一直在思考
先看 thinking 是否開啟、推理預算是否足夠,以及 provider 是否保留 thinking block。較低的 reasoning effort 每回合可能更快,但長任務也可能增加重試。
QWEN 3.8 + SILLYTAVERN
回覆循環、思考太久、忘記角色事實,或生成到一半停住時,採樣器只是其中一個可能原因。先查連接和聊天模板,再一次只改一個變數,用同一段短測試重測。
以下數值是文件提供的起點,不是適用於所有卡片的最佳預設。provider、後端、量化、角色卡與上下文預算都會改變 Qwen3.8-27B 的表現。

先看失敗症狀
同樣難看的回覆,可能來自錯誤端點、不相容模板、過小的上下文視窗,或限制太多的採樣器組合。先記錄改過什麼,再找預設。
先看 thinking 是否開啟、推理預算是否足夠,以及 provider 是否保留 thinking block。較低的 reasoning effort 每回合可能更快,但長任務也可能增加重試。
檢查上下文邊界和 response 分配。SillyTavern 會把角色資料、系統提示和聊天歷史放進 context,舊訊息可能只是已被排除。
一起檢查 repetition penalty、DRY、top-p、top-k 和 min-p。Qwen 為其中幾項列出中性值。一次改一個控制項。
檢查模型 ID、聊天模板、思考標籤處理和提示後處理。採樣器修不好發給另一個模型家族的請求格式。
排錯順序
準備一段可重複的短角色對話。保持角色卡、提示詞、可用 seed 和輸出長度不變,逐層檢查。
確認 provider 確實提供 Qwen3.8-27B,複製準確模型 ID,然後傳送 Test Message。Custom OpenAI-compatible endpoint 還要檢查 base URL 和是否提供 /v1/models。
使用 Qwen3.8 對應模板。官方模型卡預設開啟 thinking。要直接回答,就透過 provider 支援的欄位關閉。是否保留歷史 thinking 也要明確選擇。
讓 context 足夠容納角色卡和近期對話,同時給 response 留空間。上下文參數很大,也不代表後端或量化版本真的暴露同樣大小。
先從下表的官方模式起點開始。每次只改一個設定,對同一段短對話重生幾次並記錄可見結果,再測試下一個變數。
如果 provider 忽略某個欄位,介面中的數值不能證明模型收到了它。條件允許時查看請求或回應中繼資料。
參考表
Qwen 分別列出 Thinking Mode 和 Instruct 或 non-thinking mode 的參數。SillyTavern 文件也說明關閉多個採樣器的中性值。按目前測試模式選擇一列。
| 參數 | Thinking mode | Instruct / non-thinking | 留意什麼 |
|---|---|---|---|
| temperature | 1.0 | 0.7 | 低值較可預測,高值變化更多。 |
| top_p | 0.95 | 0.80 | 1 代表關閉 nucleus 過濾。 |
| top_k | 20 | 20 | 依後端不同,0 或 -1 代表關閉。 |
| min_p | 0.0 | 0.0 | 過高可能加重重複。 |
| presence_penalty | 0.0 | 1.5 | Qwen 說 0 到 2 可減少無止境重複。 |
| repetition_penalty | 1.0 | 1.0 | 1 代表關閉效果。 |
| reasoning_effort | xhigh | 不適用 | Qwen 列出 xhigh、medium、low。 |
| preserve_thinking | true | true | 只想保留最新思考時關閉。 |
這些是 Qwen 模型卡的起點。不同框架和 provider 支援的採樣參數不同,不能保證每張角色卡都有更好的 RP 效果。
看起來像採樣問題的邊界情況
把它們當成獨立實驗。社群預設可能把真正的變化來源藏起來。
SillyTavern 將 context 定義為扣除 response 分配後的提示預算。response 越長,生成越慢,也會給角色卡和歷史留下更少空間。Qwen3.8-27B 原生支援 262,144 token,但後端、顯存和量化可能降低實際限制。
官方模型卡說明支援圖片和影片理解。如果連接器沒有按後端要求傳遞媒體,問題在整合層,不在 temperature。
BF16、FP8 和低 bit 版本用不同方式換取顯存和數值精度。先在相同後端、相同提示、context 和 sampler 下比較,再判斷是不是預設問題。
repetition_penalty 1 是中性值。range 和 slope 過高會懲罰常用詞。DRY 針對重複序列,multiplier 0 代表關閉。只有可重複地循環時,才增加一個限制項。
另一條上下文路徑
需要角色卡和 lorebook 時,SillyTavern 仍然合適。提示來自網頁、PDF、截圖或研究過程時,Tabbit 更順手。打開來源,在模型選擇器裡選模型,讓上下文一直留在眼前。
使用 macOS 或 Windows 桌面版,在主畫面保留 wiki、提示詞指南或文件。

在新分頁輸入框或側邊聊天打開 Tabbit 模型選擇器。可用清單會隨產品變化,不要假設所有本地 Qwen3.8 權重都能用。

輸入 @ 引用分頁、截圖或檔案。資料不離開視線,就能讓模型列場景、改寫卡片或做比較。

輸入 @ 引用分頁、截圖或檔案。資料不離開視線,就能讓模型列場景、改寫卡片或做比較。

常見問題
Thinking Mode 是 temperature 1.0、top_p 0.95、top_k 20、min_p 0.0、presence_penalty 0.0、repetition_penalty 1.0。Instruct 或 non-thinking mode 是 0.7、0.80、20、0.0、1.5、1.0。
把它當比較對象,不要當保證。社群片段常混用模型版本和後端。記錄它的欄位,再用官方模式起點一次改一個變數。
官方模型卡預設開啟 thinking。先查連接器的聊天模板欄位、思考標籤和 provider 支援,再改 sampler。關閉時只使用後端文件寫明的欄位。
先給角色卡、系統提示和近期對話留夠空間,再預留 response。模型卡寫的是原生 262,144 token,實際後端可能更小。
先用 repetition_penalty 1 和 DRY multiplier 0。它們分別是中性值或關閉值。只有同一段測試仍然循環時,才加一個控制項。
本頁不作這個承諾。Tabbit 提供瀏覽器模型選擇器和上下文工具。請以目前選擇器為準,需要本地權重時繼續使用 SillyTavern 和本地後端。
先用官方模式起點,一次改一個變數,並讓來源保持可見。任務從網頁或文件開始時,在 Tabbit 打開它,走瀏覽器上下文路徑。
支援 macOS 和 Windows。模型可用性會隨產品更新變化。