QWEN 3.8 + SILLYTAVERN

Qwen 3.8 SillyTavern 設定

回覆循環、思考太久、忘記角色事實,或生成到一半停住時,採樣器只是其中一個可能原因。先查連接和聊天模板,再一次只改一個變數,用同一段短測試重測。

跳到排錯流程

以下數值是文件提供的起點,不是適用於所有卡片的最佳預設。provider、後端、量化、角色卡與上下文預算都會改變 Qwen3.8-27B 的表現。

Tabbit 新分頁輸入框,顯示 @ 引用入口和模型選擇器。

先看失敗症狀

症狀指向某一層,不會自動告訴你神奇數字

同樣難看的回覆,可能來自錯誤端點、不相容模板、過小的上下文視窗,或限制太多的採樣器組合。先記錄改過什麼,再找預設。

01

一直在思考

先看 thinking 是否開啟、推理預算是否足夠,以及 provider 是否保留 thinking block。較低的 reasoning effort 每回合可能更快,但長任務也可能增加重試。

02

忘記角色卡

檢查上下文邊界和 response 分配。SillyTavern 會把角色資料、系統提示和聊天歷史放進 context,舊訊息可能只是已被排除。

03

循環或變平

一起檢查 repetition penalty、DRY、top-p、top-k 和 min-p。Qwen 為其中幾項列出中性值。一次改一個控制項。

04

標籤格式壞掉

檢查模型 ID、聊天模板、思考標籤處理和提示後處理。採樣器修不好發給另一個模型家族的請求格式。

排錯順序

Provider → 模板 → context → sampler → 重測

準備一段可重複的短角色對話。保持角色卡、提示詞、可用 seed 和輸出長度不變,逐層檢查。

  1. 1

    連接和 provider

    確認 provider 確實提供 Qwen3.8-27B,複製準確模型 ID,然後傳送 Test Message。Custom OpenAI-compatible endpoint 還要檢查 base URL 和是否提供 /v1/models。

  2. 2

    聊天模板和 thinking

    使用 Qwen3.8 對應模板。官方模型卡預設開啟 thinking。要直接回答,就透過 provider 支援的欄位關閉。是否保留歷史 thinking 也要明確選擇。

  3. 3

    上下文和回應

    讓 context 足夠容納角色卡和近期對話,同時給 response 留空間。上下文參數很大,也不代表後端或量化版本真的暴露同樣大小。

  4. 4

    採樣和重測

    先從下表的官方模式起點開始。每次只改一個設定,對同一段短對話重生幾次並記錄可見結果,再測試下一個變數。

如果 provider 忽略某個欄位,介面中的數值不能證明模型收到了它。條件允許時查看請求或回應中繼資料。

參考表

把官方起點和中性值放在一起

Qwen 分別列出 Thinking Mode 和 Instruct 或 non-thinking mode 的參數。SillyTavern 文件也說明關閉多個採樣器的中性值。按目前測試模式選擇一列。

參數Thinking modeInstruct / non-thinking留意什麼
temperature1.00.7低值較可預測,高值變化更多。
top_p0.950.801 代表關閉 nucleus 過濾。
top_k2020依後端不同,0 或 -1 代表關閉。
min_p0.00.0過高可能加重重複。
presence_penalty0.01.5Qwen 說 0 到 2 可減少無止境重複。
repetition_penalty1.01.01 代表關閉效果。
reasoning_effortxhigh不適用Qwen 列出 xhigh、medium、low。
preserve_thinkingtruetrue只想保留最新思考時關閉。

這些是 Qwen 模型卡的起點。不同框架和 provider 支援的採樣參數不同,不能保證每張角色卡都有更好的 RP 效果。

看起來像採樣問題的邊界情況

視覺、量化和 DRY 都會改變基線

把它們當成獨立實驗。社群預設可能把真正的變化來源藏起來。

上下文和 response 長度

SillyTavern 將 context 定義為扣除 response 分配後的提示預算。response 越長,生成越慢,也會給角色卡和歷史留下更少空間。Qwen3.8-27B 原生支援 262,144 token,但後端、顯存和量化可能降低實際限制。

視覺輸入

官方模型卡說明支援圖片和影片理解。如果連接器沒有按後端要求傳遞媒體,問題在整合層,不在 temperature。

量化

BF16、FP8 和低 bit 版本用不同方式換取顯存和數值精度。先在相同後端、相同提示、context 和 sampler 下比較,再判斷是不是預設問題。

repetition penalty 和 DRY

repetition_penalty 1 是中性值。range 和 slope 過高會懲罰常用詞。DRY 針對重複序列,multiplier 0 代表關閉。只有可重複地循環時,才增加一個限制項。

另一條上下文路徑

來源在網頁裡,就在網頁旁使用 Qwen

需要角色卡和 lorebook 時,SillyTavern 仍然合適。提示來自網頁、PDF、截圖或研究過程時,Tabbit 更順手。打開來源,在模型選擇器裡選模型,讓上下文一直留在眼前。

打開來源

使用 macOS 或 Windows 桌面版,在主畫面保留 wiki、提示詞指南或文件。

Tabbit 顯示 Google 搜尋研究頁,右側 Deep Research 任務列出執行步驟。

選擇模型

在新分頁輸入框或側邊聊天打開 Tabbit 模型選擇器。可用清單會隨產品變化,不要假設所有本地 Qwen3.8 權重都能用。

Tabbit 主畫面打開文章,右側 AI 摘要欄顯示模型控制。

用 @ 引用

輸入 @ 引用分頁、截圖或檔案。資料不離開視線,就能讓模型列場景、改寫卡片或做比較。

Tabbit 多模型對話顯示五列並行回答和共用輸入框。

用 @ 引用

輸入 @ 引用分頁、截圖或檔案。資料不離開視線,就能讓模型列場景、改寫卡片或做比較。

Tabbit Agent 在 Google Sheets 中執行任務,右側顯示指令和步驟。

常見問題

Qwen 3.8 與 SillyTavern 設定

Qwen3.8 官方採樣值是什麼?+

Thinking Mode 是 temperature 1.0、top_p 0.95、top_k 20、min_p 0.0、presence_penalty 0.0、repetition_penalty 1.0。Instruct 或 non-thinking mode 是 0.7、0.80、20、0.0、1.5、1.0。

應該直接用社群預設嗎?+

把它當比較對象,不要當保證。社群片段常混用模型版本和後端。記錄它的欄位,再用官方模式起點一次改一個變數。

為什麼 Qwen3.8 在 SillyTavern 裡一直思考?+

官方模型卡預設開啟 thinking。先查連接器的聊天模板欄位、思考標籤和 provider 支援,再改 sampler。關閉時只使用後端文件寫明的欄位。

context 應該設多大?+

先給角色卡、系統提示和近期對話留夠空間,再預留 response。模型卡寫的是原生 262,144 token,實際後端可能更小。

要不要開 repetition penalty 或 DRY?+

先用 repetition_penalty 1 和 DRY multiplier 0。它們分別是中性值或關閉值。只有同一段測試仍然循環時,才加一個控制項。

Tabbit 能執行我本地的 Qwen3.8-27B 嗎?+

本頁不作這個承諾。Tabbit 提供瀏覽器模型選擇器和上下文工具。請以目前選擇器為準,需要本地權重時繼續使用 SillyTavern 和本地後端。

保留你能解釋的設定

先用官方模式起點,一次改一個變數,並讓來源保持可見。任務從網頁或文件開始時,在 Tabbit 打開它,走瀏覽器上下文路徑。

支援 macOS 和 Windows。模型可用性會隨產品更新變化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生瀏覽器。