官方 dense 檢查點
Qwen 模型卡的儲存庫名稱是 Qwen/Qwen3.8-27B,列出 27B 參數、視覺編碼器、Apache-2.0 授權和原生 262144 token 上下文。
Qwen3.8-27B · SillyTavern 實用指南
這個名稱確實存在,但很容易和其他模型混在一起。Qwen 發布了官方 Qwen3.8-27B dense 視覺語言檢查點。Qwen3.8-Max 是另一位成員,總參數 2.4T、啟用參數 95B。先確認手上的檢查點與提供商,再調整 RP 預設。
本指南把上游事實和社群回饋分開,不承諾特定提供商、量化檔案或每個 Tabbit 帳號都能使用。

先核對名稱
搜尋結果會把幾個名稱放在一起。它們指向不同檔案,複製一個名稱就可能把本地設定帶到錯誤路徑。
Qwen 模型卡的儲存庫名稱是 Qwen/Qwen3.8-27B,列出 27B 參數、視覺編碼器、Apache-2.0 授權和原生 262144 token 上下文。
Qwen 發布說明及相關開源命名把 Qwen3.8-Max 寫成總參數 2.4T、啟用參數 95B。其開源權重名為 Qwen3.8-2.4T-A95B,不是 27B 別名。
GGUF、FP8、GPTQ 和 RP 微調可能增加後綴或作者名。每個儲存庫都是獨立產物,要閱讀量化格式和模板說明。
SillyTavern 需要提供商實際公開的準確模型 ID。友善的顯示名稱不能證明路由提供 Qwen3.8-27B。
模型卡
用這些事實選擇執行環境。它們描述上游檢查點,不是所有量化檔案的顯存需求。
模型卡把 dense 語言模型列為 27B 參數,同時顯示 safetensors 模型大小標籤為 28B。不要把下載標籤當成新的模型名稱。
模型卡標為 image-text-to-text,並說明支援圖像與影片理解。後端仍需具備對應處理器和多模態支援。
原生上下文是 262144 token,模型卡描述可擴展至 1M。長上下文不代表消費級顯示卡能載入所有設定。
模型卡給出 Transformers、vLLM、SGLang、TokenSpeed 和 Docker 範例。請選擇明確支援該架構的目前版本。

SillyTavern 設定
角色卡無法修復錯誤路由或重複套用的模板。無論使用託管 API 或本地服務,都按這個順序檢查。
提供商標籤、社群預設和量化儲存庫不屬於上游模型卡。引用時要把說法和來源綁在一起。
複製準確的儲存庫名稱或提供商模型 ID。確認拿到的是 Qwen/Qwen3.8-27B、量化衍生檔,還是另一個 Qwen3.8-2.4T-A95B 家族成員。
本地執行時確認 Transformers、vLLM、SGLang、llama.cpp 或所用應用支援該檢查點和視覺路徑。GGUF 檔案不一定暴露全部多模態能力。
OpenAI 相容服務選擇 Chat Completions,填入文件規定的 Base URL,並複製服務回傳的 model ID。Key 不要放進角色卡。
讓託管路由負責序列化,或使用本地 tokenizer 的文件模板。兩邊都套會造成角色錯位、標籤洩漏或回覆過短。
若提供商公開這些控制項,用同一張角色卡依次測試關閉或 low、medium、xhigh。先記錄延遲和劇情推進,再改文風預設。
快速診斷
固定角色卡和開場訊息,一次只改一個輸入,並把回傳的 model ID 和測試記錄放在一起。
| 現象 | 先檢查 | 小修復 |
|---|---|---|
| 找不到模型或靜默回退 | 提供商模型列表和回應中的 model | 複製實際公開的 ID,刪除猜出的 qwen3.8-27b 別名。 |
| 角色、標籤或格式異常 | 聊天模板由誰負責 | 只保留一條模板路徑,然後新建對話。 |
| 顯存不足 | 權重格式、上下文和視覺輸入 | 先嘗試更小量化、較短上下文和純文字基線。 |
| 思考很久但劇情推進少 | 思考模式、輸出上限和預設長度 | 在同一張角色卡上比較 low/medium 與 xhigh。 |
| 不同提供商文風不同 | 過濾、採樣預設值和系統提示詞 | 把路由記錄為變數,不要把單一提供商結果當成模型事實。 |
RP 測試卡
排錯時使用短提示詞,模板、思考和提供商差異會更容易看出來。
Role: 你是[角色]。 Scene: [地點、關係、目前衝突]。 Style: [視角、語言、句長]。 Direction: 每輪推進一個可觀察動作。不要替使用者說話。 Continuity: 只使用已確認事實;不確定時提問。 Format: 先動作,再對話。250 到 450 字。不重述。 Check: 保持語氣、邊界和上一輪未解決的線索。
傳送同一張角色卡三次,比較延遲、意外標籤、格式遵循和場景是否變化。之後再調整溫度、上下文或社群預設。
瀏覽器路徑
SillyTavern 仍然適合角色卡和世界書。Tabbit 處理另一種難題:閱讀模型卡、比較提供商說明和對照資料時,不必反覆複製貼上。
把 Hugging Face 模型卡、提供商文件或角色 wiki 留在分頁裡,設定時隨時可以回看。
開啟 Tabbit 模型選擇器,只有當你的版本和帳號出現準確的 Qwen3.8-27B 選項時才選擇它。選擇器才是 Tabbit 可用性的來源。
用 @ 把網頁、截圖或檔案帶進問題。可以讓另一個模型提取模板要求,或把量化說明和模型卡放在一起比較。
多模型對話可以讓多個模型閱讀同一份資料。截圖證明的是瀏覽器工作流,不代表每個使用者都能獲得相同模型。

瀏覽器路徑


選擇工作面
兩者負責 RP 工作流的不同部分。需要細緻控制時保留專用工具,資料成為瓶頸時使用瀏覽器。
| 需求 | SillyTavern | Tabbit |
|---|---|---|
| 角色卡和世界書 | 專門的 RP 控件 | 引用網頁和檔案 |
| 預設和提示詞順序 | 細緻提示詞控制 | 系統提示詞和 Skills |
| 邊看文件邊 RP | 擴充功能或複製貼上 | 開啟的分頁成為上下文 |
| 比較模型回答 | 提供商設定或擴充功能 | 瀏覽器內多模型對話 |
| 第一步 | 確認 ID、後端和模板 | 開啟來源,再查看即時選擇器 |
開啟證據
下面的連結把上游規格和解釋 SillyTavern 排錯原因的社群回饋分開。
常見問題
是。Qwen/Qwen3.8-27B 有官方 Hugging Face 模型卡,是 27B dense 視覺語言檢查點。它和 Qwen3.8-Max 以及 Qwen3.8-2.4T-A95B 分開。
不等於。Qwen3.8-Max 被描述為總參數 2.4T、啟用參數 95B。想測試 27B dense 模型時,不要填入 Max 的提供商 ID,也不要下載 2.4T 量化檔案。
沒有脫離顯示卡、記憶體、上下文目標和後端的統一答案。先選擇明確寫出格式和載入器支援的儲存庫,把 GGUF、FP8、GPTQ 和微調名稱視為不同產物。
託管提供商通常負責序列化。本地服務應使用 tokenizer 或檢查點文件的模板。不要在已經格式化的端點上再次套用 Qwen 模板。
分別檢查思考模式、輸出上限、上下文大小、採樣預設值和提供商路由。社群回饋不一致,先用相同角色卡記錄路由,再修改提示詞。
只有當 Tabbit 模型選擇器顯示準確的模型時才選它。可用性會隨版本、地區、帳號和推出進度變化。即使沒有該模型,也能用 Tabbit 把模型卡或角色資料放在支援的對話旁邊。
安裝 macOS 或 Windows 版 Tabbit,查看即時模型選擇器,把模型卡或角色 wiki 帶進同一個瀏覽器對話。
模型存取和提供商條款會因版本與推出進度變化。