MISTRAL 24B × SILLYTAVERN

先把 24B 的基礎設定做好

「Mistral 24B」可能指 Mistral Small 3.2、較早的 3.1,或 Magistry 這類社群 RP merge。這些檔案不共用預設模板和取樣值。先確認型號,再逐層接入 SillyTavern。

查看官方 3.2 模型卡
Tabbit 桌面瀏覽器顯示多個研究分頁、輸入框和 AI 側邊欄。

先看 MODEL ID

24B 是規模,不是型號名稱

修改設定前先記下儲存庫或供應商的完整 slug,避免把 3.2 模板套到 3.1 檔案,也不會把社群 merge 當成官方 checkpoint。

01

官方 3.2 instruct

`mistralai/Mistral-Small-3.2-24B-Instruct-2506` 是 3.1 的小版本更新,官方模型卡提到指令遵循、覆誦和 function calling 有改善。

02

上一代官方版本

`mistralai/Mistral-Small-3.1-24B-Instruct-2503` 是另一個 2025 年 3 月的 checkpoint,不要從 3.2 推測它的模板或行為。

03

社群 RP 檔案

Magistry、Cydonia、Magidonia 等是微調或 merge,請以各自模型卡的授權、提示格式和取樣說明為準。

04

base、instruct 與量化

base 和 instruct 是不同 checkpoint。GGUF、AWQ 與 Q4/Q5/Q6 是格式或量化,不是新的官方 Mistral 型號。

清楚的設定路徑

先選服務層,再接 SillyTavern

SillyTavern 是聊天前端,模型仍需要本機伺服器或供應商端點。依硬體和隱私需求選擇路徑。

01

本機 GPU 或 Mac

官方 3.2 模型卡記錄 BF16/FP16 約需 55GB GPU 記憶體。較小的 GGUF 量化會用速度和品質換記憶體,先看檔案大小和上下文限制。

02

vLLM 伺服器

Mistral 建議 vLLM 0.9.1 以上與 `mistral_common` 1.6.2 以上,依模型卡使用 Mistral tokenizer、config、load 格式和準確 ID。

03

供應商或 OpenAI 相容 API

供應商若提供該 checkpoint,請複製準確的 model slug 和 endpoint。只看到「Mistral 24B」不足以決定 SillyTavern 模板。

04

連接 SillyTavern

後端接受 role messages 時使用 Chat Completion。只有後端和模型卡指定文字格式時才使用 Text Completion,並仔細設定 endpoint、API key、模型名稱和上下文。

角色扮演調校

先修模板,再調取樣

模板錯誤會看起來像模型能力不足。先修格式與上下文,再用可重複的短測試調整生成。

01

使用後端的 Mistral 格式

盡量讓 tokenizer 或服務堆疊套用模型 chat template。回覆出現 `<s>`、角色標記或工具 token 時,先修格式。

02

角色卡保持精簡

分開固定事實、目前目標和臨時場景狀態,刪除重複 lore 及要求模型替使用者寫作的衝突指令。

03

記錄取樣基線

先用模型卡或微調卡的數值。官方 3.2 卡對一般用途建議較低 temperature,例如 0.15;RP 微調可能有不同建議。

04

停止字串依型號處理

Llama 或 ChatML 的 stop string 可能截斷 Mistral 回覆或露出標記,請使用 checkpoint 的準確建議並測試兩輪對話。

社群討論提到替使用者說話、敘述異常、空回覆、覆誦和量化速度慢。這些是症狀,不代表所有 Mistral 24B 檔案都一樣。

症狀 → 檢查 → 修復

找到真正出錯的那一層

一次只改一個變數,保存結果並重跑同一條短提示。最快的修復通常是名稱、endpoint 或模板不匹配。

症狀檢查下一步
空回覆或 nullendpoint 狀態、model slug、上下文模板和 stop string。先發一條短訊息,再換成後端提供的準確 Mistral 模板。
角色標記出現在正文chat template 由 SillyTavern、伺服器還是 tokenizer 套用?只保留一個模板負責者,刪除重複格式並查看原始 prompt。
模型替使用者寫話角色卡指令和示例對話。說清楚使用者主動權,刪除衝突示例,以短選擇題測試。
覆誦或循環重複 lore、上下文長度、取樣和量化檔案。減少提示噪音,回到卡片基線,一次只改一個取樣值。
速度很慢或逐漸下降量化類型、GPU offload、RAM/顯存壓力和上下文長度。將檔案需求與硬體比較,部分 CPU offload 可能明顯慢於全 GPU。
行為和預期不同base/instruct、3.1/3.2、官方/社群儲存庫。把完整 ID 寫入筆記,再依該儲存庫的模型卡重新設定。

資料工作區,不是 RUNNER

把模型卡放在聊天旁邊

Tabbit 不取代 SillyTavern,也不執行這個本機 checkpoint。本頁檢查時 Tabbit 公開模型目錄沒有列出 Mistral。你可以用它收集模型卡、比較量化檔、保存提示筆記和閱讀社群討論。

  1. 1

    開啟官方模型卡和量化頁

    把準確 ID、硬體說明和模板指令放在眼前,確認官方 checkpoint 後再加入社群微調卡。

  2. 2

    用 @ 引用分頁和檔案

    用 @ 把頁面、截圖或本地筆記帶進提示,讓模型產生保留 model ID、標出未知假設的檢查清單。

  3. 3

    只比較目前清單

    Tabbit 可以比較選擇器中實際可用的模型並整理來源差異。清單會變動,安裝後請重新確認。

Tabbit Deep Research 頁面在 Google 結果旁顯示執行步驟。
Tabbit 模型選擇器顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6;截圖中沒有 Mistral。
Tabbit 多模型聊天介面展示多個模型對同一提示的回答。
Tabbit 瀏覽器在來源文章旁顯示 AI 摘要面板。
Tabbit 桌面瀏覽器顯示垂直分頁、輸入框和用於資料研究的 AI 側邊欄。

選對工作面

本地 RP 控制,還是瀏覽器上下文?

兩種工具解決不同問題。SillyTavern 負責角色卡、取樣和後端,Tabbit 適合跨網頁和檔案整理資料。

SillyTavern + 後端Tabbit
本機執行 Mistral 24B可以,需要相容伺服器不作承諾
角色卡和取樣細緻控制引用筆記和角色卡
官方與社群資料貼上或切換應用程式@ 分頁、檔案和頁面
模型比較切換 endpoint 或 preset比較選擇器中的模型
硬體診斷顯存、offload、tokens/sec整理證據

常見問題

Mistral 24B 與 SillyTavern 問題

Mistral 24B 是什麼?+

通常指 240 億參數的 Mistral Small checkpoint,但搜尋結果也可能指 3.1、3.2、量化檔案和社群 RP merge,請使用完整儲存庫 ID。

官方型號該選哪個?+

本頁對應的官方頁面是 `mistralai/Mistral-Small-3.2-24B-Instruct-2506`,它是 3.1 的小版本更新,請以伺服器或供應商實際提供的版本為準。

官方模型能放進一張顯卡嗎?+

3.1 公告稱可在單張 RTX 4090 或 32GB Mac 執行;3.2 模型卡記錄 BF16/FP16 約需 55GB GPU 記憶體。量化檔案需求不同,必須查看實際檔案。

應該用 Chat Completion 還是 Text Completion?+

依後端和模型卡決定。SillyTavern 文件說明,差異在於訊息如何組成 prompt,不在於本地或雲端。

為什麼會覆誦或替使用者說話?+

依序檢查 model ID、chat template、重複角色卡和 sampler。社群回報有這些症狀,但前端不匹配也會造成相同結果。

Tabbit 能執行 Mistral 24B 嗎?+

不要預設可以。本頁檢查時 Tabbit 公開模型目錄沒有顯示 Mistral,這裡推薦 Tabbit 用於資料收集、比較和瀏覽器研究。

把 checkpoint、模板和證據放在一起

先確認準確的 Mistral ID,接好服務層,再用短測試調整 SillyTavern。模型卡、量化頁和社群討論散落各處時,用 Tabbit 收攏資料。

支援 macOS 和 Windows,Tabbit 模型清單可能變動。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生瀏覽器。