MISTRAL 24B PRESET

先弄清 preset 做了哪些假設

Mistral 24B preset 可能包含模型名稱、作者說明、聊天模板、系統提示詞與採樣值。來源、版本或量化不同,就可能出現空回覆、角色標記外露、循環,甚至代替使用者說話。匯入前逐層核對。

開啟 3.2 模型卡
Tabbit 瀏覽器把搜尋頁面與執行步驟面板並排顯示。

先看 MODEL ID

24B 是規模,不是型號名稱

修改設定前先記下儲存庫或供應商的完整 slug,避免把 3.2 模板套到 3.1 檔案,也不會把社群 merge 當成官方 checkpoint。

01

官方 3.2 instruct

`mistralai/Mistral-Small-3.2-24B-Instruct-2506` 是 3.1 的小版本更新,官方模型卡提到指令遵循、覆誦和 function calling 有改善。

02

上一代官方版本

`mistralai/Mistral-Small-3.1-24B-Instruct-2503` 是另一個 2025 年 3 月的 checkpoint,不要從 3.2 推測它的模板或行為。

03

社群 RP 檔案

Magistry、Cydonia、Magidonia 等是微調或 merge,請以各自模型卡的授權、提示格式和取樣說明為準。

04

base、instruct 與量化

base 和 instruct 是不同 checkpoint。GGUF、AWQ 與 Q4/Q5/Q6 是格式或量化,不是新的官方 Mistral 型號。

清楚的設定路徑

先選服務層,再接 SillyTavern

SillyTavern 是聊天前端,模型仍需要本機伺服器或供應商端點。依硬體和隱私需求選擇路徑。

01

本機 GPU 或 Mac

官方 3.2 模型卡記錄 BF16/FP16 約需 55GB GPU 記憶體。較小的 GGUF 量化會用速度和品質換記憶體,先看檔案大小和上下文限制。

02

vLLM 伺服器

Mistral 建議 vLLM 0.9.1 以上與 `mistral_common` 1.6.2 以上,依模型卡使用 Mistral tokenizer、config、load 格式和準確 ID。

03

供應商或 OpenAI 相容 API

供應商若提供該 checkpoint,請複製準確的 model slug 和 endpoint。只看到「Mistral 24B」不足以決定 SillyTavern 模板。

04

連接 SillyTavern

後端接受 role messages 時使用 Chat Completion。只有後端和模型卡指定文字格式時才使用 Text Completion,並仔細設定 endpoint、API key、模型名稱和上下文。

角色扮演調校

先修模板,再調取樣

模板錯誤會看起來像模型能力不足。先修格式與上下文,再用可重複的短測試調整生成。

01

使用後端的 Mistral 格式

盡量讓 tokenizer 或服務堆疊套用模型 chat template。回覆出現 `<s>`、角色標記或工具 token 時,先修格式。

02

角色卡保持精簡

分開固定事實、目前目標和臨時場景狀態,刪除重複 lore 及要求模型替使用者寫作的衝突指令。

03

記錄取樣基線

先用模型卡或微調卡的數值。官方 3.2 卡對一般用途建議較低 temperature,例如 0.15;RP 微調可能有不同建議。

04

停止字串依型號處理

Llama 或 ChatML 的 stop string 可能截斷 Mistral 回覆或露出標記,請使用 checkpoint 的準確建議並測試兩輪對話。

社群討論提到替使用者說話、敘述異常、空回覆、覆誦和量化速度慢。這些是症狀,不代表所有 Mistral 24B 檔案都一樣。

症狀 → 檢查 → 修復

找到真正出錯的那一層

一次只改一個變數,保存結果並重跑同一條短提示。最快的修復通常是名稱、endpoint 或模板不匹配。

症狀檢查下一步
空回覆或 nullendpoint 狀態、model slug、上下文模板和 stop string。先發一條短訊息,再換成後端提供的準確 Mistral 模板。
角色標記出現在正文chat template 由 SillyTavern、伺服器還是 tokenizer 套用?只保留一個模板負責者,刪除重複格式並查看原始 prompt。
模型替使用者寫話角色卡指令和示例對話。說清楚使用者主動權,刪除衝突示例,以短選擇題測試。
覆誦或循環重複 lore、上下文長度、取樣和量化檔案。減少提示噪音,回到卡片基線,一次只改一個取樣值。
速度很慢或逐漸下降量化類型、GPU offload、RAM/顯存壓力和上下文長度。將檔案需求與硬體比較,部分 CPU offload 可能明顯慢於全 GPU。
行為和預期不同base/instruct、3.1/3.2、官方/社群儲存庫。把完整 ID 寫入筆記,再依該儲存庫的模型卡重新設定。

資料工作區,不是 RUNNER

把模型卡放在聊天旁邊

Tabbit 不取代 SillyTavern,也不執行這個本機 checkpoint。本頁檢查時 Tabbit 公開模型目錄沒有列出 Mistral。你可以用它收集模型卡、比較量化檔、保存提示筆記和閱讀社群討論。

  1. 1

    開啟官方模型卡和量化頁

    把準確 ID、硬體說明和模板指令放在眼前,確認官方 checkpoint 後再加入社群微調卡。

  2. 2

    用 @ 引用分頁和檔案

    用 @ 把頁面、截圖或本地筆記帶進提示,讓模型產生保留 model ID、標出未知假設的檢查清單。

  3. 3

    只比較目前清單

    Tabbit 可以比較選擇器中實際可用的模型並整理來源差異。清單會變動,安裝後請重新確認。

Tabbit Deep Research 頁面在 Google 結果旁顯示執行步驟。
Tabbit 模型選擇器顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6;截圖中沒有 Mistral。
Tabbit 多模型聊天介面展示多個模型對同一提示的回答。
Tabbit 瀏覽器在來源文章旁顯示 AI 摘要面板。

選對工作面

本地 RP 控制,還是瀏覽器上下文?

兩種工具解決不同問題。SillyTavern 負責角色卡、取樣和後端,Tabbit 適合跨網頁和檔案整理資料。

SillyTavern + 後端Tabbit
本機執行 Mistral 24B可以,需要相容伺服器不作承諾
角色卡和取樣細緻控制引用筆記和角色卡
官方與社群資料貼上或切換應用程式@ 分頁、檔案和頁面
模型比較切換 endpoint 或 preset比較選擇器中的模型
硬體診斷顯存、offload、tokens/sec整理證據

常見問題

Mistral 24B 與 SillyTavern 問題

Mistral 24B 是什麼?+

通常指 240 億參數的 Mistral Small checkpoint,但搜尋結果也可能指 3.1、3.2、量化檔案和社群 RP merge,請使用完整儲存庫 ID。

官方型號該選哪個?+

本頁對應的官方頁面是 `mistralai/Mistral-Small-3.2-24B-Instruct-2506`,它是 3.1 的小版本更新,請以伺服器或供應商實際提供的版本為準。

官方模型能放進一張顯卡嗎?+

3.1 公告稱可在單張 RTX 4090 或 32GB Mac 執行;3.2 模型卡記錄 BF16/FP16 約需 55GB GPU 記憶體。量化檔案需求不同,必須查看實際檔案。

應該用 Chat Completion 還是 Text Completion?+

依後端和模型卡決定。SillyTavern 文件說明,差異在於訊息如何組成 prompt,不在於本地或雲端。

為什麼會覆誦或替使用者說話?+

依序檢查 model ID、chat template、重複角色卡和 sampler。社群回報有這些症狀,但前端不匹配也會造成相同結果。

Tabbit 能執行 Mistral 24B 嗎?+

不要預設可以。本頁檢查時 Tabbit 公開模型目錄沒有顯示 Mistral,這裡推薦 Tabbit 用於資料收集、比較和瀏覽器研究。

把 checkpoint、模板和證據放在一起

先確認準確的 Mistral ID,接好服務層,再用短測試調整 SillyTavern。模型卡、量化頁和社群討論散落各處時,用 Tabbit 收攏資料。

支援 macOS 和 Windows,Tabbit 模型清單可能變動。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生瀏覽器。