MISTRAL 24B × SILLYTAVERN

先把 24B 的基础设置做对

“Mistral 24B”可能指 Mistral Small 3.2、较早的 3.1,或 Magistry 这样的社区 RP merge。这些文件不共用默认模板和采样值。先确认准确型号,再逐层接入 SillyTavern。

查看官方 3.2 模型卡
Tabbit 桌面浏览器显示多个研究标签、输入框和 AI 侧边栏。

先看 MODEL ID

24B 是规模,不是型号名

在改设置前先记下仓库或供应商的完整 slug。这样可以避免把 3.2 模板套到 3.1 文件上,也不会把社区 merge 当成官方 checkpoint。

01

官方 3.2 instruct

`mistralai/Mistral-Small-3.2-24B-Instruct-2506` 是 3.1 的后续小版本更新。官方模型卡提到指令遵循、复读和 function calling 有改进。

02

上一代官方版本

`mistralai/Mistral-Small-3.1-24B-Instruct-2503` 是另一份 2025 年 3 月的 checkpoint。不要从 3.2 推断它的模板或行为。

03

社区 RP 文件

Magistry、Cydonia、Magidonia 等属于微调或 merge。请以各自仓库的模型卡为准,核对许可证、提示格式和采样说明。

04

base、instruct 与量化

base 和 instruct 是不同 checkpoint。GGUF、AWQ 以及 Q4/Q5/Q6 是格式或量化,不是新的官方 Mistral 型号。

清晰的设置路径

先选服务层,再接 SillyTavern

SillyTavern 是聊天前端,模型仍需要本地服务器或供应商接口。根据硬件和隐私需求选择路径。

01

本地 GPU 或 Mac

官方 3.2 模型卡为 BF16/FP16 记录了约 55GB GPU 显存需求。较小的 GGUF 量化会用速度和质量换内存,先看量化发布者的文件大小和上下文限制。

02

vLLM 服务

Mistral 推荐 vLLM 0.9.1 或更新版本,并使用 `mistral_common` 1.6.2 或更新版本。按模型卡使用 Mistral tokenizer、config、load 格式和准确仓库 ID。

03

供应商或 OpenAI 兼容 API

如果供应商提供该 checkpoint,复制准确的 model slug 和 endpoint。只看到“Mistral 24B”这个名称,不能据此决定 SillyTavern 模板。

04

连接 SillyTavern

后端接受 role messages 时使用 Chat Completion。只有后端和模型卡指定文本格式时才用 Text Completion。认真配置 endpoint、API key、模型名和上下文。

角色扮演调参

先修模板,再动采样

模板错了,表现很像模型能力不足。先修格式和上下文,再用一组可重复的短测试调整生成。

01

使用后端的 Mistral 格式

尽量让 tokenizer 或服务栈应用模型 chat template。回复中出现 `<s>`、角色标记或工具 token 时,先停下来修格式。

02

角色卡保持紧凑

分开固定事实、当前目标和临时场景状态。删掉重复 lore 以及要求模型替用户和角色双方写作的冲突指令。

03

记录一组基线

先使用模型卡或微调卡的值。官方 3.2 卡对一般用途建议较低 temperature,例如 0.15;RP 微调可能发布不同的值。

04

停止字符串按型号处理

Llama 或 ChatML 的 stop string 可能截断 Mistral 回复或泄露标记。复制 checkpoint 的准确建议,再测试两轮对话。

社区讨论提到替用户说话、叙述异常、空回复、复读和量化速度慢。这些是症状,不代表所有 Mistral 24B 文件都一样。

症状 → 检查 → 修复

找到真正出问题的那一层

一次只改一个变量,保存结果并重复同一条短提示。最快的修复通常是名称、endpoint 或模板不匹配。

症状检查下一步
空回复或 nullendpoint 状态、model slug、上下文模板和 stop string。先发一条极短消息,再换成后端提供的准确 Mistral 模板。
角色标记出现在正文chat template 到底由 SillyTavern、服务器还是 tokenizer 应用?只保留一个模板负责人,删除重复格式并查看原始 prompt。
模型替用户写话角色卡指令和示例对话。明确用户的主动权,删除冲突示例,用短选择题测试。
复读或循环重复 lore、上下文长度、采样和量化文件。减少提示噪音,回到卡片基线,一次只改一个采样值。
速度很慢或逐渐下降量化类型、GPU offload、RAM/显存压力和上下文长度。把文件需求和硬件对比。部分 CPU offload 可能明显慢于全 GPU。
行为和预期不符base/instruct、3.1/3.2、官方/社区仓库。把完整 ID 写进笔记,再按该仓库的模型卡重新设置。

资料工作区,不是 RUNNER

把模型卡放在聊天旁边

Tabbit 不替代 SillyTavern,也不运行这个本地 checkpoint。本页检查时 Tabbit 公开模型目录没有列出 Mistral。你可以用它收集模型卡、比较量化文件、保存提示词笔记和阅读社区讨论。

  1. 1

    打开官方模型卡和量化页

    把准确 ID、硬件说明和模板指令放在眼前。确认官方 checkpoint 后,再加入社区微调卡。

  2. 2

    用 @ 引用标签和文件

    用 @ 把页面、截图或本地笔记放进提示,让模型生成保留 model ID、标出未知假设的检查清单。

  3. 3

    只比较当前列表

    Tabbit 可以比较自己选择器中实际可用的模型并总结来源差异。列表会变化,安装后请重新确认。

Tabbit Deep Research 页面,在 Google 结果旁显示执行步骤。
Tabbit 模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6;截图中没有 Mistral。
Tabbit 多模型聊天界面展示多个模型对同一提示的回答。
Tabbit 浏览器在来源文章旁显示 AI 摘要面板。
Tabbit 桌面浏览器显示垂直标签、输入框和用于资料调研的 AI 侧边栏。

选对工作面

本地 RP 控制,还是浏览器上下文?

两种工具解决不同问题。SillyTavern 负责角色卡、采样和后端,Tabbit 适合跨网页和文件整理资料。

SillyTavern + 后端Tabbit
本地运行 Mistral 24B可以,需兼容服务器不作承诺
角色卡和采样细致控制引用笔记和角色卡
官方与社区资料粘贴或切换应用@ 标签、文件和页面
模型比较切换 endpoint 或 preset比较选择器中的模型
硬件诊断显存、offload、tokens/sec整理证据

常见问题

Mistral 24B 与 SillyTavern 问题

Mistral 24B 是什么?+

它通常指 240 亿参数的 Mistral Small checkpoint,但搜索结果也会用来指 3.1、3.2、量化文件和社区 RP merge。请使用完整仓库 ID。

官方型号该选哪个?+

本页对应的官方页面是 `mistralai/Mistral-Small-3.2-24B-Instruct-2506`,它是 3.1 的小版本更新。请以服务器或供应商实际提供的版本为准。

官方模型能放进一张显卡吗?+

3.1 公告称可运行于单张 RTX 4090 或 32GB Mac;3.2 模型卡记录 BF16/FP16 约需 55GB GPU 显存。量化文件需求不同,必须看实际文件。

该用 Chat Completion 还是 Text Completion?+

跟随后端和模型卡。SillyTavern 文档说明,二者区别在于消息如何组成 prompt,不在于本地还是云端。

为什么会复读或替用户说话?+

按 model ID、chat template、重复角色卡、sampler 的顺序检查。社区报告有这些症状,但前端不匹配也会造成同样结果。

Tabbit 能运行 Mistral 24B 吗?+

不要默认可以。本页检查时 Tabbit 公开模型目录没有显示 Mistral。这里推荐 Tabbit 用于资料收集、比较和浏览器调研。

把 checkpoint、模板和证据放在一起

先确认准确的 Mistral ID,接好服务层,再用短测试调整 SillyTavern。模型卡、量化页和社区讨论散落各处时,可以用 Tabbit 收拢资料。

支持 macOS 和 Windows,Tabbit 模型列表可能变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。