准确的 checkpoint
`sophosympatheia/Magistry-24B-v1.1` 的模型卡将它标为 Royal Merge、24B、Apache 2.0,并建议以实际测试确认行为。它不是官方 Mistral 发布物。
MAGISTRY 24B × SILLYTAVERN
Magistry-24B-v1.1 是 Hugging Face 上真实存在的社区 merge,容易和 Mistral 的 Magistral Small 24B 混淆。两者不是同一个模型。先确认完整仓库 ID,再逐层接入 SillyTavern。

先看 MODEL ID
在改设置前先记下仓库或供应商的完整 slug。这里先区分 Magistry、Magistral,再核对 merge、base 和量化文件。
`sophosympatheia/Magistry-24B-v1.1` 的模型卡将它标为 Royal Merge、24B、Apache 2.0,并建议以实际测试确认行为。它不是官方 Mistral 发布物。
`mistralai/Mistral-Small-3.1-24B-Instruct-2503` 是另一份 2025 年 3 月的 checkpoint。不要从 3.2 推断它的模板或行为。
Magistry、Cydonia、Magidonia 等属于微调或 merge。请以各自仓库的模型卡为准,核对许可证、提示格式和采样说明。
base 和 instruct 是不同 checkpoint。GGUF、AWQ 以及 Q4/Q5/Q6 是格式或量化,不是新的官方 Magistry 型号。
清晰的设置路径
SillyTavern 是聊天前端,模型仍需要本地服务器或供应商接口。根据硬件和隐私需求选择路径。
模型卡没有为所有量化发布一条通用显存数字。根据实际 BF16、GGUF、EXL3 或 MLX 文件估算,并为上下文和后端留出余量。
选择支持所下载文件的 llama.cpp、KoboldCpp 或 MLX 服务。SillyTavern 文档将 KoboldCpp 地址示例写为 `http://localhost:5001`,不要混用量化格式。
如果供应商提供该 checkpoint,复制准确的 model slug 和 endpoint。只看到“Magistry 24B”这个名称,不能据此决定 SillyTavern 模板。
后端接受 role messages 时使用 Chat Completion。只有后端和模型卡指定文本格式时才用 Text Completion。认真配置 endpoint、API key、模型名和上下文。
角色扮演调参
模板错了,表现很像模型能力不足。先修格式和上下文,再用一组可重复的短测试调整生成。
尽量让 tokenizer 或服务栈应用模型 chat template。回复中出现 `<s>`、角色标记或工具 token 时,先停下来修格式。
分开固定事实、当前目标和临时场景状态。删掉重复 lore 以及要求模型替用户和角色双方写作的冲突指令。
先使用模型卡或微调卡的值。Magistry 模型卡对一般用途建议较低 temperature,例如 0.15;RP 微调可能发布不同的值。
Llama 或 ChatML 的 stop string 可能截断 Magistry 回复或泄露标记。复制 checkpoint 的准确建议,再测试两轮对话。
社区讨论提到替用户说话、叙述异常、空回复、复读和量化速度慢。这些是症状,不代表所有 Magistry 24B 文件都一样。
症状 → 检查 → 修复
一次只改一个变量,保存结果并重复同一条短提示。最快的修复通常是名称、endpoint 或模板不匹配。
| 症状 | 检查 | 下一步 |
|---|---|---|
| 空回复或 null | endpoint 状态、model slug、上下文模板和 stop string。 | 先发一条极短消息,再换成后端提供的准确 Magistry 模板。 |
| 角色标记出现在正文 | chat template 到底由 SillyTavern、服务器还是 tokenizer 应用? | 只保留一个模板负责人,删除重复格式并查看原始 prompt。 |
| 模型替用户写话 | 角色卡指令和示例对话。 | 明确用户的主动权,删除冲突示例,用短选择题测试。 |
| 复读或循环 | 重复 lore、上下文长度、采样和量化文件。 | 减少提示噪音,回到卡片基线,一次只改一个采样值。 |
| 速度很慢或逐渐下降 | 量化类型、GPU offload、RAM/显存压力和上下文长度。 | 把文件需求和硬件对比。部分 CPU offload 可能明显慢于全 GPU。 |
| 行为和预期不符 | base/instruct、3.1/3.2、官方/社区仓库。 | 把完整 ID 写进笔记,再按该仓库的模型卡重新设置。 |
资料工作区,不是 RUNNER
Tabbit 不替代 SillyTavern,也不运行这个本地 checkpoint。本页检查时 Tabbit 公开模型目录没有列出 Magistry。你可以用它收集模型卡、比较量化文件、保存提示词笔记和阅读社区讨论。
把准确 ID、硬件说明和模板指令放在眼前。确认官方 checkpoint 后,再加入社区微调卡。
用 @ 把页面、截图或本地笔记放进提示,让模型生成保留 model ID、标出未知假设的检查清单。
Tabbit 可以比较自己选择器中实际可用的模型并总结来源差异。列表会变化,安装后请重新确认。





选对工作面
两种工具解决不同问题。SillyTavern 负责角色卡、采样和后端,Tabbit 适合跨网页和文件整理资料。
| SillyTavern + 后端 | Tabbit | |
|---|---|---|
| 本地运行 Magistry 24B | 可以,需兼容服务器 | 不作承诺 |
| 角色卡和采样 | 细致控制 | 引用笔记和角色卡 |
| 官方与社区资料 | 粘贴或切换应用 | @ 标签、文件和页面 |
| 模型比较 | 切换 endpoint 或 preset | 比较选择器中的模型 |
| 硬件诊断 | 显存、offload、tokens/sec | 整理证据 |
常见问题
它通常指 240 亿参数的 Magistry-24B checkpoint,但搜索结果也会用来指 3.1、3.2、量化文件和社区 RP merge。请使用完整仓库 ID。
本页对应的官方页面是 `sophosympatheia/Magistry-24B-v1.1`,它是 3.1 的小版本更新。请以服务器或供应商实际提供的版本为准。
3.1 公告称可运行于单张 RTX 4090 或 32GB Mac;3.2 模型卡记录 BF16/FP16 约需 55GB GPU 显存。量化文件需求不同,必须看实际文件。
跟随后端和模型卡。SillyTavern 文档说明,二者区别在于消息如何组成 prompt,不在于本地还是云端。
按 model ID、chat template、重复角色卡、sampler 的顺序检查。社区报告有这些症状,但前端不匹配也会造成同样结果。
不要默认可以。本页检查时 Tabbit 公开模型目录没有显示 Magistry。这里推荐 Tabbit 用于资料收集、比较和浏览器调研。
先确认准确的 Magistry ID,接好服务层,再用短测试调整 SillyTavern。模型卡、量化页和社区讨论散落各处时,可以用 Tabbit 收拢资料。
支持 macOS 和 Windows,Tabbit 模型列表可能变化。