SKYFALL 31B × SILLYTAVERN

先找到准确的 Skyfall 文件

Skyfall 31B 这个名称对应多个版本和格式。本指南针对 TheDrummer/Skyfall-31B-v4.2。调整角色卡前,先确认完整 ID、base、Mistral v7 模板和量化。

阅读 v4.2 模型卡
Tabbit 桌面浏览器显示垂直标签、输入框和资料研究侧栏。

核对仓库 ID

31B 是规模,不是 checkpoint

把完整仓库名写进笔记,区分 v4.2、v4.1、旧版 Skyfall 和搜索结果中的同名项目。

01

本指南的模型

`TheDrummer/Skyfall-31B-v4.2` 是 safetensors 仓库。模型卡署名 TheDrummer,并列出 Mistral v7 Tekken 聊天模板。

02

Base 模型

模型元数据将 `mistralai/Magistral-Small-2509` 列为 base。不要用名字相近的 Mistral Small 版本替换它。

03

参数数量

HF API 元数据显示 BF16 参数为 31,352,980,480,架构为 Mistral,最大 position 设置为 131,072。这是元数据,不等于你的运行环境能使用同样上下文。

04

许可证

本次核对的 API 元数据没有公开 license 字段。重新分发或商业使用前,请阅读仓库模型卡和上游条款。

量化与硬件

选择机器真正装得下的文件

官方仓库很大。GGUF companion 提供多种取舍,文件大小适合做第一轮筛选,但不等于实际显存需求。

01

从 Q4_K_M 开始

GGUF tree 列出的 Q4_K_M 约 18.98 GB。还要给运行时开销、上下文和系统留空间。24 GB 显卡不一定能轻松全 GPU 加载。

02

更大量化需要余量

Q5_K_M 约 22.25 GB,Q6_K 约 25.73 GB,Q8_0 约 33.32 GB。CPU 或系统内存 offload 可能可用,但速度会明显下降。

03

小量化会换取质量

Q2_K 约 11.73 GB,Q3_K_M 约 15.20 GB。改变量化后,用同一段短场景测试,分清文件质量和提示词或采样变化。

04

只选一个服务层

GGUF 卡记录了 llama.cpp 和 Ollama 路径。下载准确文件,启动后端,再把 endpoint 和 model ID 复制进 SillyTavern。

SILLYTAVERN RP 设置

先修模板,再调采样

Skyfall v4.2 使用定制的 Mistral v7 Tekken 模板。让一个层负责格式化,再用可重复的两轮测试调输出。

01

使用 Mistral v7 Tekken

尽量让 tokenizer 或后端应用模型模板。如果 SillyTavern 也包装 prompt,检查原始 prompt 是否重复角色标记。

02

决定是否启用 thinking

模型卡模板会查找 system message 中的 `/think`,并可能加入 `[THINK]...[/THINK]`。请有意测试,不要把隐藏推理标记意外放进角色卡。

03

先记录一组基线

第一次 RP 可以从 temperature 0.7、top_p 0.9 和适中的最大回复长度开始,再一次只改一个值。这些是起点,不是 Skyfall 官方 benchmark 数值。

04

保护用户主动权

说明模型控制哪个说话者。角色卡示例保持短小,删掉要求模型同时替用户、旁白和角色写作的指令。

社区评论提到自然对话、角色一致性和语气遵循,也有人遇到回复过长、叙述不均、替用户说话或 swipe 后重复错误。这些是症状,不是受控评测。

症状 → 检查 → 修复

排查真正失败的那一层

重复同一条短提示,一次只改一个设置,这样才能把模板问题和模型、硬件问题分开。

症状检查下一步
空回复或标记泄露endpoint、Mistral 模板负责人、`/think` 开关和 stop string。发送一行短提示,只保留一个模板负责人,先清理泄露标记。
模型替 {{user}} 说话角色卡示例、system prompt 和上一条 assistant 消息。写清说话边界,缩短示例,用两选一场景测试。
回复很长且复读上下文、重复 lore、最大 token 和采样。精简角色卡,降低回复预算,再一次改一个采样值。
速度慢或崩溃量化大小、GPU offload、RAM/显存余量和上下文。换小量化或缩短上下文,每次改变后比较 tokens/sec。
行为和模型卡不符v4.2/v4.1、safetensors/GGUF 和完整 model ID。重新复制仓库 ID,按准确文件的模型卡设置。

TABBIT 资料工作台

把角色卡、量化文件和笔记放在一起

Tabbit 不运行 Skyfall,也不替代 SillyTavern。它适合处理模型卡、GGUF tree 和社区讨论分散在多个页面的情况。

  1. 1

    打开来源标签

    把官方模型卡、GGUF tree 和 SillyTavern 文档放在一起,让 Tabbit 只提取 ID、大小和模板说明。

  2. 2

    用 @ 带入上下文

    用 @ 引用页面、截图或本地笔记,让 Tabbit 生成标注已确认事实与待查问题的清单。

  3. 3

    修改前先比较

    用多模型对话比较设置说明。Tabbit 整理证据,本地后端仍是 Skyfall 运行的位置。

Tabbit Deep Research 将搜索结果和执行步骤并列显示。
Tabbit 在来源文章旁显示 AI 摘要侧栏。
Tabbit 多模型对话并列显示同一问题的多份回答。
Tabbit Agent 在 Google Sheets 中操作页面,右侧显示执行步骤。

选择合适的工具

SillyTavern 运行聊天,Tabbit 整理证据

两者解决不同环节。把生成控制留在 SillyTavern,用 Tabbit 减少在资料页面之间切换。

SillyTavern + 后端Tabbit
本地运行 Skyfall可以,需要兼容后端不作此承诺
角色卡和采样细致控制参考笔记
阅读模型和量化卡切换标签或应用@ 页面、文件和截图
比较设置说明切换预设或 endpoint比较可用模型
硬件排错观察显存、offload 和速度收集证据

常见问题

Skyfall 31B 与 SillyTavern 问答

本指南对应哪个 Skyfall 31B?+

TheDrummer/Skyfall-31B-v4.2。旧版 v4.1 或其他包含 Skyfall 名称的项目可能使用不同模板和行为。

Skyfall v4.2 基于什么?+

模型卡元数据将 mistralai/Magistral-Small-2509 列为 base。请复制完整 ID,不要只依赖搜索标签。

该下载哪个量化?+

官方 GGUF tree 中 Q4_K_M 约 18.98 GB,适合做起点。根据运行时开销测试 Q3 或 Q5。

Skyfall 使用什么 chat template?+

模型卡列出 Mistral v7 Tekken,定制模板还会检查 system prompt 中的 /think。请确认后端怎样处理这个开关。

Tabbit 会运行 Skyfall 31B 吗?+

本页不作此承诺。Tabbit 用来整理模型卡、量化文件和对比资料。请通过兼容的本地后端运行模型,再把后端接入 SillyTavern。

把 model ID 作为第一项设置

确认 v4.2,选择量化,让 Mistral 格式只有一个负责人,再用短场景调参。资料分散在不同页面和文件时,用 Tabbit 收拢它们。

支持 macOS 和 Windows。Tabbit 的模型可用性会变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。