使用准确的模型 ID
指令版本在 Hugging Face 模型卡中的 ID 是 `google/gemma-4-26B-A4B-it`。Q4、Q5、Q6 表示量化分发,不是 Google 新建的模型系列。
Gemma 4 uncensored × SillyTavern
在 SillyTavern 里,uncensored 可能指社区微调、去拒答 checkpoint、渠道标签,也可能只是用户对角色扮演体验的描述。它不是 Gemma 4 的官方变体。先核对模型卡、许可、模板和渠道政策,再判断是模型拒答还是场景配置出错。
查看 Google 的安全与模型事实 ↗
先看证据
Google 发布 Gemma 4 的预训练与指令微调开放权重,并公开安全评估与使用限制。Hugging Face 上名为 Uncensored 的仓库属于社区发布,它的测试数量和质量说法属于作者,不能当成 Google 结论。
指令版本在 Hugging Face 模型卡中的 ID 是 `google/gemma-4-26B-A4B-it`。Q4、Q5、Q6 表示量化分发,不是 Google 新建的模型系列。
active 参数有助于解释速度,但不代表每个文件都是 4 GB。权重、运行时 buffer、约 5.5 亿参数的视觉编码器、KV cache 和上下文长度都会占内存。
Q4、Q5、Q6、GGUF 和渠道 slug 描述文件或路由,不能证明模型“无审查”。量化会影响内存和输出质量,而行为边界来自 checkpoint 和微调。
SillyTavern 接入顺序
按层排查,才能分清是模板问题、采样问题、社区微调行为还是角色卡本身的问题。
记录完整的社区模型 ID、基座 checkpoint、变体、量化文件和模型卡链接。不要把 uncensored 标签或 `gemma-4-26b` 记忆输入当作官方身份。
KoboldCpp、llama.cpp、LM Studio 或 OpenAI 兼容渠道各有自己的 endpoint。支持时先从 Chat Completions 开始,Text Completion 会把更多格式细节交给你。
Google 的格式使用 `system`、`user`、`model`、`<|turn>` 和 `<turn|>`。使用后端提供的 Gemma 4 或 Gemini tokenizer 与 chat template,不要覆盖成旧 Gemma 3 模板。
Google 说明可在 system prompt 开头加入 `<|think|>` 开启思考。先用短提示测试,再加入角色卡和 preset。普通多轮历史只保留最终答案。
社区讨论提到 SillyTavern 1.17、KoboldCpp 的 `--jinja`、Gemma4/Gemini tokenizer 与 `<|think|>`。这些是排错线索,不是所有后端都适用的 Google 默认值。
回复出错时
先查 tokenizer、chat template 和后端生成模式。后端已经套模板时,再手写控制标记可能让 token 原样出现。用一条短提示对比开关 thinking。
确认 SillyTavern 和 loader 是否支持 Gemma 4 格式。社区方案可能需要 `--jinja` 或 `<|think|>`,但开关取决于服务器,不要把所有方案叠在一起。
先减少重复上下文,再改温度。检查上下文上限和角色卡,然后把 temperature 1.0、top-p 0.95、top-k 64 当作实验起点。
浏览器替代路径
Tabbit 不是本地 GGUF 运行器,也不是 SillyTavern 角色卡管理器。它适合把角色页面、设定笔记或排错帖子留在眼前,同时和浏览器里可用的模型对话。
下载 macOS 或 Windows 的 Chromium 浏览器。这条路径不需要本地 Gemma 文件、渠道 Key 或 SillyTavern 服务。
安装后打开产品内模型选择器。当前代码列出 GPT-5.4、Gemini-3.1-Pro、Claude-Sonnet-4.6、DeepSeek-V4-Flash 等模型。当前映射没有 Gemma 4,因此本页不承诺 Tabbit 可运行 Gemma。
将 wiki 或设置笔记留在标签页,输入 `@` 引用网页、截图或文件,再让模型整理场景、检查一致性或总结刚比较过的配置。

选择前端
两个工具解决不同堵点。需要角色控制时保留专用前端,资料散落在网页和文件中时使用浏览器路径。
| SillyTavern | Tabbit | |
|---|---|---|
| 角色卡和 lorebook | 核心流程 | 引用来源页面 |
| Gemma 4 本地 checkpoint | 自行准备后端 | 使用选择器列出的模型 |
| 模板和 sampler | 细致控制 | 由所选模型管理 |
| 网页上下文 | 粘贴或扩展 | 用 @ 引用标签页或文件 |
| 第一条有用回复 | endpoint + 模板 + preset | 安装 + 选择列表模型 |

将 wiki 或设置笔记留在标签页,输入 `@` 引用网页、截图或文件,再让模型整理场景、检查一致性或总结刚比较过的配置。

用 @ 引用标签页或文件
常见问题
Google 模型卡称它为 Gemma 4 26B A4B。Hugging Face 指令 checkpoint 是 `google/gemma-4-26B-A4B-it`,社区发布者可能添加自己的后缀。
不一样。26B A4B 是 MoE,总参数 252 亿、active parameters 约 38 亿。Gemma 4 31B 是约 307 亿参数的 dense 模型。
没有一个安全的统一数字。量化权重、KV cache、上下文、运行时 buffer 和视觉编码器都会影响显存。请用目标上下文测量具体 GGUF 或后端构建。
tokenizer 或模板可能与后端不匹配,也可能是服务器把控制 token 当作文本输出。先检查格式、tokenizer 和 thinking 设置。
不要直接假设。当前 Tabbit 模型映射没有 Gemma 4。安装后只能使用当前选择器实际显示的模型。
社区 uncensored 模型先核对基座、模型卡、许可、量化、tokenizer 和模板。需要在角色 wiki 或排错资料旁聊天时,安装 Tabbit 并查看当前模型选择器。
支持 macOS 和 Windows。模型可用性可能变化。