使用准确的模型 ID
指令版本在 Hugging Face 模型卡中的 ID 是 `google/gemma-4-26B-A4B-it`。Q4、Q5、Q6 表示量化分发,不是 Google 新建的模型系列。
Gemma 4 26B A4B × SillyTavern
先别被 26B 这个数字带偏。Gemma 4 26B A4B 是总计 252 亿参数、约 38 亿 active parameters 的 MoE 模型,不是 dense 26B,也不是 31B。本页按模型名、显存、模板和前端的顺序整理接入路径。
核对官方模型事实 ↗
先看名称和硬件
Google 的正式名称是 Gemma 4 26B A4B。模型卡列出 252 亿总参数、38 亿 active parameters、30 层、图片输入和 256K 上下文。社区 GGUF 文件名里的 IT、Q4、Q5 或作者名属于发布标签。
指令版本在 Hugging Face 模型卡中的 ID 是 `google/gemma-4-26B-A4B-it`。Q4、Q5、Q6 表示量化分发,不是 Google 新建的模型系列。
active 参数有助于解释速度,但不代表每个文件都是 4 GB。权重、运行时 buffer、约 5.5 亿参数的视觉编码器、KV cache 和上下文长度都会占内存。
31B 是约 307 亿参数的 dense 模型。26B A4B 会路由到专家。为 31B 写的量化或显存经验不一定适用于这个 checkpoint。
SillyTavern 接入顺序
按层排查,才能分清是模板问题、采样问题还是角色卡本身的问题。
选择明确标注 Gemma 4 26B A4B 的本地文件或渠道版本。使用渠道提供的 model slug,不要凭记忆手填 `gemma-4-26b`。
KoboldCpp、llama.cpp、LM Studio 或 OpenAI 兼容渠道各有自己的 endpoint。支持时先从 Chat Completions 开始,Text Completion 会把更多格式细节交给你。
Google 的格式使用 `system`、`user`、`model`、`<|turn>` 和 `<turn|>`。使用后端提供的 Gemma 4 或 Gemini tokenizer 与 chat template,不要覆盖成旧 Gemma 3 模板。
Google 说明可在 system prompt 开头加入 `<|think|>` 开启思考。先用短提示测试,再加入角色卡和 preset。普通多轮历史只保留最终答案。
社区讨论提到 SillyTavern 1.17、KoboldCpp 的 `--jinja`、Gemma4/Gemini tokenizer 与 `<|think|>`。这些是排错线索,不是所有后端都适用的 Google 默认值。
回复出错时
先查 tokenizer、chat template 和后端生成模式。后端已经套模板时,再手写控制标记可能让 token 原样出现。用一条短提示对比开关 thinking。
确认 SillyTavern 和 loader 是否支持 Gemma 4 格式。社区方案可能需要 `--jinja` 或 `<|think|>`,但开关取决于服务器,不要把所有方案叠在一起。
先减少重复上下文,再改温度。检查上下文上限和角色卡,然后把 temperature 1.0、top-p 0.95、top-k 64 当作实验起点。
浏览器替代路径
Tabbit 不是本地 GGUF 运行器,也不是 SillyTavern 角色卡管理器。它适合把角色页面、设定笔记或排错帖子留在眼前,同时和浏览器里可用的模型对话。
下载 macOS 或 Windows 的 Chromium 浏览器。这条路径不需要本地 Gemma 文件、渠道 Key 或 SillyTavern 服务。
安装后打开产品内模型选择器。当前代码列出 GPT-5.4、Gemini-3.1-Pro、Claude-Sonnet-4.6、DeepSeek-V4-Flash 等模型。当前映射没有 Gemma 4,因此本页不承诺 Tabbit 可运行 Gemma。
将 wiki 或设置笔记留在标签页,输入 `@` 引用网页、截图或文件,再让模型整理场景、检查一致性或总结刚比较过的配置。

选择前端
两个工具解决不同堵点。需要角色控制时保留专用前端,资料散落在网页和文件中时使用浏览器路径。
| SillyTavern | Tabbit | |
|---|---|---|
| 角色卡和 lorebook | 核心流程 | 引用来源页面 |
| Gemma 4 本地 checkpoint | 自行准备后端 | 使用选择器列出的模型 |
| 模板和 sampler | 细致控制 | 由所选模型管理 |
| 网页上下文 | 粘贴或扩展 | 用 @ 引用标签页或文件 |
| 第一条有用回复 | endpoint + 模板 + preset | 安装 + 选择列表模型 |

将 wiki 或设置笔记留在标签页,输入 `@` 引用网页、截图或文件,再让模型整理场景、检查一致性或总结刚比较过的配置。

用 @ 引用标签页或文件
常见问题
Google 模型卡称它为 Gemma 4 26B A4B。Hugging Face 指令 checkpoint 是 `google/gemma-4-26B-A4B-it`,社区发布者可能添加自己的后缀。
不一样。26B A4B 是 MoE,总参数 252 亿、active parameters 约 38 亿。Gemma 4 31B 是约 307 亿参数的 dense 模型。
没有一个安全的统一数字。量化权重、KV cache、上下文、运行时 buffer 和视觉编码器都会影响显存。请用目标上下文测量具体 GGUF 或后端构建。
tokenizer 或模板可能与后端不匹配,也可能是服务器把控制 token 当作文本输出。先检查格式、tokenizer 和 thinking 设置。
不要直接假设。当前 Tabbit 模型映射没有 Gemma 4。安装后只能使用当前选择器实际显示的模型。
本地 Gemma 4 26B A4B 依次核对 checkpoint、显存、tokenizer 和模板。需要在角色 wiki 或排错资料旁聊天时,安装 Tabbit 并查看当前模型选择器。
支持 macOS 和 Windows。模型可用性可能变化。