Gemma 4 26B A4B × SillyTavern

在 SillyTavern 使用 Gemma 4 26B

先别被 26B 这个数字带偏。Gemma 4 26B A4B 是总计 252 亿参数、约 38 亿 active parameters 的 MoE 模型,不是 dense 26B,也不是 31B。本页按模型名、显存、模板和前端的顺序整理接入路径。

Google 模型卡
核对官方模型事实
Tabbit 桌面浏览器,带竖向标签、中央提示框和右侧聊天面板。

先看名称和硬件

26B A4B 是 MoE,不能只看数字

Google 的正式名称是 Gemma 4 26B A4B。模型卡列出 252 亿总参数、38 亿 active parameters、30 层、图片输入和 256K 上下文。社区 GGUF 文件名里的 IT、Q4、Q5 或作者名属于发布标签。

01

使用准确的模型 ID

指令版本在 Hugging Face 模型卡中的 ID 是 `google/gemma-4-26B-A4B-it`。Q4、Q5、Q6 表示量化分发,不是 Google 新建的模型系列。

02

显存要算上下文和运行时

active 参数有助于解释速度,但不代表每个文件都是 4 GB。权重、运行时 buffer、约 5.5 亿参数的视觉编码器、KV cache 和上下文长度都会占内存。

03

不要照搬 31B 配方

31B 是约 307 亿参数的 dense 模型。26B A4B 会路由到专家。为 31B 写的量化或显存经验不一定适用于这个 checkpoint。

SillyTavern 接入顺序

先连后端,再放角色卡

按层排查,才能分清是模板问题、采样问题还是角色卡本身的问题。

  1. 01

    1. 确认 checkpoint

    选择明确标注 Gemma 4 26B A4B 的本地文件或渠道版本。使用渠道提供的 model slug,不要凭记忆手填 `gemma-4-26b`。

  2. 02

    2. 选择兼容的 API 模式

    KoboldCpp、llama.cpp、LM Studio 或 OpenAI 兼容渠道各有自己的 endpoint。支持时先从 Chat Completions 开始,Text Completion 会把更多格式细节交给你。

  3. 03

    3. 让后端处理 Gemma 4 模板

    Google 的格式使用 `system`、`user`、`model`、`<|turn>` 和 `<turn|>`。使用后端提供的 Gemma 4 或 Gemini tokenizer 与 chat template,不要覆盖成旧 Gemma 3 模板。

  4. 04

    4. 有意地开启 thinking

    Google 说明可在 system prompt 开头加入 `<|think|>` 开启思考。先用短提示测试,再加入角色卡和 preset。普通多轮历史只保留最终答案。

社区讨论提到 SillyTavern 1.17、KoboldCpp 的 `--jinja`、Gemma4/Gemini tokenizer 与 `<|think|>`。这些是排错线索,不是所有后端都适用的 Google 默认值。

回复出错时

只修出错的那一层

CASE 01

思考标记变成正文

先查 tokenizer、chat template 和后端生成模式。后端已经套模板时,再手写控制标记可能让 token 原样出现。用一条短提示对比开关 thinking。

CASE 02

有时思考,有时不思考

确认 SillyTavern 和 loader 是否支持 Gemma 4 格式。社区方案可能需要 `--jinja` 或 `<|think|>`,但开关取决于服务器,不要把所有方案叠在一起。

CASE 03

角色重复或丢细节

先减少重复上下文,再改温度。检查上下文上限和角色卡,然后把 temperature 1.0、top-p 0.95、top-k 64 当作实验起点。

浏览器替代路径

保留角色 wiki,在旁边提问

Tabbit 不是本地 GGUF 运行器,也不是 SillyTavern 角色卡管理器。它适合把角色页面、设定笔记或排错帖子留在眼前,同时和浏览器里可用的模型对话。

  1. 1

    安装 Tabbit

    下载 macOS 或 Windows 的 Chromium 浏览器。这条路径不需要本地 Gemma 文件、渠道 Key 或 SillyTavern 服务。

  2. 2

    只选择列表里的模型

    安装后打开产品内模型选择器。当前代码列出 GPT-5.4、Gemini-3.1-Pro、Claude-Sonnet-4.6、DeepSeek-V4-Flash 等模型。当前映射没有 Gemma 4,因此本页不承诺 Tabbit 可运行 Gemma。

  3. 3

    把资料带进对话

    将 wiki 或设置笔记留在标签页,输入 `@` 引用网页、截图或文件,再让模型整理场景、检查一致性或总结刚比较过的配置。

Tabbit 新标签页模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6,画面中没有 Gemma 4。

选择前端

角色卡用 SillyTavern,资料页用 Tabbit

两个工具解决不同堵点。需要角色控制时保留专用前端,资料散落在网页和文件中时使用浏览器路径。

SillyTavernTabbit
角色卡和 lorebook核心流程引用来源页面
Gemma 4 本地 checkpoint自行准备后端使用选择器列出的模型
模板和 sampler细致控制由所选模型管理
网页上下文粘贴或扩展用 @ 引用标签页或文件
第一条有用回复endpoint + 模板 + preset安装 + 选择列表模型
Tabbit 新标签页模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6,画面中没有 Gemma 4。

把资料带进对话

将 wiki 或设置笔记留在标签页,输入 `@` 引用网页、截图或文件,再让模型整理场景、检查一致性或总结刚比较过的配置。

Tabbit 新标签页模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6,画面中没有 Gemma 4。

网页上下文

用 @ 引用标签页或文件

常见问题

Gemma 4 26B A4B 与 SillyTavern

Gemma 4 26B 的官方名称是什么?+

Google 模型卡称它为 Gemma 4 26B A4B。Hugging Face 指令 checkpoint 是 `google/gemma-4-26B-A4B-it`,社区发布者可能添加自己的后缀。

26B A4B 和 Gemma 4 31B 一样吗?+

不一样。26B A4B 是 MoE,总参数 252 亿、active parameters 约 38 亿。Gemma 4 31B 是约 307 亿参数的 dense 模型。

需要多少显存?+

没有一个安全的统一数字。量化权重、KV cache、上下文、运行时 buffer 和视觉编码器都会影响显存。请用目标上下文测量具体 GGUF 或后端构建。

为什么 `<|think|>` 会出现在回复里?+

tokenizer 或模板可能与后端不匹配,也可能是服务器把控制 token 当作文本输出。先检查格式、tokenizer 和 thinking 设置。

Tabbit 能运行 Gemma 4 26B 吗?+

不要直接假设。当前 Tabbit 模型映射没有 Gemma 4。安装后只能使用当前选择器实际显示的模型。

先把模型链路接对,再调 preset

本地 Gemma 4 26B A4B 依次核对 checkpoint、显存、tokenizer 和模板。需要在角色 wiki 或排错资料旁聊天时,安装 Tabbit 并查看当前模型选择器。

支持 macOS 和 Windows。模型可用性可能变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。