Gemma 4 × SillyTavern 设置

先修对设置层

Gemma 4 回复不对,不一定需要换一套预设。按模型 ID、chat template、系统角色、上下文预算和采样器的顺序检查。这页给的是可复现的基线,不是万能配方。

Tabbit 桌面浏览器,带垂直标签、中间输入框和页面旁的聊天面板。

先看症状

输出表现会提示你检查哪项设置

先分清格式错误和采样选择。最快的修复,通常是能解释症状的最小改动。

01

thinking 标记直接漏到回复里

先检查 instruct 或 chat template、tokenizer 和 reasoning 模式,再动温度。像 <|think|> 这样的标记放错格式,就会变成原样文本。

02

回复截断或空白

检查 response token 上限和剩余上下文窗口。长角色卡加历史消息后,可能没有足够空间生成回复。

03

模型复读或丢失角色

查重复的角色卡内容、过满的上下文和过强的复读控制。先用干净提示测试,再一次改一个采样器。

模型与内存

26B A4B 和 31B 是不同取舍

Google 将 26B A4B 描述为 mixture-of-experts,31B 为 dense。MoE 每个 token 激活的参数更少,但权重仍要加载。量化和上下文长度会改变实际内存成本。

ModelProfileMemory noteFit
26B A4B混合专家模型,每个 token 激活 4BGoogle 估算 Q4_0 权重约 14.4 GB,未计上下文开销后端支持对应格式时,可作为本地候选
31BDense 模型Google 估算 Q4_0 权重约 17.5 GB,未计上下文开销确认内存和响应速度能接受再选
Q4、Q5、Q6量化文件,不是新的官方型号低精度可能省内存,但会带来质量和速度取舍遵循发布者 model card 和后端格式

这些是加载权重的近似值。还要为运行时、KV cache 和所选上下文长度留空间。

连接链

角色卡和回复之间有五层

把每一层当作独立检查点。症状在哪次改动后出现,就知道该回头看哪里。

01

接口和模型 ID

Setting

连接器、服务器地址和准确 checkpoint slug

Baseline / watch

使用供应商或后端显示的 ID

错误 alias、旧模型或不支持的量化格式

02

Chat 或 instruct 格式

Setting

Chat Completions、Text Completion 和模板

Baseline / watch

服务支持时先从 Chat Completions 开始

header 或 thinking 标记变成普通文本

03

系统角色

Setting

system message 及其位置

Baseline / watch

保持简短明确,并与角色卡分开

后端忽略或重复 system message

04

上下文与回复

Setting

context tokens 和最大 response tokens

Baseline / watch

载入长历史前先给回复留空间

回复截断、忘记细节或内存升高

05

采样

Setting

温度、Top P、Top K、Min P 和复读控制

Baseline / watch

从中性起点开始,每次改一个值

复读、平淡或角色声音不稳定

采样基线

用能解释的基线开始

Google 和社区指南常从 Temperature 1.0、Top P 0.95、Top K 64 附近开始。SillyTavern 对每项控制有独立定义。把它们当作第一次测试,不要当成最佳预设。

第一次测试

  • Temperature 1.0
  • Top P 0.95
  • Top K 64
  • Min P 0
  • Repetition penalty 1
  • DRY multiplier 0

SillyTavern 对不同控制项使用不同的禁用值。后端也可能提供不同范围,请同时看提示和服务器文档。

01

1. 先建立干净运行

使用一条短提示、同一张卡和同一份上下文。保存输出,后面的改动才有可比较的对象。

02

2. 单独改温度

回复太平时,小幅调高温度;太乱时,小幅调低。测试期间固定 Top P 和 Top K。

03

3. 再调 token 池

一次只改 Top P 或 Top K。SillyTavern 中 Min P 为 0 时禁用,后端支持时再用低值测试。

04

4. 最后处理复读

先查重复上下文。Repetition penalty 为 1、DRY multiplier 为 0 时禁用。过强的值会惩罚普通词,让文风变僵。

排错地图

根据证据匹配修复

CASE 01

thinking 被当作正文显示

重新核对准确的模型模板、tokenizer 和 reasoning 模式。后端支持时试试 Chat Completions。确认格式前,不要直接把标记塞进提示。

CASE 02

长回复提前停止

先检查上下文使用量,再增加 response tokens。先删重复的 lore 或角色卡内容。更大的上下文窗口也会增加 KV cache 内存。

CASE 03

几轮后开始复读

检查重复消息和上下文边界。先回到 repetition penalty 1、DRY 0,再试一个适度的控制项,不要叠加多个惩罚。

CASE 04

不同量化文件感觉不同

比较文件时固定后端、角色卡和采样器。记录量化后缀、上下文长度和生成速度。Q4 文件不能直接代表 BF16 运行。

另一条路径

任务围绕网页时,先跳过本地采样折腾

Tabbit 是支持 macOS 和 Windows 的 Chromium AI 浏览器。它不运行本地 Gemma checkpoint,也不替代 SillyTavern 角色卡。需要读网页、截图或文件并在旁边提问时,它更合适。

  1. 1

    安装 Tabbit

    下载桌面浏览器并打开新标签页。官网列出 macOS 12+ 和 Windows 10+ 支持。

  2. 2

    使用当前模型选择器

    只选择已安装 Tabbit 中实际列出的模型。列表会变化。本页不声称 Gemma 4 当前可用。

  3. 3

    用 @ 引用上下文

    让角色 wiki、提示笔记或文档留在标签页里。用 @ 引用页面、截图或本地文件,再要求整理、总结或给第二版草稿。

Tabbit 模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截图中看不到 Gemma 4。
Tabbit 模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截图中看不到 Gemma 4。Tabbit 模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截图中看不到 Gemma 4。

选择工作流

本地 SillyTavern 还是 Tabbit?

看任务选择路径。本地适合精细控制模型和角色卡,网页本身是上下文时用 Tabbit。

SillyTavern + 本地后端Tabbit
Checkpoint 和量化自己选择并加载选择当前模型列表里的项
模板和采样器细粒度控制由所选模型管理
角色卡和 lorebook核心工作流打开来源页面
网页、截图和文件上下文粘贴或配置扩展@ 当前标签或文件
第一步诊断模型 ID → 模板 → 上下文 → 采样打开、引用、提问
Tabbit 桌面浏览器,带垂直标签、中间输入框和页面旁的聊天面板。

采样基线

SillyTavern 对不同控制项使用不同的禁用值。后端也可能提供不同范围,请同时看提示和服务器文档。

常见问题

Gemma 4 设置,直接回答

Gemma 4 SillyTavern 的安全基线是什么?+

先用 Temperature 1.0、Top P 0.95、Top K 64,并将 Min P 设为 0、repetition penalty 设为 1、DRY multiplier 设为 0。这些是起点,一次只改一个值。

该选 26B A4B 还是 31B?+

两者架构不同。Google 将 26B A4B 描述为 MoE,31B 为 dense。结合 model card、近似权重内存、上下文预算和后端决定。

为什么 Gemma 4 thinking token 会显示成文本?+

模型模板、tokenizer、后端和 reasoning 模式可能不一致。加 <|think|> 之前先核对这四项。

context 和 response token 共用内存吗?+

它们共用请求预算,更大的总上下文也需要更多 KV cache 内存。SillyTavern 发送的上下文会扣除 response allowance。

Tabbit 能运行我的本地 Gemma 4 量化文件吗?+

本页不做这个承诺。安装后只使用当前选择器里实际列出的模型。Tabbit 负责网页和文件上下文,SillyTavern 仍适合本地角色卡和采样控制。

一次改一个值,再读结果

本地 Gemma 4 要把 model card、模板和上下文链放在一起核对。围绕网页工作时,安装 Tabbit,从当前选择器选择模型。

支持 macOS 和 Windows,模型可用性可能变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。