Gemma 4 × SillyTavern 設定

先修對設定層

Gemma 4 回覆不對,不一定需要換一套預設。依序檢查模型 ID、chat template、系統角色、上下文預算和取樣器。這頁提供可重現的基線,不是萬用配方。

Tabbit 桌面瀏覽器,帶有垂直分頁、中間輸入框和頁面旁的聊天面板。

先看症狀

輸出表現會提示要檢查哪項設定

先分清格式錯誤和取樣選擇。最快的修復通常是能解釋症狀的最小改動。

01

thinking 標記直接漏到回覆裡

先檢查 instruct 或 chat template、tokenizer 和 reasoning 模式,再動溫度。像 <|think|> 這類標記放錯格式,就會變成原樣文字。

02

回覆截斷或空白

檢查 response token 上限和剩餘上下文視窗。長角色卡加歷史訊息後,可能沒有足夠空間生成回覆。

03

模型覆誦或失去角色

查重複的角色卡內容、過滿的上下文和過強的覆誦控制。先用乾淨提示測試,再一次改一個取樣器。

模型與記憶體

26B A4B 和 31B 是不同取捨

Google 將 26B A4B 描述為 mixture-of-experts,31B 為 dense。MoE 每個 token 啟用的參數較少,但權重仍要載入。量化和上下文長度會改變實際記憶體成本。

ModelProfileMemory noteFit
26B A4B混合專家模型,每個 token 啟用 4BGoogle 估算 Q4_0 權重約 14.4 GB,未計上下文開銷後端支援對應格式時,可作為本地候選
31BDense 模型Google 估算 Q4_0 權重約 17.5 GB,未計上下文開銷確認記憶體和回應速度能接受再選
Q4、Q5、Q6量化檔案,不是新的官方型號低精度可能省記憶體,但會有品質和速度取捨遵循發布者 model card 和後端格式

這些是載入權重的近似值。還要為執行時、KV cache 和所選上下文長度留空間。

連接鏈

角色卡和回覆之間有五層

把每一層當作獨立檢查點。症狀在哪次改動後出現,就知道該回頭看哪裡。

01

介面和模型 ID

Setting

連接器、伺服器位址和準確 checkpoint slug

Baseline / watch

使用供應商或後端顯示的 ID

錯誤 alias、舊模型或不支援的量化格式

02

Chat 或 instruct 格式

Setting

Chat Completions、Text Completion 和模板

Baseline / watch

服務支援時先從 Chat Completions 開始

header 或 thinking 標記變成普通文字

03

系統角色

Setting

system message 及其位置

Baseline / watch

保持簡短明確,並與角色卡分開

後端忽略或重複 system message

04

上下文與回覆

Setting

context tokens 和最大 response tokens

Baseline / watch

載入長歷史前先給回覆留空間

回覆截斷、忘記細節或記憶體升高

05

取樣

Setting

溫度、Top P、Top K、Min P 和覆誦控制

Baseline / watch

從中性起點開始,每次改一個值

覆誦、平淡或角色聲音不穩定

取樣基線

用能解釋的基線開始

Google 和社群指南常從 Temperature 1.0、Top P 0.95、Top K 64 附近開始。SillyTavern 對每項控制有獨立定義。把它們當作第一次測試,不要當成最佳預設。

第一次測試

  • Temperature 1.0
  • Top P 0.95
  • Top K 64
  • Min P 0
  • Repetition penalty 1
  • DRY multiplier 0

SillyTavern 對不同控制項使用不同的停用值。後端也可能提供不同範圍,請同時看提示和伺服器文件。

01

1. 先建立乾淨執行

使用一條短提示、同一張卡和同一份上下文。保存輸出,後面的改動才有可比較的對象。

02

2. 單獨改溫度

回覆太平時,小幅調高溫度;太亂時,小幅調低。測試期間固定 Top P 和 Top K。

03

3. 再調 token 池

一次只改 Top P 或 Top K。SillyTavern 中 Min P 為 0 時停用,後端支援時再用低值測試。

04

4. 最後處理覆誦

先查重複上下文。Repetition penalty 為 1、DRY multiplier 為 0 時停用。過強的值會懲罰普通詞,讓文風變僵。

排錯地圖

根據證據匹配修復

CASE 01

thinking 被當作正文顯示

重新核對準確的模型模板、tokenizer 和 reasoning 模式。後端支援時試試 Chat Completions。確認格式前,不要直接把標記塞進提示。

CASE 02

長回覆提前停止

先檢查上下文使用量,再增加 response tokens。先刪重複的 lore 或角色卡內容。更大的上下文視窗也會增加 KV cache 記憶體。

CASE 03

幾輪後開始覆誦

檢查重複訊息和上下文邊界。先回到 repetition penalty 1、DRY 0,再試一個適度的控制項,不要疊加多個懲罰。

CASE 04

不同量化檔案感覺不同

比較檔案時固定後端、角色卡和取樣器。記錄量化後綴、上下文長度和生成速度。Q4 檔案不能直接代表 BF16 執行。

另一條路徑

任務圍繞網頁時,先跳過本地取樣折騰

Tabbit 是支援 macOS 和 Windows 的 Chromium AI 瀏覽器。它不執行本地 Gemma checkpoint,也不取代 SillyTavern 角色卡。需要讀網頁、截圖或檔案並在旁邊提問時,它更合適。

  1. 1

    安裝 Tabbit

    下載桌面瀏覽器並開啟新分頁。官網列出 macOS 12+ 和 Windows 10+ 支援。

  2. 2

    使用目前模型選擇器

    只選擇已安裝 Tabbit 中實際列出的模型。清單會變。本頁不聲稱 Gemma 4 目前可用。

  3. 3

    用 @ 引用上下文

    讓角色 wiki、提示筆記或文件留在分頁裡。用 @ 引用頁面、截圖或本機檔案,再要求整理、摘要或給第二版草稿。

Tabbit 模型選擇器顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截圖中看不到 Gemma 4。
Tabbit 模型選擇器顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截圖中看不到 Gemma 4。Tabbit 模型選擇器顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截圖中看不到 Gemma 4。

選擇工作流

本地 SillyTavern 還是 Tabbit?

看任務選擇路徑。本地適合精細控制模型和角色卡,網頁本身是上下文時用 Tabbit。

SillyTavern + 本地後端Tabbit
Checkpoint 和量化自己選擇並載入選擇目前模型清單中的項目
模板和取樣器細粒度控制由所選模型管理
角色卡和 lorebook核心工作流開啟來源頁面
網頁、截圖和檔案上下文貼上或設定擴充功能@ 目前分頁或檔案
第一步診斷模型 ID → 模板 → 上下文 → 取樣開啟、引用、提問
Tabbit 桌面瀏覽器,帶有垂直分頁、中間輸入框和頁面旁的聊天面板。

取樣基線

SillyTavern 對不同控制項使用不同的停用值。後端也可能提供不同範圍,請同時看提示和伺服器文件。

常見問題

Gemma 4 設定,直接回答

Gemma 4 SillyTavern 的安全基線是什麼?+

先用 Temperature 1.0、Top P 0.95、Top K 64,並將 Min P 設為 0、repetition penalty 設為 1、DRY multiplier 設為 0。這些是起點,一次只改一個值。

該選 26B A4B 還是 31B?+

兩者架構不同。Google 將 26B A4B 描述為 MoE,31B 為 dense。結合 model card、近似權重記憶體、上下文預算和後端決定。

為什麼 Gemma 4 thinking token 會顯示成文字?+

模型模板、tokenizer、後端和 reasoning 模式可能不一致。加入 <|think|> 之前先核對這四項。

context 和 response token 共用記憶體嗎?+

它們共用請求預算,更大的總上下文也需要更多 KV cache 記憶體。SillyTavern 傳送的上下文會扣除 response allowance。

Tabbit 能執行我的本地 Gemma 4 量化檔案嗎?+

本頁不做這個承諾。安裝後只使用目前選擇器中實際列出的模型。Tabbit 負責網頁和檔案上下文,SillyTavern 仍適合本地角色卡和取樣控制。

一次改一個值,再讀結果

本地 Gemma 4 要把 model card、模板和上下文鏈放在一起核對。圍繞網頁工作時,安裝 Tabbit,從目前選擇器選擇模型。

支援 macOS 和 Windows,模型可用性可能變動。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生瀏覽器。