Gemma 4 × SillyTavern

在 SillyTavern 設定 Gemma 4

想用 Gemma 4 進行角色聊天?先分清官方模型名稱和社群量化檔案。接著依序檢查後端、chat template、tokenizer 和 thinking 標記。這份指南整理了一條能實際完成設定的路徑,也提供一個不必先處理本地部署的瀏覽器方案。

Google DeepMind 官方頁面
在 Google DeepMind 核對模型名稱
Tabbit 桌面版新分頁,左側有垂直分頁,中間是輸入框,右側是聊天面板。

先確認模型

Gemma 4 是一個模型家族,不是一份 SillyTavern 預設

Google 列出 E2B、E4B、12B、26B A4B 和 31B。26B A4B 是混合專家模型,31B 是 dense 模型。Q4 和 Q6 是量化版本,不是新的官方模型名稱。

01

該選 26B A4B 還是 31B?

依照 model card 和手上的硬體來決定。26B A4B 只有部分參數會啟用,執行時可能比較省資源;31B 通常需要更多記憶體。兩者架構不同,不要只看數字比較。

02

本地、供應商還是 API

Ollama、LM Studio、KoboldCpp 和 llama.cpp server 處理模板與上下文的方式不同。OpenRouter 等 API 可能比較省事,但模型 ID 和 alias 要以供應商清單為準。

03

角色扮演也是設定測試

角色是否一致,除了 checkpoint,也取決於角色卡、system prompt、sampler 和上下文上限。社群有人用 DRY 和預設來減少重複,但那只是起點,不是官方預設值。

SillyTavern 路徑

照這個順序連接,出錯比較好找

一次只改一層。這樣遇到不理想的回覆時,才知道問題出在哪裡,不會變成每個設定都在猜。

  1. 01

    1. 先確認端點

    選擇符合後端的連接器,確認清單中有正確的 Gemma 4 checkpoint。使用供應商服務時,直接複製它的 model slug,不要憑記憶輸入 alias。

  2. 02

    2. 選擇 Chat Completions

    如果 API 或本地伺服器支援,先使用 Chat Completions。Text Completion 也可能可用,但需要自己處理更多模板細節,較容易漏掉過時格式。

  3. 03

    3. 對齊 tokenizer 與模板

    使用後端提供的 Gemma 4 或 Gemini tokenizer/template。較舊的 Gemma 模板可能會把 header 和 thinking 標記放在錯誤的位置。

  4. 04

    4. 加入角色卡和預設

    先載入角色卡,再加入簡潔的 system prompt。社群預設一次測試一份,保留作者的原始檔案,並記下自己做過的變更。

FF、Moonlight 等名稱來自社群討論,不是 Google 的預設值,本頁也不轉載它們的檔案。

回覆看起來不對時

只修出問題的那一層

CASE 01

thinking 文字沒有被解析

先檢查模型模板、tokenizer 和 thinking 設定。Reddit 上有人建議在 system prompt 前加入 <|think|> 標記,但這取決於後端;格式不符時,反而可能直接顯示原始 token。

CASE 02

有時會思考,有時不會

供應商可能和本地版本用不同方式呈現 reasoning。不要直接強塞標記。用同一個簡短請求比較開啟和關閉 thinking 的結果,再查看供應商或 model card 的說明。

CASE 03

角色不斷重複或逐漸跑偏

先減少上下文中的雜訊,再調整溫度。刪掉重複的角色卡內容,確認上下文上限,然後再試社群 sampler 或 DRY 設定。Reddit 使用者常提到 Temperature 1.0、Top-K 64 和 Top-P 0.95,但把它們當成實驗起點就好。

瀏覽器路徑

讓角色頁保持開啟,在旁邊直接提問

Tabbit 不取代 SillyTavern 的角色卡或 lorebook。它處理的是另一種需求:一邊閱讀即時 wiki、文件或參考頁,一邊和瀏覽器中目前可用的模型聊天。

  1. 1

    安裝 Tabbit

    下載適用於 macOS 或 Windows 的 Chromium 核心瀏覽器。走這條路徑不需要本地模型檔案,也不需要 SillyTavern 伺服器。

  2. 2

    選擇清單中實際顯示的模型

    安裝後開啟模型選擇器,選擇當下確實顯示的模型,例如 GPT-5.4、GPT-5.2-Chat 或 Gemini-3-Flash。模型供應情況可能改變,所以選擇器才是準確依據。

  3. 3

    參考目前開啟的頁面

    把角色 wiki 或設定文件留在分頁中。使用 @ 參考頁面、螢幕截圖或檔案,再請模型整理設定、記錄場景或提出另一個版本。

Tabbit 新分頁的模型選擇器,顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。這張截圖沒有顯示 Gemma 4。

選對工具

SillyTavern 還是 Tabbit?

按照你卡住的地方選擇。瀏覽器捷徑不是角色卡管理器,本地前端也不會自動讓模型變得更好。

SillyTavernTabbit
角色卡和 lorebook內建保持來源頁面開啟
本地 Gemma 4 checkpoint自行準備後端使用選擇器中的模型
模板和 sampler 控制可細緻調整由選定的模型管理
頁面上下文貼上內容或使用擴充功能@ 目前分頁或檔案
第一個可用回覆安裝 + 端點 + 預設安裝 + 選擇清單中的模型
Tabbit 新分頁的模型選擇器,顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。這張截圖沒有顯示 Gemma 4。

參考目前開啟的頁面

把角色 wiki 或設定文件留在分頁中。使用 @ 參考頁面、螢幕截圖或檔案,再請模型整理設定、記錄場景或提出另一個版本。

Tabbit 新分頁的模型選擇器,顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。這張截圖沒有顯示 Gemma 4。

頁面上下文

@ 目前分頁或檔案

常見問題

Gemma 4 和 SillyTavern,直接回答

Gemma 4 26B 和 31B 是同一個模型嗎?+

不是。Google 將 26B A4B 描述為混合專家模型,31B 則是 dense 模型。請依照 model card 和手上的硬體選擇。

Gemma 4 應該下載哪種量化版本?+

沒有適合所有人的固定答案。根據可用記憶體、上下文需求和發布者的 model card,在 Q4、Q5、Q6 中選擇。量化檔案不是新的官方 Gemma 名稱。

為什麼 thinking token 會直接顯示成文字?+

tokenizer、模板、後端或供應商可能對格式的處理方式不同。先核對這些項目,再加入 <|think|> 等標記;標記放在錯誤的模板中,可能讓輸出更混亂。

Tabbit 可以執行 Gemma 4 嗎?+

不要預設可以。安裝後打開 Tabbit 目前的模型選擇器,只使用實際列出的模型。本頁截圖沒有顯示 Gemma 4。

Tabbit 可以取代 SillyTavern 嗎?+

不能。角色卡、lorebook 和細緻的預設控制仍適合在 SillyTavern 使用。Tabbit 適合在網頁和檔案旁邊聊天。

別再修錯層

如果要在本地使用 Gemma 4,請依照 model card 檢查模板鏈。如果想立即對著角色 wiki 得到回覆,安裝 Tabbit,再從目前的模型選擇器中選一個可用模型。

支援 macOS 和 Windows。模型清單可能會變動。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生瀏覽器。