Tabbit部落格

Kimi K2 接入 SillyTavern:設定與排錯

透過本機或託管後端連接準確版本的 Kimi K2,再逐層測試與排查。

本文目錄
  1. 重點整理
  2. 連線的組成部分
  3. 1. 先確認 checkpoint
  4. 2. 選擇本機服務或服務商
  5. 3. 依照後端契約連線
  6. 保護金鑰與私人 prompt
  7. 4. 先做短測試
  8. 5. 連線穩定後再評估 RP
  9. 將 Tabbit Browser 當作研究工作區
  10. 該選哪條路?
  11. 常見問題
  12. SillyTavern 能自行執行 Kimi K2 嗎?
  13. 要輸入哪個 Kimi K2 模型 ID?
  14. 該選 Chat Completion 還是 Text Completion?
  15. 可以本機執行 Kimi K2 嗎?
  16. 為何有空白回覆、標記或重複?
  17. 來源與草稿狀態

要在 SillyTavern 使用 Kimi K2,必須連接能提供明確 K2 checkpoint 的獨立後端。SillyTavern 負責組合角色與對話脈絡,不會託管模型。先確認版本,選擇本機推論伺服器或有文件的服務商,再用簡單請求測試,之後才加入角色扮演脈絡。

本文只涵蓋 Kimi-K2-Instruct,以及後端明確標示的 K2 更新版本。這不是特定服務商的設定教學:目前託管 endpoint、API alias、價格、額度和可用性都尚未核實。實際連線重現前,文章維持草稿。

重點整理

  • SillyTavern 是用戶端;仍需另一個模型伺服器或 API 執行 Kimi K2。

  • 核對準確 checkpoint、revision、量化方式與 chat template。官方頁面另指向 Kimi-K2-Instruct-0905,不要混用版本設定。

  • Hugging Face repo ID 不一定等於服務商的 API alias。

  • Chat Completions 和 Text Completions 是 prompt 組合方式,不代表雲端或本機。

  • 分別確認連線、模型、template 和短對話。本稿未連接真實 K2 後端。

連線的組成部分

部分功能連線前確認
Checkpoint提供模型權重與行為版本、revision、量化、授權與 template
推論伺服器載入模型並提供 API格式、版本、路徑、網址與 template 處理
託管服務遠端執行模型準確模型、ID、認證、限制、價格、context 和資料條款
SillyTavern組合角色與對話脈絡並送出後端文件指定的 API 類型與設定

連線測試成功只能表示 endpoint 可連到,不能證明載入的是目標 checkpoint、template 正確或長對話穩定。

1. 先確認 checkpoint

請從Kimi K2-Instruct 官方模型卡開始,而非舊 preset 或影片簡稱。模型卡列出 vLLM 和 SGLang 本機服務範例,也指向 Kimi-K2-Instruct-0905。Kimi K2 專案頁說明 0905 更新涉及權重與 context 支援。部署前記下完整名稱與 revision、量化版本、runtime、template 的處理層,以及請求採用的模型 ID。

官方範例呈現 OpenAI-compatible chat completions 介面,但不代表任意服務商都使用相同 endpoint 或 ID。協定相容不保證功能、限制、政策或輸出一致。

不要以 K2.5、K2.6、K2.7 Code、K2.8 或 K3 步驟補足原版 K2 的設定。Kimi K2.6 概覽Kimi K3 SillyTavernK3 設定指南都是各自版本的資料,不是 K2 preset。

\n其他模型教學可用來了解不同接入路徑,但其 ID 和 preset 不能直接套用於 K2。可另看 Mistral 24BDeepSeek V4 FlashGLM-5.3Gemma 4 的獨立路徑。Kimi K3 roleplay談的是另一代模型。\n

2. 選擇本機服務或服務商

路徑適用情況目前文件需核對本稿尚未知
本機推論伺服器想自行管理 runtime 與 endpointcheckpoint、引擎、template、網址與硬體指引未測試安裝、記憶體、延遲或速度
託管服務目錄明確列出所需 checkpointmodel ID、base URL、金鑰、限制、價格、context 與資料處理未開啟或測試 K2 服務商
Kimi Web/App只用官方介面是否有獨立且有文件的 API 產品消費者聊天不等於 API 權限

本機需要管理模型檔案、硬體與更新;託管則受服務商現行條款和說明限制。模型卡範例不是硬體建議,量化、context、記憶體與 runtime 都會影響需求,不應只根據啟用參數數量估算。

使用託管服務時,開啟最新模型目錄與連線指南。若 checkpoint、請求格式、認證欄位或 ID 未明確記載,就先停止,不要猜值。

3. 依照後端契約連線

SillyTavern API Connections 文件說明,Chat Completions 會按角色組織訊息;Text Completions 則把對話組合成連續文字。這個選項影響 prompt 組裝,不代表本機或雲端。

  1. 依 checkpoint 和 runtime 的官方流程啟動伺服器,等待伺服器顯示就緒。

  2. 在 API Connections 選擇後端文件指定的類型。僅憑 OpenAI-compatible 無法推定確切選項或路徑。

  3. 將網址和憑證填入指定欄位,依現行文件複製。勿把金鑰放入角色卡、共享 preset、截圖或公開 prompt。

  4. 使用後端接受的模型 ID,可能不同於 HF repo 名稱。

  5. 確認 template 是由伺服器還是 SillyTavern 套用,避免重複格式化。

  6. 若版本支援 profile,保存含 checkpoint、日期、API 類型與 template 負責層的基準設定。保存並不等於驗證。

介面標籤會隨版本改變,請核對兩端最新文件。不要用真實金鑰隨意測試其他 API。

保護金鑰與私人 prompt

將 API key 當密碼管理。分享前確認 profile 或截圖未包含金鑰,外洩後依服務商流程更換。本機 endpoint 也可能可從網路存取;遵循 bind 和 firewall 指引,勿將未認證伺服器公開至網際網路。

4. 先做短測試

先送出不含敏感資訊的簡單訊息,例如「請用一句話確認你收到這則訊息」。確認回覆正常後,再載入簡單角色卡跑兩輪,接著詢問前一輪的一項無害資訊。檢查 template 標記、重複角色名稱、空白回覆或異常文字。兩輪不能證明長上下文能力。

接著一次只加一層:lorebook、作者註記、長開場或擴充功能。大型角色卡可能超出後端實際 context,或假設另一套 template。若短測通過但完整角色卡失敗,先比對長度與格式,不要立刻改生成參數。

症狀可能層級優先檢查
無法連線伺服器/endpoint狀態、網址、路徑、port 與網路
認證錯誤金鑰/帳戶欄位、有效性與權限
找不到模型模型 ID服務商 alias 與 HF repo
空白回覆請求/伺服器API 類型、路徑、日誌、輸出上限
template 標記外露template用戶端與伺服器是否重複格式化
重複或迴圈prompt/設定角色卡重複、lore、context、stop
回覆很慢載入/硬體/佇列日誌、量化、任務數、prompt 長度
第一輪成功後失敗累積 context歷史對話與 lore 觸發

記錄 checkpoint、伺服器與 SillyTavern 版本、API 類型、最後變更和移除機密後的錯誤,一次只改一項。日誌可能含私人對話,請先在本機檢視,只分享最少且已遮蔽內容。

5. 連線穩定後再評估 RP

API 呼叫成功不代表文風符合喜好。比較模型時固定角色卡、prompt、context 和設定。觀察角色聲音、劇情推進、是否擅自控制使用者角色、是否尊重界線,以及能否使用近期資訊。記下範例和限制;單次好回覆不是整體評分。

不要假設 K2.6、K3 或其他模型的 preset 適用 K2。若後端為準確 checkpoint 公布建議參數,記錄來源並在連線穩定後再測。文風適用性另見Kimi K2 roleplay

將 Tabbit Browser 當作研究工作區

可在 Tabbit Browser 同時開啟模型卡、runtime 指南和 SillyTavern 文件,記錄各設定所依據的來源。本稿未用 Tabbit 測試 K2 伺服器;Tabbit 不託管模型,也不能取代 SillyTavern。推論由後端執行,RP 脈絡由 SillyTavern 組裝。瀏覽器無法驗證 API key 或 endpoint。

該選哪條路?

情境下一步
有相容硬體且想自行控制依 checkpoint 與 runtime 官方說明操作
想用託管 API等待明確列出 checkpoint 和 endpoint 的現行文件
只有 Kimi 網頁版確認是否有獨立且有文件的 API
可連線但文風不合固定連線設定,分開評估模型與角色卡
出現 template 標記確認哪一層套用 template

結論是:透過提供準確 checkpoint 和相容 API 的後端,才能將 Kimi K2 接入 SillyTavern。先核對版本及一手文件,只填有來源的值;先測簡單訊息,再加小型角色卡。若 endpoint 或 ID 沒有文件說明,不要自行猜測。

常見問題

SillyTavern 能自行執行 Kimi K2 嗎?

不能。它是組合 prompt 並連接後端的介面。你需要本機伺服器或託管服務,透過相容 API 提供準確 checkpoint。

要輸入哪個 Kimi K2 模型 ID?

使用後端針對該 checkpoint 或部署列出的 ID。moonshotai/Kimi-K2-Instruct 這個 HF repo 名稱不一定是 API alias。

該選 Chat Completion 還是 Text Completion?

依照後端文件選擇。此設定決定 SillyTavern 如何組裝 prompt,不是本機與雲端的差異。

可以本機執行 Kimi K2 嗎?

官方卡提供 vLLM 和 SGLang 範例。能否執行取決於 checkpoint、量化、硬體與 runtime;本指南沒有實際本機安裝測試。

為何有空白回覆、標記或重複?

先核對 endpoint 與 ID,再確認由哪一層套用 template。縮短 prompt 並逐步加入角色脈絡,之後才調整生成設定。

來源與草稿狀態

2026-09-23 已在 Tabbit 開啟核對Kimi K2-Instruct 官方模型卡Kimi K2 專案頁SillyTavern API Connections 文件。服務商、實際連線和輸出、價格/可用性、社群截圖及 Tabbit 整合仍未驗證,因此維持草稿。

常見問題

SillyTavern 會自行執行 Kimi K2 嗎?

不會。它是前端,需要本機推論伺服器或提供準確 checkpoint 的託管服務。

要填哪個模型 ID?

使用後端為準確 K2 版本列出的 ID;HF repo ID 不一定是 API alias。

選 Chat 還是 Text Completion?

依後端文件的提示詞格式選擇,並非本機與雲端的差異。

Kimi K2 能本機執行嗎?

模型卡列有本機部署範例;記憶體與速度須依 checkpoint 和硬體確認。

空白回覆先檢查什麼?

檢查 endpoint、模型 ID、連線及模板由哪一層套用,再用短提示詞測試。

下一步

讓 Tabbit 與你並肩工作。

跨分頁調研、自動化重複的瀏覽器工作,讓每一處上下文都觸手可及。