要在 SillyTavern 使用 Kimi K2,必須連接能提供明確 K2 checkpoint 的獨立後端。SillyTavern 負責組合角色與對話脈絡,不會託管模型。先確認版本,選擇本機推論伺服器或有文件的服務商,再用簡單請求測試,之後才加入角色扮演脈絡。
本文只涵蓋 Kimi-K2-Instruct,以及後端明確標示的 K2 更新版本。這不是特定服務商的設定教學:目前託管 endpoint、API alias、價格、額度和可用性都尚未核實。實際連線重現前,文章維持草稿。
重點整理
SillyTavern 是用戶端;仍需另一個模型伺服器或 API 執行 Kimi K2。
核對準確 checkpoint、revision、量化方式與 chat template。官方頁面另指向 Kimi-K2-Instruct-0905,不要混用版本設定。
Hugging Face repo ID 不一定等於服務商的 API alias。
Chat Completions 和 Text Completions 是 prompt 組合方式,不代表雲端或本機。
分別確認連線、模型、template 和短對話。本稿未連接真實 K2 後端。
連線的組成部分
| 部分 | 功能 | 連線前確認 |
|---|---|---|
| Checkpoint | 提供模型權重與行為 | 版本、revision、量化、授權與 template |
| 推論伺服器 | 載入模型並提供 API | 格式、版本、路徑、網址與 template 處理 |
| 託管服務 | 遠端執行模型 | 準確模型、ID、認證、限制、價格、context 和資料條款 |
| SillyTavern | 組合角色與對話脈絡並送出 | 後端文件指定的 API 類型與設定 |
連線測試成功只能表示 endpoint 可連到,不能證明載入的是目標 checkpoint、template 正確或長對話穩定。
1. 先確認 checkpoint
請從Kimi K2-Instruct 官方模型卡開始,而非舊 preset 或影片簡稱。模型卡列出 vLLM 和 SGLang 本機服務範例,也指向 Kimi-K2-Instruct-0905。Kimi K2 專案頁說明 0905 更新涉及權重與 context 支援。部署前記下完整名稱與 revision、量化版本、runtime、template 的處理層,以及請求採用的模型 ID。
官方範例呈現 OpenAI-compatible chat completions 介面,但不代表任意服務商都使用相同 endpoint 或 ID。協定相容不保證功能、限制、政策或輸出一致。
不要以 K2.5、K2.6、K2.7 Code、K2.8 或 K3 步驟補足原版 K2 的設定。Kimi K2.6 概覽、Kimi K3 SillyTavern和K3 設定指南都是各自版本的資料,不是 K2 preset。
\n其他模型教學可用來了解不同接入路徑,但其 ID 和 preset 不能直接套用於 K2。可另看 Mistral 24B、DeepSeek V4 Flash、GLM-5.3 和 Gemma 4 的獨立路徑。Kimi K3 roleplay談的是另一代模型。\n
2. 選擇本機服務或服務商
| 路徑 | 適用情況 | 目前文件需核對 | 本稿尚未知 |
|---|---|---|---|
| 本機推論伺服器 | 想自行管理 runtime 與 endpoint | checkpoint、引擎、template、網址與硬體指引 | 未測試安裝、記憶體、延遲或速度 |
| 託管服務 | 目錄明確列出所需 checkpoint | model ID、base URL、金鑰、限制、價格、context 與資料處理 | 未開啟或測試 K2 服務商 |
| Kimi Web/App | 只用官方介面 | 是否有獨立且有文件的 API 產品 | 消費者聊天不等於 API 權限 |
本機需要管理模型檔案、硬體與更新;託管則受服務商現行條款和說明限制。模型卡範例不是硬體建議,量化、context、記憶體與 runtime 都會影響需求,不應只根據啟用參數數量估算。
使用託管服務時,開啟最新模型目錄與連線指南。若 checkpoint、請求格式、認證欄位或 ID 未明確記載,就先停止,不要猜值。
3. 依照後端契約連線
SillyTavern API Connections 文件說明,Chat Completions 會按角色組織訊息;Text Completions 則把對話組合成連續文字。這個選項影響 prompt 組裝,不代表本機或雲端。
依 checkpoint 和 runtime 的官方流程啟動伺服器,等待伺服器顯示就緒。
在 API Connections 選擇後端文件指定的類型。僅憑 OpenAI-compatible 無法推定確切選項或路徑。
將網址和憑證填入指定欄位,依現行文件複製。勿把金鑰放入角色卡、共享 preset、截圖或公開 prompt。
使用後端接受的模型 ID,可能不同於 HF repo 名稱。
確認 template 是由伺服器還是 SillyTavern 套用,避免重複格式化。
若版本支援 profile,保存含 checkpoint、日期、API 類型與 template 負責層的基準設定。保存並不等於驗證。
介面標籤會隨版本改變,請核對兩端最新文件。不要用真實金鑰隨意測試其他 API。
保護金鑰與私人 prompt
將 API key 當密碼管理。分享前確認 profile 或截圖未包含金鑰,外洩後依服務商流程更換。本機 endpoint 也可能可從網路存取;遵循 bind 和 firewall 指引,勿將未認證伺服器公開至網際網路。
4. 先做短測試
先送出不含敏感資訊的簡單訊息,例如「請用一句話確認你收到這則訊息」。確認回覆正常後,再載入簡單角色卡跑兩輪,接著詢問前一輪的一項無害資訊。檢查 template 標記、重複角色名稱、空白回覆或異常文字。兩輪不能證明長上下文能力。
接著一次只加一層:lorebook、作者註記、長開場或擴充功能。大型角色卡可能超出後端實際 context,或假設另一套 template。若短測通過但完整角色卡失敗,先比對長度與格式,不要立刻改生成參數。
| 症狀 | 可能層級 | 優先檢查 |
|---|---|---|
| 無法連線 | 伺服器/endpoint | 狀態、網址、路徑、port 與網路 |
| 認證錯誤 | 金鑰/帳戶 | 欄位、有效性與權限 |
| 找不到模型 | 模型 ID | 服務商 alias 與 HF repo |
| 空白回覆 | 請求/伺服器 | API 類型、路徑、日誌、輸出上限 |
| template 標記外露 | template | 用戶端與伺服器是否重複格式化 |
| 重複或迴圈 | prompt/設定 | 角色卡重複、lore、context、stop |
| 回覆很慢 | 載入/硬體/佇列 | 日誌、量化、任務數、prompt 長度 |
| 第一輪成功後失敗 | 累積 context | 歷史對話與 lore 觸發 |
記錄 checkpoint、伺服器與 SillyTavern 版本、API 類型、最後變更和移除機密後的錯誤,一次只改一項。日誌可能含私人對話,請先在本機檢視,只分享最少且已遮蔽內容。
5. 連線穩定後再評估 RP
API 呼叫成功不代表文風符合喜好。比較模型時固定角色卡、prompt、context 和設定。觀察角色聲音、劇情推進、是否擅自控制使用者角色、是否尊重界線,以及能否使用近期資訊。記下範例和限制;單次好回覆不是整體評分。
不要假設 K2.6、K3 或其他模型的 preset 適用 K2。若後端為準確 checkpoint 公布建議參數,記錄來源並在連線穩定後再測。文風適用性另見Kimi K2 roleplay。
將 Tabbit Browser 當作研究工作區
可在 Tabbit Browser 同時開啟模型卡、runtime 指南和 SillyTavern 文件,記錄各設定所依據的來源。本稿未用 Tabbit 測試 K2 伺服器;Tabbit 不託管模型,也不能取代 SillyTavern。推論由後端執行,RP 脈絡由 SillyTavern 組裝。瀏覽器無法驗證 API key 或 endpoint。
該選哪條路?
| 情境 | 下一步 |
|---|---|
| 有相容硬體且想自行控制 | 依 checkpoint 與 runtime 官方說明操作 |
| 想用託管 API | 等待明確列出 checkpoint 和 endpoint 的現行文件 |
| 只有 Kimi 網頁版 | 確認是否有獨立且有文件的 API |
| 可連線但文風不合 | 固定連線設定,分開評估模型與角色卡 |
| 出現 template 標記 | 確認哪一層套用 template |
結論是:透過提供準確 checkpoint 和相容 API 的後端,才能將 Kimi K2 接入 SillyTavern。先核對版本及一手文件,只填有來源的值;先測簡單訊息,再加小型角色卡。若 endpoint 或 ID 沒有文件說明,不要自行猜測。
常見問題
SillyTavern 能自行執行 Kimi K2 嗎?
不能。它是組合 prompt 並連接後端的介面。你需要本機伺服器或託管服務,透過相容 API 提供準確 checkpoint。
要輸入哪個 Kimi K2 模型 ID?
使用後端針對該 checkpoint 或部署列出的 ID。moonshotai/Kimi-K2-Instruct 這個 HF repo 名稱不一定是 API alias。
該選 Chat Completion 還是 Text Completion?
依照後端文件選擇。此設定決定 SillyTavern 如何組裝 prompt,不是本機與雲端的差異。
可以本機執行 Kimi K2 嗎?
官方卡提供 vLLM 和 SGLang 範例。能否執行取決於 checkpoint、量化、硬體與 runtime;本指南沒有實際本機安裝測試。
為何有空白回覆、標記或重複?
先核對 endpoint 與 ID,再確認由哪一層套用 template。縮短 prompt 並逐步加入角色脈絡,之後才調整生成設定。
來源與草稿狀態
2026-09-23 已在 Tabbit 開啟核對Kimi K2-Instruct 官方模型卡、Kimi K2 專案頁與SillyTavern API Connections 文件。服務商、實際連線和輸出、價格/可用性、社群截圖及 Tabbit 整合仍未驗證,因此維持草稿。
常見問題
SillyTavern 會自行執行 Kimi K2 嗎?
不會。它是前端,需要本機推論伺服器或提供準確 checkpoint 的託管服務。
要填哪個模型 ID?
使用後端為準確 K2 版本列出的 ID;HF repo ID 不一定是 API alias。
選 Chat 還是 Text Completion?
依後端文件的提示詞格式選擇,並非本機與雲端的差異。
Kimi K2 能本機執行嗎?
模型卡列有本機部署範例;記憶體與速度須依 checkpoint 和硬體確認。
空白回覆先檢查什麼?
檢查 endpoint、模型 ID、連線及模板由哪一層套用,再用短提示詞測試。