Kimi K2をSillyTavernで使うには、特定したK2チェックポイントを提供する別のバックエンドへ接続します。SillyTavernはキャラクターや会話の文脈を組み立てるクライアントで、モデルをホストしません。まずバージョンを確認し、ローカルサーバーか公式手順があるプロバイダーを選び、短いリクエストを試してからRP用の文脈を追加します。
このガイドはKimi-K2-Instructと、バックエンドが明示するK2更新版だけを対象にします。特定プロバイダー向けの手順ではありません。現在のホスト型endpoint、API alias、料金、上限、提供状況は検証していません。実際の接続再現が終わるまで草稿のままです。
要点
SillyTavernはクライアントです。Kimi K2を動かすサーバーまたはAPIが別に必要です。
正確なcheckpoint、revision、量子化、chat templateを確認します。公式ページはKimi-K2-Instruct-0905を案内しているため、別版の設定を混ぜないでください。
Hugging Faceのrepo IDがAPI aliasと同じとは限りません。
Chat CompletionsとText Completionsはprompt構築方式の違いで、ローカル/クラウドの区別ではありません。
接続、モデル、template、短い会話を個別に確認します。実際のK2 backendは未テストです。
接続を構成する要素
| 要素 | 役割 | 接続前の確認 |
|---|---|---|
| Checkpoint | モデル重みと動作を提供 | 版、revision、量子化、ライセンス、template |
| 推論サーバー | モデルをロードしAPIを公開 | 対応形式、version、path、address、template処理 |
| ホスト型provider | リモートでモデルを実行 | 正確なモデル、ID、認証、上限、料金、context、データ条件 |
| SillyTavern | 会話とキャラクター文脈を組み立て送信 | API typeとbackendが指定する設定 |
接続確認が成功しても、指定したcheckpointやtemplate、長時間会話の一貫性まで確認できたわけではありません。
1. Checkpointを確認する
古いpresetや動画の短い名称ではなく、公式Kimi K2-Instruct model cardを確認してください。カードにはvLLMとSGLangによるローカル配信例があり、Kimi-K2-Instruct-0905も案内されています。Kimi K2公式プロジェクトは0905で重みとcontextサポートが変わると記載しています。正確な名称とrevision、量子化の有無、runtime、templateを適用する側、requestに使うモデルIDを記録します。
公式例ではOpenAI互換のchat completions interfaceが示されています。しかし、どのproviderも同じendpointやIDを受け付ける証明ではありません。protocol互換性は機能、上限、policy、出力の同一性を保証しません。
K2.5、K2.6、K2.7 Code、K2.8、K3の設定を元のK2に流用しないでください。Kimi K2.6概要、Kimi K3 SillyTavern、Kimi K3設定はそれぞれ別版の情報です。
\n他モデルの資料は設定方針の違いを知る参考ですが、IDやpresetはK2へ流用できません。Mistral 24B、DeepSeek V4 Flash、GLM-5.3、Gemma 4は別のモデル経路です。Kimi K3 roleplayも別世代を扱います。\n
2. ローカルとproviderを選ぶ
| ルート | 向いているケース | 現行資料で確認すること | この草稿で不明なこと |
|---|---|---|---|
| ローカル推論サーバー | runtimeとendpointを自分で管理したい | checkpoint、engine、template、URL、hardware要件 | インストール、memory、速度は未測定 |
| ホスト型provider | 必要なcheckpointがcatalogに明記される | model ID、base URL、key、limits、料金、context、data handling | K2 providerのページを開いて接続していない |
| Kimi Web/App | 専用画面だけで使う | 別途APIが提供されるか | Webチャットや契約だけではAPI利用を確認できない |
ローカルではファイル、hardware、更新を自分で管理します。ホスト型ではproviderの現行仕様と規約に依存します。公式例はhardware推奨ではありません。量子化、context、memory、runtimeで条件が変わるため、active parameter数だけで必要構成を推定しないでください。
providerを使う場合は、現行のmodel catalogと接続ガイドを開きます。checkpoint、request format、認証欄、IDが記載されていなければ推測せず停止してください。
3. Backend仕様に沿って接続する
SillyTavern API Connections資料によると、Chat Completionsはrole別のmessageを作り、Text Completionsは会話を連続したtextにまとめます。これはprompt構築の選択で、ローカルかクラウドかを選ぶものではありません。
checkpointとruntimeの公式手順でserverを起動し、serverのready表示を確認します。
SillyTavernのAPI Connectionsでbackend資料が指定するtypeを選びます。OpenAI互換という情報だけでUI選択やpathを決めないでください。
URLとcredentialを所定の欄に入力します。keyをキャラクターカード、共有preset、画像、public promptに入れないでください。
backendが受理するmodel IDを使います。HF repo名とは異なる場合があります。
templateをserverとSillyTavernのどちらが適用するか確認します。二重適用を避けます。
profilesが使える場合、checkpoint、日付、API type、template担当を記録した基準profileを保存します。保存は設定値の検証ではありません。
SillyTavernやproviderの画面・資料は更新されます。両側の現行資料を確認し、実キーで別APIを試さないでください。
Credentialと会話内容を守る
API keyはpassword同様に扱います。profileやscreenshotに含まれていないか確認し、漏えいしたらproviderの手順で更新してください。ローカルendpointもネットワークから到達可能な場合があります。bindやfirewallの説明に従い、認証のないserverを公開ネットワークへ出さないでください。
4. 短いスモークテスト
まず「受信確認として一文で返答してください」のような簡単なpromptを使います。通常のassistant応答が返ることを確認します。次に単純なcharacter cardで二往復し、直前の無害な情報を参照する追加質問をします。template marker、role名の重複、空応答、不自然な本文を確認します。二往復で長期記憶は証明できません。
lorebook、author note、長いgreeting、extensionは一つずつ追加します。長いカードが実際のcontextを超えたり別templateを前提にしたりすることがあります。短い試験が通って長いカードだけ失敗するなら、生成設定を変える前にサイズと形式を比較します。
| 症状 | 主な層 | 最初の確認 |
|---|---|---|
| 接続不可 | server/endpoint | 起動状態、URL、path、port、network |
| 認証エラー | key/account | 欄、keyの有効性、権限 |
| model not found | model ID | provider aliasとHF repo ID |
| 空応答 | request/server | API type、path、log、出力上限 |
| markerが見える | template | client/server双方が整形していないか |
| 繰り返し | prompt/settings | card重複、lore、context、stop |
| 応答が遅い | load/hardware/queue | log、量子化、job、prompt長 |
| 1ターン目後に失敗 | 累積context | history、lore activation |
checkpoint、serverとSillyTavernの版、API type、最後に変えた項目、秘匿情報を除いたエラーを記録し、一度に一項目だけ変更します。ログやterminalにはprivateな会話が含まれることがあるため、共有前にローカルで確認してください。
5. 接続後にRPを評価する
API callが成功しても好みの文体かは分かりません。モデル比較ではカード、prompt、context、設定を固定します。声の維持、ユーザーのキャラクターを勝手に操作しないこと、境界の尊重、最近の情報の利用を確認します。よい例と限界を記録します。一つの応答を総合評価にしないでください。
K2.6、K3、他モデルのpresetがK2に合うとは限りません。正確なcheckpoint用の推奨設定がbackendにあれば出典を記録し、接続が安定してから試します。文体の適性は別記事のKimi K2 roleplayを参照してください。
調査用ワークスペースとしてのTabbit Browser
Tabbit Browserでmodel card、runtime手順、SillyTavern資料を開き、各設定を定義する出典をメモできます。この用途でKimi K2 serverをテストしていません。Tabbitはmodel hostでもSillyTavernの代替でもありません。推論はbackend、RP文脈はSillyTavernで扱います。API keyやendpointの動作確認はできません。
どのルートを選ぶ?
| 状況 | 次の手順 |
|---|---|
| 対応hardwareがあり制御したい | checkpointとruntimeの公式手順を確認 |
| hosted APIを使いたい | 正確なcheckpointとendpointの現行資料を待つ |
| KimiのWebだけ使える | 別のAPI製品と公開手順の有無を確認 |
| 接続できるが文体が合わない | 接続設定を固定し、モデルとカードを評価 |
| markerが漏れる | templateを適用する層を特定 |
まとめると、正確なcheckpointを提供する互換backendを通じて接続します。版と一次資料を確認し、記載された値だけを使い、短文の後に小さなカードで試します。endpointやIDが資料にない場合は推測しないでください。
よくある質問
SillyTavernだけでKimi K2を実行できますか?
できません。SillyTavernはpromptを組み立ててbackendへ接続するUIです。正確なcheckpointを互換APIで提供するローカルserverまたはhosted serviceが必要です。
どのmodel IDを入力しますか?
checkpointまたはdeploymentについてbackendが指定するIDを使います。moonshotai/Kimi-K2-InstructというHF repo名がproviderのAPI aliasとは限りません。
Chat CompletionとText Completionのどちらですか?
backendの資料に従います。SillyTavernがpromptをどう構成するかの違いで、ローカル/クラウドの区別ではありません。
ローカル実行できますか?
公式cardにはvLLMとSGLangの例があります。実際の可否はcheckpoint、量子化、hardware、runtime次第で、このガイドではインストール未検証です。
空応答、marker、繰り返しが出るのはなぜですか?
endpointとIDを確認してから、どの層がtemplateを適用するかを調べます。promptを短くし、生成設定を変える前に文脈を少しずつ追加します。
出典と草稿状態
公式Kimi K2-Instruct card、Kimi K2 project、SillyTavern API Connectionsを2026-09-23にTabbitで確認しました。provider、実接続、生成結果、価格/提供状況、community screenshot、Tabbit連携は未検証です。草稿を維持します。
よくある質問
SillyTavernだけで Kimi K2 を実行できますか?
いいえ。正確なモデルを提供するローカルサーバーかホスト型サービスが必要です。
どの ID を入力しますか?
バックエンド指定の ID を使います。HF のリポジトリ ID と API alias は異なる場合があります。
Chat と Text Completion のどちら?
バックエンドのprompt形式に従います。クラウド/ローカルの区別ではありません。
ローカル実行は可能?
カードには例があります。メモリと速度はモデルやハードウェア次第です。
空応答では何を確認しますか?
endpoint、ID、接続、templateの担当層を確認して短い入力で再試行します。