TabbitBlog

Kimi K2 を SillyTavern に接続:設定とトラブル対応

ローカルまたはホスト型バックエンドで Kimi K2 checkpoint を接続し、各層を確認します。

この記事の内容
  1. 要点
  2. 接続を構成する要素
  3. 1. Checkpointを確認する
  4. 2. ローカルとproviderを選ぶ
  5. 3. Backend仕様に沿って接続する
  6. Credentialと会話内容を守る
  7. 4. 短いスモークテスト
  8. 5. 接続後にRPを評価する
  9. 調査用ワークスペースとしてのTabbit Browser
  10. どのルートを選ぶ?
  11. よくある質問
  12. SillyTavernだけでKimi K2を実行できますか?
  13. どのmodel IDを入力しますか?
  14. Chat CompletionとText Completionのどちらですか?
  15. ローカル実行できますか?
  16. 空応答、marker、繰り返しが出るのはなぜですか?
  17. 出典と草稿状態

Kimi K2をSillyTavernで使うには、特定したK2チェックポイントを提供する別のバックエンドへ接続します。SillyTavernはキャラクターや会話の文脈を組み立てるクライアントで、モデルをホストしません。まずバージョンを確認し、ローカルサーバーか公式手順があるプロバイダーを選び、短いリクエストを試してからRP用の文脈を追加します。

このガイドはKimi-K2-Instructと、バックエンドが明示するK2更新版だけを対象にします。特定プロバイダー向けの手順ではありません。現在のホスト型endpoint、API alias、料金、上限、提供状況は検証していません。実際の接続再現が終わるまで草稿のままです。

要点

  • SillyTavernはクライアントです。Kimi K2を動かすサーバーまたはAPIが別に必要です。

  • 正確なcheckpoint、revision、量子化、chat templateを確認します。公式ページはKimi-K2-Instruct-0905を案内しているため、別版の設定を混ぜないでください。

  • Hugging Faceのrepo IDがAPI aliasと同じとは限りません。

  • Chat CompletionsとText Completionsはprompt構築方式の違いで、ローカル/クラウドの区別ではありません。

  • 接続、モデル、template、短い会話を個別に確認します。実際のK2 backendは未テストです。

接続を構成する要素

要素役割接続前の確認
Checkpointモデル重みと動作を提供版、revision、量子化、ライセンス、template
推論サーバーモデルをロードしAPIを公開対応形式、version、path、address、template処理
ホスト型providerリモートでモデルを実行正確なモデル、ID、認証、上限、料金、context、データ条件
SillyTavern会話とキャラクター文脈を組み立て送信API typeとbackendが指定する設定

接続確認が成功しても、指定したcheckpointやtemplate、長時間会話の一貫性まで確認できたわけではありません。

1. Checkpointを確認する

古いpresetや動画の短い名称ではなく、公式Kimi K2-Instruct model cardを確認してください。カードにはvLLMとSGLangによるローカル配信例があり、Kimi-K2-Instruct-0905も案内されています。Kimi K2公式プロジェクトは0905で重みとcontextサポートが変わると記載しています。正確な名称とrevision、量子化の有無、runtime、templateを適用する側、requestに使うモデルIDを記録します。

公式例ではOpenAI互換のchat completions interfaceが示されています。しかし、どのproviderも同じendpointやIDを受け付ける証明ではありません。protocol互換性は機能、上限、policy、出力の同一性を保証しません。

K2.5、K2.6、K2.7 Code、K2.8、K3の設定を元のK2に流用しないでください。Kimi K2.6概要Kimi K3 SillyTavernKimi K3設定はそれぞれ別版の情報です。

\n他モデルの資料は設定方針の違いを知る参考ですが、IDやpresetはK2へ流用できません。Mistral 24BDeepSeek V4 FlashGLM-5.3Gemma 4は別のモデル経路です。Kimi K3 roleplayも別世代を扱います。\n

2. ローカルとproviderを選ぶ

ルート向いているケース現行資料で確認することこの草稿で不明なこと
ローカル推論サーバーruntimeとendpointを自分で管理したいcheckpoint、engine、template、URL、hardware要件インストール、memory、速度は未測定
ホスト型provider必要なcheckpointがcatalogに明記されるmodel ID、base URL、key、limits、料金、context、data handlingK2 providerのページを開いて接続していない
Kimi Web/App専用画面だけで使う別途APIが提供されるかWebチャットや契約だけではAPI利用を確認できない

ローカルではファイル、hardware、更新を自分で管理します。ホスト型ではproviderの現行仕様と規約に依存します。公式例はhardware推奨ではありません。量子化、context、memory、runtimeで条件が変わるため、active parameter数だけで必要構成を推定しないでください。

providerを使う場合は、現行のmodel catalogと接続ガイドを開きます。checkpoint、request format、認証欄、IDが記載されていなければ推測せず停止してください。

3. Backend仕様に沿って接続する

SillyTavern API Connections資料によると、Chat Completionsはrole別のmessageを作り、Text Completionsは会話を連続したtextにまとめます。これはprompt構築の選択で、ローカルかクラウドかを選ぶものではありません。

  1. checkpointとruntimeの公式手順でserverを起動し、serverのready表示を確認します。

  2. SillyTavernのAPI Connectionsでbackend資料が指定するtypeを選びます。OpenAI互換という情報だけでUI選択やpathを決めないでください。

  3. URLとcredentialを所定の欄に入力します。keyをキャラクターカード、共有preset、画像、public promptに入れないでください。

  4. backendが受理するmodel IDを使います。HF repo名とは異なる場合があります。

  5. templateをserverとSillyTavernのどちらが適用するか確認します。二重適用を避けます。

  6. profilesが使える場合、checkpoint、日付、API type、template担当を記録した基準profileを保存します。保存は設定値の検証ではありません。

SillyTavernやproviderの画面・資料は更新されます。両側の現行資料を確認し、実キーで別APIを試さないでください。

Credentialと会話内容を守る

API keyはpassword同様に扱います。profileやscreenshotに含まれていないか確認し、漏えいしたらproviderの手順で更新してください。ローカルendpointもネットワークから到達可能な場合があります。bindやfirewallの説明に従い、認証のないserverを公開ネットワークへ出さないでください。

4. 短いスモークテスト

まず「受信確認として一文で返答してください」のような簡単なpromptを使います。通常のassistant応答が返ることを確認します。次に単純なcharacter cardで二往復し、直前の無害な情報を参照する追加質問をします。template marker、role名の重複、空応答、不自然な本文を確認します。二往復で長期記憶は証明できません。

lorebook、author note、長いgreeting、extensionは一つずつ追加します。長いカードが実際のcontextを超えたり別templateを前提にしたりすることがあります。短い試験が通って長いカードだけ失敗するなら、生成設定を変える前にサイズと形式を比較します。

症状主な層最初の確認
接続不可server/endpoint起動状態、URL、path、port、network
認証エラーkey/account欄、keyの有効性、権限
model not foundmodel IDprovider aliasとHF repo ID
空応答request/serverAPI type、path、log、出力上限
markerが見えるtemplateclient/server双方が整形していないか
繰り返しprompt/settingscard重複、lore、context、stop
応答が遅いload/hardware/queuelog、量子化、job、prompt長
1ターン目後に失敗累積contexthistory、lore activation

checkpoint、serverとSillyTavernの版、API type、最後に変えた項目、秘匿情報を除いたエラーを記録し、一度に一項目だけ変更します。ログやterminalにはprivateな会話が含まれることがあるため、共有前にローカルで確認してください。

5. 接続後にRPを評価する

API callが成功しても好みの文体かは分かりません。モデル比較ではカード、prompt、context、設定を固定します。声の維持、ユーザーのキャラクターを勝手に操作しないこと、境界の尊重、最近の情報の利用を確認します。よい例と限界を記録します。一つの応答を総合評価にしないでください。

K2.6、K3、他モデルのpresetがK2に合うとは限りません。正確なcheckpoint用の推奨設定がbackendにあれば出典を記録し、接続が安定してから試します。文体の適性は別記事のKimi K2 roleplayを参照してください。

調査用ワークスペースとしてのTabbit Browser

Tabbit Browserでmodel card、runtime手順、SillyTavern資料を開き、各設定を定義する出典をメモできます。この用途でKimi K2 serverをテストしていません。Tabbitはmodel hostでもSillyTavernの代替でもありません。推論はbackend、RP文脈はSillyTavernで扱います。API keyやendpointの動作確認はできません。

どのルートを選ぶ?

状況次の手順
対応hardwareがあり制御したいcheckpointとruntimeの公式手順を確認
hosted APIを使いたい正確なcheckpointとendpointの現行資料を待つ
KimiのWebだけ使える別のAPI製品と公開手順の有無を確認
接続できるが文体が合わない接続設定を固定し、モデルとカードを評価
markerが漏れるtemplateを適用する層を特定

まとめると、正確なcheckpointを提供する互換backendを通じて接続します。版と一次資料を確認し、記載された値だけを使い、短文の後に小さなカードで試します。endpointやIDが資料にない場合は推測しないでください。

よくある質問

SillyTavernだけでKimi K2を実行できますか?

できません。SillyTavernはpromptを組み立ててbackendへ接続するUIです。正確なcheckpointを互換APIで提供するローカルserverまたはhosted serviceが必要です。

どのmodel IDを入力しますか?

checkpointまたはdeploymentについてbackendが指定するIDを使います。moonshotai/Kimi-K2-InstructというHF repo名がproviderのAPI aliasとは限りません。

Chat CompletionとText Completionのどちらですか?

backendの資料に従います。SillyTavernがpromptをどう構成するかの違いで、ローカル/クラウドの区別ではありません。

ローカル実行できますか?

公式cardにはvLLMとSGLangの例があります。実際の可否はcheckpoint、量子化、hardware、runtime次第で、このガイドではインストール未検証です。

空応答、marker、繰り返しが出るのはなぜですか?

endpointとIDを確認してから、どの層がtemplateを適用するかを調べます。promptを短くし、生成設定を変える前に文脈を少しずつ追加します。

出典と草稿状態

公式Kimi K2-Instruct cardKimi K2 projectSillyTavern API Connectionsを2026-09-23にTabbitで確認しました。provider、実接続、生成結果、価格/提供状況、community screenshot、Tabbit連携は未検証です。草稿を維持します。

よくある質問

SillyTavernだけで Kimi K2 を実行できますか?

いいえ。正確なモデルを提供するローカルサーバーかホスト型サービスが必要です。

どの ID を入力しますか?

バックエンド指定の ID を使います。HF のリポジトリ ID と API alias は異なる場合があります。

Chat と Text Completion のどちら?

バックエンドのprompt形式に従います。クラウド/ローカルの区別ではありません。

ローカル実行は可能?

カードには例があります。メモリと速度はモデルやハードウェア次第です。

空応答では何を確認しますか?

endpoint、ID、接続、templateの担当層を確認して短い入力で再試行します。

次のステップへ

Tabbit と一緒に仕事をしましょう。

タブをまたいで調査し、繰り返しのブラウザ作業を自動化し、あらゆる文脈を手の届くところに。