Kimi K2.6はMoonshotの汎用マルチモーダルモデルです。長時間のコーディング、画像・動画理解、ツール呼び出し、Agentワークフローを対象にし、ネイティブAPIでは kimi-k2.6 を使います。K2.7 CodeやK3の別名ではありません。
判断の軸は、Moonshotが示した具体例です。K2.6 AgentがローカルのQwen3.5-0.8Bを最適化しながら12時間以上動き、4,000回以上のツール呼び出しを行い、推論速度を約15から約193 token/sに上げたと説明されています。これは長時間処理の方向性を示すベンダー事例で、あなたのharnessの速度や成功率ではありません。まず Kimi K2.6モデルページ (English)を読み、実際のアカウントの経路を確認してください。
先に結論
長い文脈、画像、動画、ツールを使う汎用Agentの候補です。
新しいAPIでは
kimi-k2.6を指定し、モードと使用量を記録します。リポジトリ実装が中心ならK2.7 Codeを別に試します。
1M文脈とK3の能力が必要ならK3を独立に評価します。
4,000回の事例やベンダーbenchmarkは仮説であり、保証ではありません。
仕様
| 項目 | 2026-09-20の確認内容 | 境界 |
|---|---|---|
| API ID | kimi-k2.6 | プロバイダーの別名は異なる場合があります。 |
| 位置づけ | 汎用マルチモーダルAgent | K2.7 Codeは別ルートです。 |
| 文脈 | ガイド256K、料金表262,144 | クライアントの実効値を確認します。 |
| 入力 | テキスト、画像、動画 | プロバイダーが全て公開するとは限りません。 |
| モード | 思考・非思考 | token使用量と挙動が変わります。 |
| 料金 | cache hit $0.16/M、miss $0.95/M、出力 $4/M | 税、ツール、再試行、プロバイダー料金は別です。 |
| ウェイト | modified-MIT、INT4、vLLM/SGLang/KTransformers | ハードウェアと運用を別途確認します。 |
エージェントブラウザーとはでブラウザーセッションとAPIを区別できます。製品の判断には AIブラウザー比較と Tabbit Browserの実践も使ってください。
K2.6の中身とK2.5からの変化
MoonshotはK2.6について、長時間のコード作成、指示遵守、自己修正、自律実行がK2.5より強いと説明します。モデルカードは1T総パラメータ、32B活性、384 experts、tokenごとに8 experts、MLA、400M MoonViT、256K文脈を示します。公式ガイドには画像と動画のAPI例があります。
| 方向 | 公開情報 | 試すべきこと |
|---|---|---|
| 長時間コード | Rust、Go、Python、frontend、DevOps、最適化 | 複数回の編集後も設計を保つか。 |
| マルチモーダル | テキスト、画像、動画 | 選んだ経路で同じ入力が使えるか。 |
| Agent Swarm | 最大300 sub-agents、4,000 stepsという説明 | fan-out、費用、権限を制限できるか。 |
| 継続実行 | 数日動くAgentの例 | ツール失敗やループをどう止めるか。 |
Kimi K2.7 Codeは強制思考のコード特化ルートを扱います。Kimi K3料金ガイドは1M文脈とcache writeを扱うため、K2.6の事実として流用しません。試験の組み立てにはブラウザー自動化ガイドとKimi prompt資料 (English)を使います。
ベンチマークの読み方
MoonshotはSWE-Bench Pro 58.6、Terminal-Bench 2.0 66.7、HLE with tools 54.0、BrowseComp 83.2、DeepSearchQA F1 92.5、OSWorld-Verified 73.1、LiveCodeBench v6 89.6を報告しています。Hugging FaceカードにはSWE-Bench Verified 80.2、Multilingual 76.7、Toolathlon 50.0などもあります。
タスク、ツール、版、評価者が異なるため、一つの点数にまとめません。CodingFleetはGLM-5.1とのSWE-Bench Proが58.6対58.4で、0.2点差を戦略にしないよう注意します。Artificial Analysisは独立スナップショットで35.8 token/s、遅く冗長という説明を掲載していますが、現在はdeprecatedで10K入力の既定ワークロードだけ更新しています。条件は Kimi reviews (English)で確認してください。
入手経路
Moonshot API:
kimi-k2.6を選び、cache、思考、ツール、出力tokenを保存する。Kimi.ai、アプリ、Kimi Code:消費者のquotaとAPIのtoken課金を混同しない。
オープンウェイト: Hugging Faceのmodified-MIT、メモリ、量子化を確認する。
プロバイダー: ID、料金、入力モダリティ、データ方針が異なる。DeepInfraは独自料金を示し、画像入力を公開していません。
Tabbit:公開モデルカードではアカウント内の提供を証明できません。
コミュニティとリスク
r/kimiの利用者は中国の交通法規に関するパズルで、K2.6が27分考えた後に関連問題を10回以上検索し、32分後も答えなかったと報告しました。これはツールループとquotaをテストする材料で、一般的な失敗率ではありません。別のスレッドでは、Kimiをマルチモーダルfrontend向け、GLMを別のbackend向けとする意見があり、版管理した実プロジェクトで比べるよう勧めています。共通fixtureやharnessはありません。
| 用途 | 最初の可逆テスト | 合格条件 |
|---|---|---|
| リポジトリ | 小さなissue、固定テスト、temporary branch | diff、テスト、停止条件が一致。 |
| 画像からコード | 公開mockupとvisual checklist | レイアウト、操作、素材を別々に確認。 |
| 動画理解 | 既知イベントの短い公開動画 | 各主張をtimestampに結びつける。 |
| Agent Swarm | まず2〜3 subtaskに制限 | fan-out、権限、tokenを上限内にする。 |
| 長文調査 | 日付付きcorpusと引用形式 | 検索、引用、停止条件を確認。 |
主な未知はプロバイダー間の差、長いループの費用、冗長出力、ローカル速度、言語別の差、データ規制です。256Kは全tokenの一貫した推論を保証せず、open weightsはハードウェア見積りではありません。
Tabbitで分かること
認証済みのKimi K2.6 Tabbitタスクは実行しておらず、4–8枚の適格なスクリーンショットもありません。Tabbitのselector、quota、遅延、実効文脈、provider、品質について主張しません。アカウントに表示されたら公開画像か捨てられるリポジトリで試し、引用と変更を確認してください。最初から機密コードを渡さないでください。
判定
Kimi K2.6は長文脈コード、マルチモーダル入力、ツールAgentの候補です。4,000回の事例は方向性を示しますが、ベンダーのショーケースです。モードと使用量を制御したいなら kimi-k2.6、コード特化ならK2.7 Code、1M文脈と別の料金が必要ならK3を比較し、最後は可逆的なfixtureで決めます。
出典
よくある質問
Kimi K2.6とは何ですか?
Moonshotの汎用マルチモーダルAgentモデルで、APIでは `kimi-k2.6` と呼ばれます。公式ガイドはテキスト、画像、動画入力、思考・非思考モード、ツール、256K文脈を示しています。
最も重要な能力は何ですか?
Moonshotはローカル推論を12時間以上続け、4,000回以上のツール呼び出しを行った例を紹介しています。これは長時間実行のショーケースであり、成功率や遅延の保証ではありません。
料金はいくらですか?
2026年9月20日に確認したネイティブAPI表は、キャッシュヒット入力0.16ドル、ミス入力0.95ドル、出力4ドル(100万トークンあたり)で、262,144トークンの行を掲載しています。税、プロバイダー、消費者プランは別です。
K2.7 CodeやK3と同じですか?
違います。K2.6は汎用、K2.7 Codeは思考を強制するコード特化、K3は別の1M文脈と価格を持つ新しい旗艦です。各モデルのベンチマークや料金を混ぜてはいけません。
どう入手できますか?
MoonshotはKimi.ai、Kimiアプリ、ネイティブAPI、Kimi Codeでの提供を案内しています。Hugging Faceにはmodified-MITのウェイトと導入経路がありますが、プロバイダーごとに機能と制限が異なります。
Tabbitで使えますか?
この記事では認証済みのKimi K2.6 Tabbitタスクを実行していません。ライブのモデル選択とアカウント条件を確認し、可逆的な小タスクで試してください。