O Kimi K2.6 é o modelo multimodal geral da Moonshot para código de longa duração, imagens, vídeo, ferramentas e agentes. A API nativa usa kimi-k2.6 e documenta modos com e sem raciocínio. Ele não é o Kimi K2.7 Code nem outro nome para o Kimi K3.
O ponto de decisão é concreto, mas não deve ser exagerado: a Moonshot descreve um agente K2.6 que funcionou por mais de 12 horas, fez mais de 4.000 chamadas de ferramentas e elevou a inferência local do Qwen3.5-0.8B de cerca de 15 para 193 tokens/s. É uma demonstração do tipo de fluxo desejado, não uma promessa para seu harness. Veja a página do modelo Kimi K2.6 (English) e confirme a rota na sua conta.
Decisão rápida
Comece pelo K2.6 para agentes gerais com contexto longo, visão, vídeo e ferramentas.
Na API nativa, use
kimi-k2.6e registre modo, ferramentas e tokens.Compare o K2.7 Code quando o trabalho principal for implementar em repositórios.
Avalie o K3 separadamente se precisar do contexto de 1M e de suas capacidades próprias.
O caso das 4.000 chamadas e os benchmarks são hipóteses a testar, não garantias.
Agentes longos precisam de permissões mínimas, parada e rollback.
Kimi K2.6 em uma tabela
| Item | Evidência conferida em 20/09/2026 | Limite |
|---|---|---|
| ID nativo | kimi-k2.6 | Aliases de provedores podem variar. |
| Posição | Agente multimodal geral | K2.7 Code é uma rota distinta. |
| Contexto | 256K no guia; 262.144 na tabela | Confirme o limite efetivo. |
| Entrada | Texto, imagem e vídeo | Um provedor pode omitir modalidades. |
| Modos | Com e sem raciocínio | Uso de tokens e comportamento mudam. |
| API | $0.16/M cache hit, $0.95/M cache miss, $4/M saída | Impostos, ferramentas e tentativas à parte. |
| Pesos | modified-MIT, INT4, vLLM/SGLang/KTransformers | Hardware e operação exigem revisão. |
O que é um navegador agêntico separa uma sessão de navegador de uma API. Para a camada de produto, leia AI browser comparison e as práticas do Tabbit Browser.
O que o modelo é de fato
A Moonshot apresenta o K2.6 como mais forte que o K2.5 em código longo, seguimento de instruções, autocorreção e execução autônoma. O cartão do modelo lista um MoE de 1T total e 32B ativos, 384 especialistas, 8 selecionados por token, atenção MLA, codificador MoonViT de 400M e contexto de 256K. O guia da API inclui exemplos de imagem e vídeo.
O caso das 4.000 chamadas é interessante porque combina linguagem incomum, profiling repetido e 14 iterações. Ele também mostra por que estado das ferramentas, testes e condição de parada importam mais que uma demonstração de uma resposta. Registre ID, modo, ferramentas, tokens, tentativas e correções humanas.
Mudanças desde o K2.5
| Área | Informação pública | O que testar |
|---|---|---|
| Código longo | Rust, Go, Python, frontend, DevOps e otimização | A arquitetura permanece após várias edições? |
| Multimodalidade | Texto, imagem e vídeo | A rota escolhida expõe as mesmas entradas? |
| Agent Swarm | Até 300 subagentes e 4.000 passos, segundo o lançamento | É possível limitar custo, permissões e fan-out? |
| Execução persistente | Exemplos de agentes ativos por dias | Como interromper loop ou falha de ferramenta? |
Kimi K2.7 Code trata a rota de código com raciocínio forçado. O guia de preços do Kimi K3 trata o contexto de 1M e cache writes do K3; não é a tabela do K2.6. Para planejar a fixture, use também o guia de automação do navegador e os recursos de prompts do Kimi (English).
Como ler os benchmarks
A Moonshot informa 58,6 no SWE-Bench Pro, 66,7 no Terminal-Bench 2.0, 54,0 no HLE with tools, 83,2 no BrowseComp, 92,5 no DeepSearchQA F1, 73,1 no OSWorld-Verified e 89,6 no LiveCodeBench v6. O cartão do Hugging Face acrescenta 80,2 no SWE-Bench Verified, 76,7 no Multilingual e 50,0 no Toolathlon.
As linhas usam tarefas, ferramentas, versões e avaliadores diferentes. A CodingFleet lembra que 58,6 contra 58,4 do GLM-5.1 no SWE-Bench Pro é uma diferença de 0,2 ponto, pequena demais para decidir uma estratégia. A Artificial Analysis, em um retrato independente agora marcado como deprecated, mostra 35,8 tokens/s e descreve respostas lentas e verbosas; só continua atualizando o workload padrão de 10K tokens. As condições estão nas avaliações do Kimi (English).
Acesso sem misturar produtos
API Moonshot: selecione
kimi-k2.6e registre cache, raciocínio, ferramentas e saída.Kimi.ai, aplicativo e Kimi Code: cota de consumo e cobrança por tokens são coisas diferentes.
Pesos abertos: confira modified-MIT, memória e quantização na ficha do Hugging Face.
Provedores: ID, preço, modalidades e política de dados podem mudar. A página da DeepInfra mostra seus próprios preços e diz que não expõe entrada de imagem.
Tabbit: a ficha pública não comprova disponibilidade na conta.
Comunidade e riscos
No r/kimi, um usuário conta que um quebra-cabeça sobre leis de trânsito chinesas fez o K2.6 pensar por 27 minutos; depois ele buscou mais de dez problemas relacionados e ainda procurava após 32 minutos. É um sinal para testar loops de ferramentas e cota, não uma taxa geral de falhas. Outro tópico atribui ao Kimi vantagem no frontend multimodal e recomenda testes em um projeto com controle de versão. Não há fixture ou harness comum.
| Trabalho | Primeiro teste reversível | Aceitação |
|---|---|---|
| Repositório | Issue pequena, testes fixos, branch temporária | Diff limitado, testes verdes, parada prevista. |
| Imagem para código | Mockup público e checklist visual | Layout, interação e recursos separados. |
| Vídeo | Clipe público com eventos conhecidos | Cada afirmação aponta para timestamp. |
| Agent Swarm | Duas ou três subtarefas no início | Fan-out, permissões e tokens limitados. |
| Pesquisa longa | Corpus datado e formato de citações | Recuperação, fontes e parada conferidas. |
As incógnitas são paridade entre provedores, custo dos loops longos, verbosidade, velocidade local, diferença entre idiomas e conformidade de dados. 256K não garante coerência perfeita e pesos abertos não são um orçamento de hardware.
O que o Tabbit pode comprovar
Não foi executada uma tarefa autenticada do Kimi K2.6 no Tabbit e não foram obtidas quatro a oito capturas qualificadas. Portanto, o artigo não afirma nada sobre seletor, cota, latência, contexto efetivo, rota de provedor ou qualidade no Tabbit. Se o modelo aparecer, use uma imagem pública ou um repositório descartável e não envie código confidencial no primeiro teste.
Veredito
O Kimi K2.6 é um candidato real para código de contexto longo, entrada multimodal e agentes com ferramentas. As 4.000 chamadas mostram a ambição, não uma promessa. Use kimi-k2.6 para controlar modo e uso, compare K2.7 Code para código especializado e K3 para seu próprio contexto. Decida com uma fixture reversível, não com um título de leaderboard.
Fontes
Perguntas frequentes
O que é o Kimi K2.6?
É o modelo multimodal geral da Moonshot, exposto como `kimi-k2.6`. O guia oficial indica texto, imagem e vídeo, modos com e sem raciocínio, ferramentas e contexto de 256K.
Qual capacidade deve chamar atenção?
A Moonshot descreve mais de 4.000 chamadas de ferramentas ao longo de mais de 12 horas em um caso de implantação local. É uma demonstração do fornecedor, não uma garantia de sucesso ou latência.
Quanto custa?
A tabela da API nativa conferida em 20 de setembro de 2026 mostra 0,16 dólar por milhão de entrada com cache, 0,95 sem cache e 4 de saída, com uma linha de contexto de 262.144 tokens. Impostos, provedores e planos de consumo são separados.
É igual ao K2.7 Code ou ao K3?
Não. K2.6 é a rota geral, K2.7 Code é especializado em código e força o raciocínio, enquanto K3 é o novo flagship com outro contexto e preço. Benchmarks e tarifas não devem ser transferidos entre eles.
Como obter o Kimi K2.6?
A Moonshot indica Kimi.ai, o aplicativo Kimi, a API nativa e o Kimi Code. O Hugging Face também oferece pesos modified-MIT e caminhos de implantação; provedores podem expor capacidades e limites diferentes.
O Kimi K2.6 está no Tabbit?
Este artigo não executou uma tarefa autenticada do Kimi K2.6 no Tabbit. Confira o seletor e os termos da conta e faça um teste reversível antes de assumir disponibilidade, cota ou latência.