TabbitBlog

Preço do Kimi K3: custo de API, assinaturas e cálculo de orçamento

Entenda as tarifas oficiais do Kimi K3, cache, planos atuais e três exemplos para estimar o custo real.

Neste artigo
  1. Resumo rápido
  2. Tabela oficial
  3. Tabela oficial de tarifas da API
  4. Planos de consumo exibidos hoje
  5. O número decisivo: US$15 de saída
  6. O que diz a cobrança oficial
  7. Três orçamentos de exemplo
  8. Entrada e resposta curtas
  9. Primeira leitura de contexto longo
  10. Contexto longo repetido
  11. Comparando a família
  12. Assinatura, API ou navegador
  13. O que a comunidade observa
  14. Quando o limite vira o preço percebido
  15. Quando o mesmo plano basta para outro trabalho
  16. Uma opção prática: comparar no Tabbit
  17. Tabela de decisão
  18. Veredito

O Kimi K3 não é simplesmente um modelo de 3 dólares. A tabela oficial da API mostra US$3 por milhão de tokens de entrada sem cache, US$0,30 em cache e US$15 de saída. A escrita do cache custa US$3 por milhão com TTL de cinco minutos e US$6 com TTL de uma hora. O número que muda o orçamento é : a saída custa cinco vezes a entrada sem cache.

Este é um guia de preços, não uma nova avaliação de capacidade. Para condições de testes, veja a página do Kimi K3 (English) e a coleção de reviews (English). O Tabbit pode comparar modelos disponíveis na conta atual, mas não transforma uma assinatura em crédito de API.

Resumo rápido

  • API oficial em USD: US$3/M de entrada, US$0,30/M em cache e US$15/M de saída.

  • O cache hit é barato, mas a primeira escrita não é gratuita.

  • Assinatura é limite do produto, não carteira de tokens.

  • K3 tem 1.048.576 tokens de contexto; K2.6 tem 262.144 e tarifas menores.

  • Em prompts curtos, saída e retries pesam; em contexto repetido, o cache pesa.

Tabela oficial

Tabela oficial de tarifas da API

Esta tabela é a cobrança por tokens da API, não o preço mensal da assinatura Kimi. Separe entrada sem cache, hits, escrita e saída. A janela de contexto é um limite máximo, não o consumo obrigatório em cada chamada; K2.7 Code e K2.6 são linhas de comparação da mesma fonte.

ModeloEntrada em cache / 1MEscrita 5 min / 1MEscrita 1 h / 1MEntrada / 1MSaída / 1MContexto
K3$0.30$3.00$6.00$3.00$15.001.048.576
K2.7 Code$0.19$0.95$4.00262.144
K2.6$0.16$0.95$4.00262.144

Fonte: documentação oficial de preços, conferida em 20 de setembro de 2026. A página de assinatura mostra Andante, Moderato, Allegretto e Allegro em CNY; o anual é descrito como mais vantajoso, com economia de até ¥1.680, e não é uma conversão da API.página oficial de assinatura

Planos de consumo exibidos hoje

PlanoMensalDestaque da página
Andante¥49Recursos e cota básica de consumo
Moderato¥99Mais recursos e cota do produto
Allegretto¥199Cota maior para uso intensivo
Allegro¥699Maior plano pessoal exibido

O número decisivo: US$15 de saída

Respostas longas, loops de Agent, traces de ferramentas e retries aumentam a saída. Quando o SDK fornecer usage, guarde os campos e use esta fórmula:

Dizer que a saída é mais cara descreve a tarifa, não a distribuição de todas as faturas pequenas. No exemplo de 10.000 tokens de entrada e 2.000 de saída, cada lado contribui com US$0,03. Não trate US$3/M como preço por tarefa sem registrar saída, retries, ferramentas e loops que falharam.

custo = (entrada sem cache×3
       + entrada em cache×0,30
       + escrita×tarifa
       + saída×15) / 1.000.000
       + ferramentas e impostos

Não substitua tokens por caracteres visíveis. Se for uma aproximação, marque como estimativa.

Para um orçamento reproduzível, guarde entrada sem cache, entrada em hit, tokens gravados, saída, número de retries e ferramentas. Assim você separa pedido frio, pedido quente e loop falho em vez de esconder tudo em uma média.

O que diz a cobrança oficial

A documentação de preços separa faixas de cobrança da escrita do cache de cinco minutos e de uma hora; sem TTL informado, a faixa documentada padrão é de cinco minutos. O troubleshooting oficial diz que a API tenta usar cache automaticamente: não é preciso enviar cache ID, TTL ou parâmetro extra. A primeira escrita paga a tarifa de escrita; um hit paga US$0,30/M e renova a validade. Para 500.000 tokens, uma leitura fria custa US$1,50, um hit custa US$0,15 e a escrita de uma hora adiciona US$3.regras de cobrança

Não é preciso criar um cache ID nem ativar a função manualmente. Mantenha estáveis o prompt de sistema, as definições de ferramentas e o início dos documentos, e confirme os hits nos dados de uso. As faixas de TTL são níveis de cobrança e retenção da escrita, não parâmetros obrigatórios em cada chamada.

Três orçamentos de exemplo

São cálculos que podem ser refeitos a partir da tabela oficial; retries, ferramentas, impostos e acréscimos do fornecedor ficam fora.

Cálculo local

Estime o custo de tokens da API Kimi K3

Usa as tarifas oficiais em USD verificadas em 20/09/2026. Os valores ficam neste navegador.

Por tarefa$0.06000
Por mês$0.06

A API tenta usar cache automaticamente. A estimativa separa a gravação dos acertos e exclui novas tentativas, ferramentas, impostos e acréscimos. Ver tarifas atuais

A calculadora roda apenas neste navegador e não envia seus valores. Ela separa hits automáticos da escrita do cache e exclui retries, ferramentas, impostos e acréscimos; confira a tarifa oficial antes de definir um orçamento.

Entrada e resposta curtas

10.000 tokens de entrada e 2.000 de saída custam (10.000×3+2.000×15)/1.000.000 = US$0,06; entrada e saída contribuem US$0,03 cada. Em uma tarefa única, medir saída e retries é mais útil que projetar um cache quase nunca reutilizado.

Primeira leitura de contexto longo

500.000 tokens sem cache e 20.000 de saída custam US$1,80. Se o prefixo for gravado, some a tarifa de escrita correspondente e mantenha o início frio separado dos hits seguintes.

Contexto longo repetido

Com os mesmos 500.000 tokens em hit e 20.000 de saída, o cálculo cai para US$0,45. A entrada fica mais barata, mas respostas longas e traces de ferramentas continuam aumentando a saída. São exemplos aritméticos, não promessa de produção.

Comparando a família

O K2.6 é mais barato, mas tem janela menor. Se a tarefa couber em 262k tokens, comece pela guia de prompts da API (English). Para várias etapas, use a guia de configuração de Agent (English) e a revisão de codificação real (English) para separar planejamento, execução e validação. Tarifa menor não prova que o resultado será equivalente.

O K2.7 Code aparece com as mesmas tarifas de K2.6 na tabela, mas uso e resultado precisam de teste próprio. Se o limite de 262k causar truncamento, busca ou chamadas extras, a tarifa por milhão deixa de explicar o custo total. Teste uma resposta curta, uma pergunta sobre documento longo e um loop com ferramentas antes de escolher apenas pelo preço.

Assinatura, API ou navegador

As páginas de membros, a aba de API e a tabela USD para desenvolvedores são superfícies diferentes. No Reddit, alguns usuários consideram os limites o principal problema; outros dizem que um plano caro sustenta loops de Agent por horas. São relatos pessoais, não limites verificados.feedback da comunidade (English)

A assinatura oferece recursos e limites do produto; a API oferece chave, usage, política de retry e cobrança auditável; o navegador reúne páginas, abas e seleção de modelo. Saldos e direitos não são automaticamente compartilhados. Não calcule o número de loops da API a partir do preço mensal nem as funções da assinatura a partir da tarifa da API.

u/thegodkingreal critica os limites. u/Timely_Impression_92 descreve loops de várias horas, enquanto u/Moppmopp diz que um plano caro pode acabar rapidamente. u/the_stamp_collector diz usar Kimi por horas sem problemas. Web3 Wesley no YouTube coloca a comparação com a assinatura Claude. São relatos pessoais coletados em 20 de setembro de 2026; o vídeo descreve três meses no plano Moonshot de US$19 junto com Claude e Codex. Não verificam quotas, versão atual ou ROI geral.

O que a comunidade observa

Quando o limite vira o preço percebido

Esses relatos opostos são experiências pessoais, não limites publicados.

u/thegodkingreal critica os limites, enquanto u/Moppmopp diz que um plano de US$200 pode acabar em meio dia. Esses relatos falam de loops úteis, não de tarifa por token, e não trazem quota verificável, contrato ou prova da versão atual.

Quando o mesmo plano basta para outro trabalho

u/Timely_Impression_92 diz estar satisfeito com loops de Agent de várias horas em um plano de US$200; u/the_stamp_collector afirma usar Kimi por horas todos os dias sem problemas. Web3 Wesley pergunta se Kimi Code pode substituir uma assinatura Claude de US$100 e descreve três meses com o plano Moonshot de US$19 junto com Claude e Codex. São experiências pessoais coletadas em 20 de setembro de 2026, não uma quota comum nem ROI universal.

Uma opção prática: comparar no Tabbit

Se o K3 estiver disponível na conta, abra a página do Kimi K3 no Tabbit (English) e a coleção de prompts (English) para comparar a mesma tarefa.

Use o mesmo prompt e critérios de aceitação para testar resposta curta, pergunta sobre documento longo e código em etapas. Registre tamanho da saída, retries, correções humanas e tempo de conclusão e compare com os três orçamentos da calculadora. Isso mede adequação no navegador; não é uma fatura Kimi nem garante acesso em todas as contas.

Chat multimodelo do Tabbit com Kimi K3 e outros modelos

Tabbit Browser

O artigo sobre contexto de 1M do GPT-5.6 Sol mostra outro caso, mas não é fonte de preço do K3.

Tabela de decisão

CargaCusto dominanteComeço recomendadoCuidado
Entrada e resposta curtasSaída e retriesAPI com limite de saídaSaída vale 5× a entrada
Prefixo longo repetidoEscrita, TTL e hitsAPI com registro de hits e escritasEscrita fria não é hit
Mais de 262k tokensContexto e chamadasComparar K3 com truncamentoTarifa maior pode reduzir chamadas
Agent em segundo planoSaída, limite e concorrênciaTestar loop representativoUso varia por pessoa
Pesquisa ocasionalRecursos e limite do planoComparar a página atualAssinatura não é API
Trabalho multimodelo no navegadorAcesso, adequação e tempo de configuraçãoTestar modelos compatíveis no TabbitDepende da conta e da edição atuais

Veredito

Use K3 quando o contexto de 1M e a capacidade justificarem os US$15/M de saída. Caso contrário, teste um modelo menor com os mesmos critérios. Monte três orçamentos — pedido frio, cache hit e loop com retry — e confira novamente a tarifa oficial da API e a página de assinatura.

Os números são um retrato conferido em 20 de setembro de 2026. Tarifas USD, planos CNY, impostos, região, elegibilidade, ferramentas e disponibilidade podem mudar separadamente. Guarde a data da tarifa e o usage real; relatos da comunidade e um teste no Tabbit servem para planejar um piloto, não para substituir as fontes oficiais.

Perguntas frequentes

Qual é o preço oficial da API do Kimi K3?

A tabela oficial mostra US$3 por milhão de tokens de entrada sem cache, US$0,30 por milhão de entrada em cache e US$15 por milhão de saída. A escrita do cache é cobrada separadamente conforme o TTL.

A entrada em cache é dez vezes mais barata?

Sim, nessa linha de cobrança: US$0,30 por milhão contra US$3 sem cache. A primeira escrita e os tokens de saída ainda entram no cálculo.

A escrita do cache do Kimi K3 é cobrada?

Sim. A tabela oficial separa a escrita de cinco minutos e de uma hora. A API tenta usar cache automaticamente e não exige cache ID, TTL ou parâmetro extra; a escrita e o hit seguinte têm cobranças diferentes.

A assinatura Kimi inclui crédito de API?

Não. A assinatura oferece recursos e limites do produto, enquanto a API cobra por tokens. A página pessoal atual mostra Andante por ¥49/mês, Moderato por ¥99, Allegretto por ¥199 e Allegro por ¥699; o anual é descrito apenas como mais vantajoso, com economia de até ¥1.680, então confirme o valor exato na página ao vivo.

O Kimi K3 é sempre a opção mais barata?

Não. O K2.6 aparece com tarifas menores, mas com janela de 262.144 tokens contra 1.048.576 do K3. Compare chamadas, truncamento e qualidade aceitável.

O preço do Kimi K3 pode mudar?

Pode. Região, impostos, elegibilidade, limites e ferramentas podem mudar separadamente. Consulte as páginas oficiais antes de comprar ou orçar.

Dê o próximo passo

Deixe o Tabbit trabalhar ao seu lado.

Pesquise entre abas, automatize o trabalho repetitivo do navegador e mantenha todo o contexto ao alcance.