O Kimi K3 não é simplesmente um modelo de 3 dólares. A tabela oficial da API mostra US$3 por milhão de tokens de entrada sem cache, US$0,30 em cache e US$15 de saída. A escrita do cache custa US$3 por milhão com TTL de cinco minutos e US$6 com TTL de uma hora. O número que muda o orçamento é 5×: a saída custa cinco vezes a entrada sem cache.
Este é um guia de preços, não uma nova avaliação de capacidade. Para condições de testes, veja a página do Kimi K3 (English) e a coleção de reviews (English). O Tabbit pode comparar modelos disponíveis na conta atual, mas não transforma uma assinatura em crédito de API.
Resumo rápido
API oficial em USD: US$3/M de entrada, US$0,30/M em cache e US$15/M de saída.
O cache hit é barato, mas a primeira escrita não é gratuita.
Assinatura é limite do produto, não carteira de tokens.
K3 tem 1.048.576 tokens de contexto; K2.6 tem 262.144 e tarifas menores.
Em prompts curtos, saída e retries pesam; em contexto repetido, o cache pesa.
Tabela oficial
Tabela oficial de tarifas da API
Esta tabela é a cobrança por tokens da API, não o preço mensal da assinatura Kimi. Separe entrada sem cache, hits, escrita e saída. A janela de contexto é um limite máximo, não o consumo obrigatório em cada chamada; K2.7 Code e K2.6 são linhas de comparação da mesma fonte.
| Modelo | Entrada em cache / 1M | Escrita 5 min / 1M | Escrita 1 h / 1M | Entrada / 1M | Saída / 1M | Contexto |
|---|---|---|---|---|---|---|
| K3 | $0.30 | $3.00 | $6.00 | $3.00 | $15.00 | 1.048.576 |
| K2.7 Code | $0.19 | — | — | $0.95 | $4.00 | 262.144 |
| K2.6 | $0.16 | — | — | $0.95 | $4.00 | 262.144 |
Fonte: documentação oficial de preços, conferida em 20 de setembro de 2026. A página de assinatura mostra Andante, Moderato, Allegretto e Allegro em CNY; o anual é descrito como mais vantajoso, com economia de até ¥1.680, e não é uma conversão da API.página oficial de assinatura
Planos de consumo exibidos hoje
| Plano | Mensal | Destaque da página |
|---|---|---|
| Andante | ¥49 | Recursos e cota básica de consumo |
| Moderato | ¥99 | Mais recursos e cota do produto |
| Allegretto | ¥199 | Cota maior para uso intensivo |
| Allegro | ¥699 | Maior plano pessoal exibido |
O número decisivo: US$15 de saída
Respostas longas, loops de Agent, traces de ferramentas e retries aumentam a saída. Quando o SDK fornecer usage, guarde os campos e use esta fórmula:
Dizer que a saída é mais cara descreve a tarifa, não a distribuição de todas as faturas pequenas. No exemplo de 10.000 tokens de entrada e 2.000 de saída, cada lado contribui com US$0,03. Não trate US$3/M como preço por tarefa sem registrar saída, retries, ferramentas e loops que falharam.
custo = (entrada sem cache×3
+ entrada em cache×0,30
+ escrita×tarifa
+ saída×15) / 1.000.000
+ ferramentas e impostosNão substitua tokens por caracteres visíveis. Se for uma aproximação, marque como estimativa.
Para um orçamento reproduzível, guarde entrada sem cache, entrada em hit, tokens gravados, saída, número de retries e ferramentas. Assim você separa pedido frio, pedido quente e loop falho em vez de esconder tudo em uma média.
O que diz a cobrança oficial
A documentação de preços separa faixas de cobrança da escrita do cache de cinco minutos e de uma hora; sem TTL informado, a faixa documentada padrão é de cinco minutos. O troubleshooting oficial diz que a API tenta usar cache automaticamente: não é preciso enviar cache ID, TTL ou parâmetro extra. A primeira escrita paga a tarifa de escrita; um hit paga US$0,30/M e renova a validade. Para 500.000 tokens, uma leitura fria custa US$1,50, um hit custa US$0,15 e a escrita de uma hora adiciona US$3.regras de cobrança
Não é preciso criar um cache ID nem ativar a função manualmente. Mantenha estáveis o prompt de sistema, as definições de ferramentas e o início dos documentos, e confirme os hits nos dados de uso. As faixas de TTL são níveis de cobrança e retenção da escrita, não parâmetros obrigatórios em cada chamada.
Três orçamentos de exemplo
São cálculos que podem ser refeitos a partir da tabela oficial; retries, ferramentas, impostos e acréscimos do fornecedor ficam fora.
Cálculo local
Estime o custo de tokens da API Kimi K3
Usa as tarifas oficiais em USD verificadas em 20/09/2026. Os valores ficam neste navegador.
A API tenta usar cache automaticamente. A estimativa separa a gravação dos acertos e exclui novas tentativas, ferramentas, impostos e acréscimos. Ver tarifas atuais
A calculadora roda apenas neste navegador e não envia seus valores. Ela separa hits automáticos da escrita do cache e exclui retries, ferramentas, impostos e acréscimos; confira a tarifa oficial antes de definir um orçamento.
Entrada e resposta curtas
10.000 tokens de entrada e 2.000 de saída custam (10.000×3+2.000×15)/1.000.000 = US$0,06; entrada e saída contribuem US$0,03 cada. Em uma tarefa única, medir saída e retries é mais útil que projetar um cache quase nunca reutilizado.
Primeira leitura de contexto longo
500.000 tokens sem cache e 20.000 de saída custam US$1,80. Se o prefixo for gravado, some a tarifa de escrita correspondente e mantenha o início frio separado dos hits seguintes.
Contexto longo repetido
Com os mesmos 500.000 tokens em hit e 20.000 de saída, o cálculo cai para US$0,45. A entrada fica mais barata, mas respostas longas e traces de ferramentas continuam aumentando a saída. São exemplos aritméticos, não promessa de produção.
Comparando a família
O K2.6 é mais barato, mas tem janela menor. Se a tarefa couber em 262k tokens, comece pela guia de prompts da API (English). Para várias etapas, use a guia de configuração de Agent (English) e a revisão de codificação real (English) para separar planejamento, execução e validação. Tarifa menor não prova que o resultado será equivalente.
O K2.7 Code aparece com as mesmas tarifas de K2.6 na tabela, mas uso e resultado precisam de teste próprio. Se o limite de 262k causar truncamento, busca ou chamadas extras, a tarifa por milhão deixa de explicar o custo total. Teste uma resposta curta, uma pergunta sobre documento longo e um loop com ferramentas antes de escolher apenas pelo preço.
Assinatura, API ou navegador
As páginas de membros, a aba de API e a tabela USD para desenvolvedores são superfícies diferentes. No Reddit, alguns usuários consideram os limites o principal problema; outros dizem que um plano caro sustenta loops de Agent por horas. São relatos pessoais, não limites verificados.feedback da comunidade (English)
A assinatura oferece recursos e limites do produto; a API oferece chave, usage, política de retry e cobrança auditável; o navegador reúne páginas, abas e seleção de modelo. Saldos e direitos não são automaticamente compartilhados. Não calcule o número de loops da API a partir do preço mensal nem as funções da assinatura a partir da tarifa da API.
u/thegodkingreal critica os limites. u/Timely_Impression_92 descreve loops de várias horas, enquanto u/Moppmopp diz que um plano caro pode acabar rapidamente. u/the_stamp_collector diz usar Kimi por horas sem problemas. Web3 Wesley no YouTube coloca a comparação com a assinatura Claude. São relatos pessoais coletados em 20 de setembro de 2026; o vídeo descreve três meses no plano Moonshot de US$19 junto com Claude e Codex. Não verificam quotas, versão atual ou ROI geral.
O que a comunidade observa
Quando o limite vira o preço percebido
Esses relatos opostos são experiências pessoais, não limites publicados.
u/thegodkingreal critica os limites, enquanto u/Moppmopp diz que um plano de US$200 pode acabar em meio dia. Esses relatos falam de loops úteis, não de tarifa por token, e não trazem quota verificável, contrato ou prova da versão atual.
Quando o mesmo plano basta para outro trabalho
u/Timely_Impression_92 diz estar satisfeito com loops de Agent de várias horas em um plano de US$200; u/the_stamp_collector afirma usar Kimi por horas todos os dias sem problemas. Web3 Wesley pergunta se Kimi Code pode substituir uma assinatura Claude de US$100 e descreve três meses com o plano Moonshot de US$19 junto com Claude e Codex. São experiências pessoais coletadas em 20 de setembro de 2026, não uma quota comum nem ROI universal.
Uma opção prática: comparar no Tabbit
Se o K3 estiver disponível na conta, abra a página do Kimi K3 no Tabbit (English) e a coleção de prompts (English) para comparar a mesma tarefa.
Use o mesmo prompt e critérios de aceitação para testar resposta curta, pergunta sobre documento longo e código em etapas. Registre tamanho da saída, retries, correções humanas e tempo de conclusão e compare com os três orçamentos da calculadora. Isso mede adequação no navegador; não é uma fatura Kimi nem garante acesso em todas as contas.

O artigo sobre contexto de 1M do GPT-5.6 Sol mostra outro caso, mas não é fonte de preço do K3.
Tabela de decisão
| Carga | Custo dominante | Começo recomendado | Cuidado |
|---|---|---|---|
| Entrada e resposta curtas | Saída e retries | API com limite de saída | Saída vale 5× a entrada |
| Prefixo longo repetido | Escrita, TTL e hits | API com registro de hits e escritas | Escrita fria não é hit |
| Mais de 262k tokens | Contexto e chamadas | Comparar K3 com truncamento | Tarifa maior pode reduzir chamadas |
| Agent em segundo plano | Saída, limite e concorrência | Testar loop representativo | Uso varia por pessoa |
| Pesquisa ocasional | Recursos e limite do plano | Comparar a página atual | Assinatura não é API |
| Trabalho multimodelo no navegador | Acesso, adequação e tempo de configuração | Testar modelos compatíveis no Tabbit | Depende da conta e da edição atuais |
Veredito
Use K3 quando o contexto de 1M e a capacidade justificarem os US$15/M de saída. Caso contrário, teste um modelo menor com os mesmos critérios. Monte três orçamentos — pedido frio, cache hit e loop com retry — e confira novamente a tarifa oficial da API e a página de assinatura.
Os números são um retrato conferido em 20 de setembro de 2026. Tarifas USD, planos CNY, impostos, região, elegibilidade, ferramentas e disponibilidade podem mudar separadamente. Guarde a data da tarifa e o usage real; relatos da comunidade e um teste no Tabbit servem para planejar um piloto, não para substituir as fontes oficiais.
Perguntas frequentes
Qual é o preço oficial da API do Kimi K3?
A tabela oficial mostra US$3 por milhão de tokens de entrada sem cache, US$0,30 por milhão de entrada em cache e US$15 por milhão de saída. A escrita do cache é cobrada separadamente conforme o TTL.
A entrada em cache é dez vezes mais barata?
Sim, nessa linha de cobrança: US$0,30 por milhão contra US$3 sem cache. A primeira escrita e os tokens de saída ainda entram no cálculo.
A escrita do cache do Kimi K3 é cobrada?
Sim. A tabela oficial separa a escrita de cinco minutos e de uma hora. A API tenta usar cache automaticamente e não exige cache ID, TTL ou parâmetro extra; a escrita e o hit seguinte têm cobranças diferentes.
A assinatura Kimi inclui crédito de API?
Não. A assinatura oferece recursos e limites do produto, enquanto a API cobra por tokens. A página pessoal atual mostra Andante por ¥49/mês, Moderato por ¥99, Allegretto por ¥199 e Allegro por ¥699; o anual é descrito apenas como mais vantajoso, com economia de até ¥1.680, então confirme o valor exato na página ao vivo.
O Kimi K3 é sempre a opção mais barata?
Não. O K2.6 aparece com tarifas menores, mas com janela de 262.144 tokens contra 1.048.576 do K3. Compare chamadas, truncamento e qualidade aceitável.
O preço do Kimi K3 pode mudar?
Pode. Região, impostos, elegibilidade, limites e ferramentas podem mudar separadamente. Consulte as páginas oficiais antes de comprar ou orçar.