TabbitBlog

Preços do MiMo-V2.6-Pro: Tabela Oficial, Cache e Custo por Tarefa

Guia prático de aquisição para o MiMo-V2.6-Pro: tarifas oficiais da API, economia de cache de prompts, tokens de raciocínio, modo UltraSpeed e orçamentos reais.

Neste artigo
  1. Principais conclusões
  2. Tabela de preços do MiMo-V2.6-Pro de relance
  3. O número determinante: US$ 0,0036 por milhão de tokens em cache
  4. Analisando as declarações oficiais de economia
  5. Linhas de cobrança complementares
  6. Comparativo da família e guia de seleção
  7. Limites de gratuidade e despesas efetivas
  8. Relatos da comunidade de desenvolvedores
  9. Dois orçamentos práticos demonstrativos
  10. Cenário 1: Correção pontual de código (Chamada única, reflexão densa)
  11. Cenário 2: Agente de pesquisa web em múltiplos turnos (Contexto amplo, alto cache)
  12. Operacionalizando seus fluxos no Tabbit Browser
  13. Fontes consultadas

O valor nominal por token nunca reflete o custo real para solucionar uma demanda de engenharia. Ele indica apenas o preço de um insumo básico. Na tabela oficial divulgada pela Xiaomi em 22 de setembro de 2026, o modelo topo de linha MiMo-V2.6-Pro é cotado a US$ 0,435 por milhão de tokens de entrada sem cache e US$ 0,87 por milhão de tokens de saída (ou ¥ 3,00 e ¥ 6,00 em RMB). À primeira vista, parece apenas mais uma investida na disputa de preços de modelos abertos.

No entanto, os fatores que realmente determinam a fatura são dois: um desconto de 99,17% (120 vezes mais barato) no cache de prompts, que reduz a leitura para US$ 0,0036 por milhão de tokens, e um teto de saída máxima de 131.072 tokens. Quando modelos treinados com aprendizado por reforço (RL) realizam reflexões profundas antes de responder, o volume de saída pode facilmente superar o custo de entrada. Este guia detalha as tarifas oficiais para montar orçamentos reais. Para consultar as especificações técnicas, veja a página do MiMo-V2.6-Pro (English); este artigo foca na viabilidade financeira.

Principais conclusões

  • Tarifas base de US$ 0,435 de entrada e US$ 0,87 de saída por milhão de tokens, situando-se entre 1/20 e 1/60 dos custos de modelos proprietários ocidentais.

  • A alavanca do cache corta o custo por 120: prefixos coincidentes saem a US$ 0,0036 / 1M de tokens, viabilizando economicamente fluxos de agentes em múltiplos turnos.

  • O UltraSpeed possui um multiplicador exato de 10×: o mimo-v2.6-pro-ultraspeed gera texto até 20 vezes mais rápido para interfaces interativas, mas sobe para US$ 4,35 de entrada e US$ 8,70 de saída.

  • Raciocínio é faturado como saída: os tokens de reflexão interna são cobrados na tarifa de saída de US$ 0,87 / 1M, podendo fazer com que a saída seja várias vezes mais cara que a entrada.

  • A linha anterior V2.5 encerra-se em 21 de outubro de 2026: quem mantém integrações baseadas em mimo-2-5-pro-api ou mimo-2-5-pro-preset deve planejar a migração para o V2.6.

Tabela de preços do MiMo-V2.6-Pro de relance

A tabela a seguir compila os valores da documentação oficial da Xiaomi MiMo, confirmados em 22 de setembro de 2026. Todos os valores referem-se a blocos de 1 milhão (1M) de tokens.

Versão do modeloEntrada (Cache hit) / 1MEntrada (Cache miss) / 1MSaída / 1MJanela de contextoSaída máxima
MiMo-V2.6-ProUS$ 0,0036 (¥ 0,025)US$ 0,435 (¥ 3,00)US$ 0,87 (¥ 6,00)1.048.576131.072
MiMo-V2.6-FlashUS$ 0,0028 (¥ 0,020)US$ 0,140 (¥ 1,00)US$ 0,28 (¥ 2,00)1.048.576131.072
MiMo-V2.6-Pro-UltraSpeedUS$ 0,0360 (¥ 0,250)US$ 4,350 (¥ 30,00)US$ 8,70 (¥ 60,00)1.048.576131.072
MiMo-V2.5-Pro (Legado)US$ 0,435 (¥ 3,00)US$ 0,87 (¥ 6,00)1.048.5768.192

O comparativo evidencia as melhorias estruturais: enquanto a entrada e saída nominais acompanham o padrão do antigo V2.5 (US$ 0,435 e US$ 0,87), o V2.6 inaugura a faixa de leitura de cache a US$ 0,0036 e amplia o limite de saída de 8k para 128k tokens. Os endpoints do V2.5 serão desativados em 21 de outubro de 2026.

O número determinante: US$ 0,0036 por milhão de tokens em cache

O dado de maior relevância orçamentária é US$ 0,0036 / 1M de tokens (¥ 0,025 / 1M), configurando uma queda de 99,17% em relação à entrada sem cache.

Na construção de fluxos de agentes inteligentes, quase nenhuma tarefa se resume a uma interação isolada. Em um fluxo de raciocínio agêntico complexo, o agente consulta documentos, aciona APIs e pondera hipóteses ao longo de 15 a 30 iterações. Sem cache, reenviar um contexto de 500.000 tokens por 20 turnos exigiria 10 milhões de tokens de entrada, custando US$ 4,35. Com o cache automático de prefixos, essas mesmas 20 chamadas consomem apenas US$ 0,036 em entrada.

Além disso, há um comportamento contra-intuitivo: o acerto de cache do Pro custa quase o mesmo que o do Flash (US$ 0,0036 contra US$ 0,0028). Em arquiteturas onde o reaproveitamento de contexto ultrapassa 85%, executar o modelo MoE de 1,02 trilhão de parâmetros tem custo de entrada praticamente idêntico ao do econômico MiMo-V2.6-Flash (English).

Analisando as declarações oficiais de economia

O material institucional afirma que o MiMo-V2.6-Pro entrega capacidade de ponta por «1/20 a 1/60 do custo» dos principais concorrentes proprietários. Embora a matemática direta confirme o cálculo frente aos US$ 75 ou US$ 15 de saída de modelos ocidentais, dois fatores operacionais devem ser incorporados às estimativas:

  1. Expansão por tokens de raciocínio: Por ter sido refinado com aprendizado por reforço extensivo, o modelo processa internamente seus passos lógicos antes de responder. Em problemas difíceis de software, ele pode despender entre 15.000 e 30.000 tokens de pensamento para gerar um trecho final de 500 tokens de código. Como esses passos são tarifados no valor de saída de US$ 0,87 / 1M, uma única execução pode atingir US$ 0,026 mesmo partindo de um prompt breve.

  2. Exigência de alinhamento estrito do cache: O reaproveitamento de prefixo requer correspondência exata. Se o cliente inserir carimbos de data e hora dinâmicos ou identificadores voláteis no início do prompt de sistema, todas as requisições falharão no cache, recaindo na tarifa de US$ 0,435 / 1M.

A equação padronizada para precificar chamadas individuais é:

custo por chamada = (entrada sem cache × US$ 0,435
                   + entrada em cache × US$ 0,0036
                   + saída total com raciocínio × US$ 0,87) / 1.000.000
orçamento mensal = (custo médio por chamada × volume de tarefas) × margem de repetição

Linhas de cobrança complementares

Para calcular o custo total de propriedade, considere também as opções adicionais da plataforma Xiaomi:

  • Modo UltraSpeed (custo ×10): O mimo-v2.6-pro-ultraspeed foi desenvolvido para assistentes de voz e chat imediato onde o atraso de resposta é inaceitável. Ele acelera a geração em até 20 vezes aplicando uma sobretaxa rigorosa de dez vezes (US$ 4,35 na entrada, US$ 8,70 na saída). Destinar cargas batch a esse endpoint eleva os gastos desnecessariamente.

  • Assinaturas Token Plan: A Xiaomi disponibiliza pacotes mensais em RMB para desenvolvedores individuais e equipes:

    • Plano Lite (¥ 39 / mês): Para prototipagem rápida e testes ocasionais.

    • Plano Standard (¥ 99 / mês): Para projetos ativos de automação pessoal.

    • Plano Pro (¥ 329 / mês): Maior capacidade e limites de concorrência para desenvolvedores profissionais.

    • Plano Max (¥ 659 / mês): Destinado a fluxos de trabalho intensivos de equipes.

  • Limitações de requisições por minuto: A API sob demanda aplica tetos de RPM (requisições por minuto) e TPM (tokens por minuto), exigindo contratos sob medida para grandes volumes.

Comparativo da família e guia de seleção

VersãoCenário de aplicaçãoEntrada / 1M (Sem cache / Em cache)Saída / 1MPerfil de velocidade
MiMo-V2.6-ProProgramação avançada, cadeias lógicas, agentes de navegaçãoUS$ 0,435 / US$ 0,0036US$ 0,87Equilíbrio entre raciocínio e cadência
MiMo-V2.6-FlashTriagem massiva, sumarização e pipelines ETL levesUS$ 0,140 / US$ 0,0028US$ 0,28Alta velocidade e baixo consumo
MiMo-V2.6-Pro-UltraSpeedAssistentes de voz em tempo real, interação humana instantâneaUS$ 4,350 / US$ 0,0360US$ 8,70Geração ultrarrápida (até 20× superior)

O roteiro de escolha é simples: utilize o MiMo-V2.6-Flash para triagem e extrações que dispensam raciocínio avançado; adote o MiMo-V2.6-Pro como padrão para resolução de problemas complexos; e reserve o UltraSpeed para interfaces interativas onde a percepção de latência justifica o multiplicador de 10×. Veja como o mercado se posiciona em nosso comparativo de navegadores com IA 2026 e na análise de preços do Kimi K3.

Limites de gratuidade e despesas efetivas

Saber exatamente o que não gera cobrança evita divergências contábeis:

  • Sem tarifa de retenção de cache em períodos básicos: Ao contrário de serviços que cobram aluguel horário de memória (como os US$ 0,50 por milhão de token-hora do Google), a Xiaomi MiMo fatura estritamente o volume de leitura nos acertos, sem taxa fixa de guarda.

  • Bloqueios de proteção não são penalizados: Requisições contidas precocemente pelas travas de segurança upstream não são cobradas pela saída que deixaram de produzir.

  • Raciocínio consome créditos normalmente: Supor que o processamento mental é um bônus sem custo é um equívoco frequente; ele é totalmente tarifado na saída.

  • Falhas de agentes consomem tokens: Se um agente autônomo entrar em loops desnecessários ou chamadas de ferramentas repetitivas, todos os tokens continuarão sendo contabilizados.

Relatos da comunidade de desenvolvedores

Os depoimentos publicados em fóruns especializados confirmam tanto a vantagem de custo quanto as condições técnicas de contorno:

Comentário no Reddit de u/Illustrious-Many-782 sobre testes em tarefas atômicas
u/Illustrious-Many-782 (Reddit): Na correção de erros reais em Next.js, o MiMo apresentou excelente custo-benefício; avaliação independente de usuário.
Comentário no Reddit de u/latent_vector sobre consumo de tokens de reflexão
u/latent_vector (r/LocalLLaMA): Passos extensos de reflexão elevam a saída gerada, tornando os tokens de saída o componente principal da despesa.
Comentário no Hacker News de alexp_dev sobre a economia de cache
alexp_dev (Hacker News): O desconto de 99,17% no cache torna viáveis ciclos de 20 turnos em agentes com históricos volumosos.
Comentário no Hacker News de cloud_arch sobre o custo do UltraSpeed
cloud_arch (Hacker News): O UltraSpeed zera a latência de interface, mas seu preço dez vezes superior o coloca no mesmo patamar de modelos ocidentais.

Esses apontamentos reforçam a premissa de avaliar os modelos pelo custo integral por tarefa realizada, em vez de focar apenas em pontuações de benchmarking.

Dois orçamentos práticos demonstrativos

Tomando como base as taxas oficiais em dólares para 2026, calculamos a projeção financeira de duas operações rotineiras:

Cenário 1: Correção pontual de código (Chamada única, reflexão densa)

  • Entrada: 25.000 tokens sem cache (código e instrução), 0% em cache.

  • Saída: 3.500 tokens (com 2.500 de raciocínio e 1.000 de código final).

  • Cálculo: (25.000 × US$ 0,435 + 3.500 × US$ 0,87) / 1.000.000 = US$ 0,010875 + US$ 0,003045 = US$ 0,01392 por execução.

  • 1.000 tarefas por mês: US$ 13,92. Aplicando uma margem de reexecução de 1,2, o valor atinge US$ 16,70 por mês.

Cenário 2: Agente de pesquisa web em múltiplos turnos (Contexto amplo, alto cache)

  • Entrada: 800.000 tokens consolidados em 15 acionamentos de ferramentas; 92% em cache (736.000 reutilizados, 64.000 novos).

  • Saída: 12.000 tokens no total (estratégia de busca e relatório conclusivo).

  • Cálculo: (64.000 × US$ 0,435 + 736.000 × US$ 0,0036 + 12.000 × US$ 0,87) / 1.000.000 = US$ 0,02784 + US$ 0,00265 + US$ 0,01044 = US$ 0,04093 por tarefa.

  • 200 tarefas por mês: US$ 8,19. Sem a preservação de contexto em cache, essa rotina custaria US$ 71,60 por mês (mais de 8,7 vezes maior).

Cenário de trabalhoTokens de entradaParcela em cacheTokens de saídaTarefas / mêsGasto mensal de tokens (USD)
Correção pontual25.0000%3.5001.000US$ 13,92
Agente de pesquisa800.00092%12.000200US$ 8,19

Cálculo local

Estime o custo mensal de tokens

Tarifas oficiais da API verificadas em setembro de 2026. Inclui o raciocínio na saída. Os valores permanecem no navegador.

MiMo-V2.6-Pro$0.0519 / tarefa$10.38 / mês
MiMo-V2.6-Flash$0.0174 / tarefa$3.47 / mês
MiMo-V2.6-Pro-UltraSpeed$0.5190 / tarefa$103.80 / mês

Exclui chamadas de ferramentas e novas tentativas. Leitura em cache Pro e Flash a $0,0036 e $0,0028 por 1M tokens. Verificado em 22-09-2026. Ver tarifas atuais

A ferramenta de cálculo acima funciona exclusivamente no seu navegador sem trafegar números para servidores externos. Sinta-se à vontade para ajustar os campos e verificar a diferença entre Pro, Flash e UltraSpeed.

Operacionalizando seus fluxos no Tabbit Browser

Após planejar as despesas de chamada à API, a equipe demanda uma camada de execução fluida. Montar robôs manuais e código de cola para tarefas rotineiras de extração web gera atrito operacional permanente.

O Tabbit Browser integra uma infraestrutura de navegação com IA onde agentes autônomos acessam páginas ativas, coletam tabelas e correlacionam referências entre diferentes abas. Para saber mais sobre essa tendência, leia nossos artigos sobre o que é um navegador com agentes autônomos e os melhores navegadores com IA em 2026.

Em conformidade com os registros do projeto, a disponibilidade dos modelos no Tabbit depende da lista de opções de cada conta e dos termos de serviço. O Tabbit não administra sua conta de cobrança de API externa, mas cria uma superfície de trabalho poderosa para pesquisas em ambiente web.

Tabbit Browser

Fontes consultadas

As informações de valores e especificações apresentadas foram obtidas da documentação técnica oficial conferida em 22 de setembro de 2026:

Perguntas frequentes

Qual é o preço do MiMo-V2.6-Pro na API oficial?

A API oficial precifica o MiMo-V2.6-Pro em US$ 0,435 por milhão de tokens de entrada sem cache, US$ 0,0036 por milhão de tokens em acerto de cache e US$ 0,87 por milhão de tokens de saída.

Quanto o cache de prompt economiza no MiMo-V2.6-Pro?

A leitura em cache custa US$ 0,0036 por milhão de tokens, contra US$ 0,435 da entrada normal. Trata-se de uma redução de 99,17% (120 vezes mais barato) em prefixos reutilizados.

Os tokens de raciocínio interno são cobrados à parte?

Não. A Xiaomi MiMo soma os tokens do processo reflexivo com o texto final gerado e fatura tudo na tarifa padrão de saída de US$ 0,87 por milhão de tokens.

O que é o MiMo-V2.6-Pro-UltraSpeed e por que custa 10 vezes mais?

O UltraSpeed é uma variante de alta vazão voltada para interações em tempo real com até 20 vezes mais velocidade de geração. O custo é multiplicado exatamente por 10 (US$ 4,35 entrada, US$ 8,70 saída).

Como os planos Token Plan da Xiaomi diferem da API sob demanda?

Os Token Plans são pacotes mensais pré-pagos (Lite ¥39, Standard ¥99, Pro ¥329, Max ¥659) com cotas fixas de uso, distintos da cobrança medida por milhão de tokens da API convencional.

É possível utilizar o MiMo-V2.6-Pro no Tabbit Browser?

O Tabbit Browser oferece um ambiente nativo para automação e pesquisa web; o suporte direto a modelos depende do seletor de contas ativo e dos termos do serviço.

Dê o próximo passo

Deixe o Tabbit trabalhar ao seu lado.

Pesquise entre abas, automatize o trabalho repetitivo do navegador e mantenha todo o contexto ao alcance.