O DeepSeek V4.1 Flash é uma opção atual para contexto longo, imagens, ferramentas e tarifas de API baixas em determinados horários. O nome exato é decisivo: a API oficial usa deepseek-flash, enquanto deepseek-v4-flash é apenas um alias temporário de compatibilidade. Um texto antigo sobre V4 Flash pode descrever outro checkpoint mesmo que o código ainda funcione.
O marco é o lançamento de 10 de setembro de 2026 e a tabela de preços conferida em 20 de setembro: MoE de 552B, 8B parâmetros ativos no prefill, 16B no decode, contexto de 1M, saída máxima de 384K, visão nativa e modos com e sem raciocínio. V4 Pro é uma rota separada. Consulte a página do modelo DeepSeek V4.1 Flash (English) e confirme o ID no cliente que será usado.
Decisão rápida
É candidato para agentes que lidam com documentos longos, imagens e cache controlável.
Para novas chamadas de API, use
deepseek-flash; o nome antigo indica compatibilidade, não a permanência do modelo antigo.Leia cada pontuação junto da tarefa, versão e harness; não existe aqui um ranking independente único.
Separe cobrança da API, pesos locais, provedores e acesso ao Tabbit.
Um agente que altera arquivos deve entregar diff, testes e um ponto de revisão humana.
DeepSeek V4.1 Flash em resumo
| Pergunta | Dado conferido em 20-09-2026 | Limite prático |
|---|---|---|
| Nome da API | deepseek-flash, versão DeepSeek-V4.1-Flash | Confirme região e conta. |
| Nome antigo | deepseek-v4-flash redireciona temporariamente para V4.1 | Resultados antigos não migram automaticamente. |
| Arquitetura | MoE 552B; 8B ativos no prefill e 16B no decode | Não prevê latência hospedada nem velocidade local. |
| Contexto/saída | 1M; máximo de 384K | O máximo não é garantido em todo cliente. |
| Entradas e ferramentas | Texto, visão, JSON, ferramentas, Responses API e Anthropic API; FIM sem raciocínio | A exposição depende da rota. |
| Concorrência publicada | 2.500 | Pode mudar por conta, região e serviço. |
O texto o que é um navegador agêntico separa uma sessão do navegador de uma API. Para uma visão mais ampla, veja AI browser comparison e as práticas do Tabbit Browser.
Arquitetura e resultados oficiais
A DeepSeek descreve uma arquitetura causal encoder-decoder assimétrica, com 8B ativos no prefill e 16B no decode. O anúncio afirma que o cache KV usa um quarto da HBM e um oitavo do SSD da geração anterior. O cartão do Hugging Face traz caminhos para Transformers, vLLM, SGLang e quantização, mas isso não é um orçamento de hardware para um MoE de 552B. Os prompts do DeepSeek (English) são material de tarefa; este artigo não copia prompts longos.
O changelog de 10 de setembro lista 90,6 no Terminal-Bench 2.1, 74,2 no DeepSWE v1.1, 88,1 no CyberGym, 62,8 no SEC-Bench Pro, 63,9 no HLE with tools, 78,9 no Chartography with tools, 89,6 no BabyVision with tools e 54,8 no Automation-Bench. As linhas usam tarefas, ferramentas e versões distintas; uma média única esconderia o alcance de cada uma. As condições estão no catálogo de avaliações DeepSeek (English).
V4 Flash, V4.1 Flash e V4 Pro não são intercambiáveis
V4 Flash 0731 é um antecessor histórico. V4.1 Flash é a rota atual deepseek-flash e o checkpoint com pesos publicados. V4 Pro é separado; uma política de transição pode redirecionar pedidos antigos, mas uma pontuação do Pro não é uma medição do Flash. O alias deepseek-v4-flash é direcionado ao V4.1 e cobrado como Flash.
O guia de preços do DeepSeek V4 Flash continua útil para contas e histórico de migração, mas não substitui a identificação deste checkpoint. Para desenhar uma avaliação, consulte a pesquisa sobre raciocínio agêntico.
Preço, modos e implantação
| Período | Entrada com cache | Entrada sem cache | Saída |
|---|---|---|---|
| Fora do pico | $0.003 | $0.15 | $0.60 |
| Pico | $0.006 | $0.30 | $1.20 |
O pico ocorre de segunda a sexta, 01:00–04:00 e 06:00–10:00 UTC, exceto feriados públicos chineses; o restante é fora do pico. Raciocínio, saída, ferramentas e novas tentativas determinam o custo real. A API aceita JSON, ferramentas, Responses API, Anthropic API, visão e FIM sem raciocínio. Os pesos MIT dão controle ao operador, mas hardware, latência e recuperação de falhas continuam sendo responsabilidade dele. O guia de automação do navegador ajuda a montar uma tarefa, mas não prova que o modelo esteja disponível no Tabbit.
Evidência da comunidade e riscos
Um usuário do r/opencode relatou ter criado um jogo de navegador parecido com Valorant em cerca de dez minutos, usando aproximadamente 300K tokens e $0.28, e publicou o código. O artefato é concreto, mas faltam prompt exato, modo da API, logs e rubrica de aceitação. Um relato anterior sobre V4 Flash 0731 descreveu uma depuração web de cerca de 30 minutos; os comentários discutiram capacidade, hardware local e alucinações. É contexto histórico, não evidência do V4.1. Um snapshot do Agent Arena no X não foi usado: não pôde ser reaberto com segurança e trazia $0.07 e $0.06 em pontos diferentes. O YouTube foi pesquisado, sem transcrição ou execução controlada.
| Situação | Primeiro teste | Critério de aceitação |
|---|---|---|
| Agente de código | Repositório pequeno, problema fixo e comando de testes | Diff, testes e log de ferramentas coincidem. |
| Extração de imagem ou gráfico | Imagem pública com rótulos conhecidos | Cada valor tem rastreabilidade e a incerteza aparece. |
| Documento longo | Corpus datado com needles em posições distintas | Medir a recuperação em vários comprimentos. |
| Lote sensível a custo | Mesma tarefa no pico e fora dele, cache registrado | Incluir saída e tentativas no custo aceito. |
| Implantação local | Teste quantizado com memória e vazão registradas | Hardware, latência e recuperação são explicáveis. |
O que o Tabbit pode comprovar
Não foi executada uma tarefa autenticada do DeepSeek V4.1 Flash no Tabbit, nem foram obtidas quatro a oito capturas qualificadas. Portanto, o artigo não afirma nada sobre seletor, contexto efetivo, visão, latência, cota ou preço no Tabbit. Se o modelo aparecer na conta, comece com uma imagem ou documento público, peça cinco fatos com links e confira cada um manualmente. Não envie material confidencial nem dê permissão de escrita no primeiro teste.
Veredito
O DeepSeek V4.1 Flash merece um piloto para agentes com contexto longo, entrada multimodal e custo sensível ao horário. Use deepseek-flash, registre período e modo e valide com uma fixture fixa. Escolha pesos locais apenas com um plano real de hardware; considere o Tabbit somente depois de verificar seu seletor e suas condições.
Fontes
Perguntas frequentes
O que é o DeepSeek V4.1 Flash?
É o checkpoint Flash atual da DeepSeek, chamado `deepseek-flash` na API oficial. Ele oferece contexto de 1M, até 384K tokens de saída, modos com e sem raciocínio, visão nativa e chamadas de ferramentas.
Ele é o mesmo que o V4 Flash?
Não. V4 Flash e V4 Flash Vision Exp foram retirados. Os nomes antigos funcionam temporariamente como aliases que apontam para o V4.1 Flash, portanto uma avaliação histórica do V4 Flash não identifica o checkpoint atual.
Quanto custa o DeepSeek V4.1 Flash?
A tabela oficial conferida em 20 de setembro de 2026 mostra, fora do pico, 0,003/0,15 dólar por milhão para entrada com ou sem cache e 0,60 para saída. No pico, os valores são 0,006/0,30/1,20; confira a tabela antes de montar o orçamento.
Ele tem pesos abertos?
O cartão do Hugging Face publica pesos sob licença MIT e caminhos para Transformers, vLLM e SGLang. Isso não prova que o custo de hardware local seja baixo nem que o modelo esteja disponível no Tabbit.
Ele serve para agentes de código?
O changelog da DeepSeek informa 90,6 no Terminal-Bench 2.1 e 74,2 no DeepSWE v1.1 em suas avaliações. Um relato atual no Reddit é positivo, mas não informa prompt, harness e critérios de aceitação completos; repita a tarefa com uma fixture reversível.
Posso usá-lo no Tabbit?
Este artigo não executou uma tarefa autenticada do DeepSeek V4.1 Flash no Tabbit. O nome e o preço da API não comprovam disponibilidade no Tabbit; confira o seletor ativo e os termos da conta.