Gemini 3.6 Flash é um candidato de eficiência para um piloto multimodal de código, documentos e agentes delimitados. O valor não está apenas no benchmark: o Google diz que ele usa menos tokens de saída que o 3.5 Flash, mas os relatos mostram que a economia só existe quando a revisão é barata.
O marco é o anúncio do Google de 21/07/2026 e o cartão conferido em 20/09: gemini-3.6-flash, entrada 1.048.576, saída 65.536, entradas de texto/imagem/vídeo/áudio/PDF e Standard pago a US$ 1,50/7,50 por milhão. 3.7 e 3.8 são rotas vizinhas, não substitutos automáticos. Comece pela página do Gemini 3.6 (English).
Decisão rápida
Use 3.6 quando multimodalidade, loops rápidos e menor saída importarem.
Os 17% são uma comparação datada, não uma economia universal por tarefa.
Mantenha verificação independente: há alucinações, timeouts e corte de conhecimento.
Separe API, AI Studio/Antigravity, contratos empresariais e Tabbit.
Um agente com escrita deve fornecer diff, testes e condição de parada.
Ficha
| Campo | Evidência verificada | Limite |
|---|---|---|
| ID | gemini-3.6-flash estável | Confirme o ID no cliente. |
| Entradas | Texto, imagem, vídeo, áudio e PDF | O cliente pode expor menos. |
| Tokens | 1.048.576 entrada; 65.536 saída | O plano pode reduzir a janela. |
| Ferramentas | Cache, código, computer use preview, busca, funções, grounding, saída estruturada, URL | Suporte da API não garante acesso na conta. |
| Preço | US$ 1,50 entrada / 7,50 saída por milhão | Camada gratuita, ferramentas e retries são separados. |
| Corte | Março de 2026 | Fatos atuais exigem fontes. |
Leia o que é um navegador agêntico, a comparação de navegadores IA e as práticas do Tabbit Browser.
De 3.5 a 3.6, e a relação com 3.7
O Google apresenta 3.6 como a evolução de 3.5: código, conhecimento e multimodalidade, com 17% menos saída na comparação citada. O anúncio também mostra DeepSWE 49 contra 37, MLE-Bench 63,9 contra 49,7, OSWorld 83,0 contra 78,4 e GDPval-AA Elo 1421 contra 1349. São comparações do fornecedor, não auditoria independente.
3.7 e 3.8 não tornam 3.6 inútil. Se 3.6 conclui uma tarefa delimitada com poucos loops e revisão rápida, a eficiência vale. Para autonomia longa, compare a rota nova com o mesmo fixture. O guia de raciocínio agêntico ajuda a registrar esforço, ferramentas e correções.
Resultados e relatos
O cartão mostra SWE-Bench Pro 58,7%, DeepSWE 49%, Terminal-Bench 78,0%, MLE-Bench 63,9%, OSWorld 83,0%, CharXiv sem ferramentas 85,2% e GDM-MRCR 1M 54,0%. São tarefas diferentes, não um índice único. A medição 1M não garante que todo prompt grande seja barato ou estável. Guarde as condições nos prompts (English) e reviews (English), sem copiar prompts de terceiros.
Promptslove descreve 24 horas com OpenCode, high thinking e quatro tarefas: frontend, jogo de navegador, formulários e vídeo do Instagram. Formulários, CSV, edição e vídeo teriam funcionado, mas o frontend teria perdido ponteiros de rolagem, contadores, responsividade e acabamento. No Reddit há elogios à velocidade em tarefas limitadas, mas também relatos de verificação sem prova, ação perigosa, testes esquecidos, regras Firebase ignoradas, erros 400 e repetição em contexto longo. A coleção de avaliações (English) mantém esses limites.
Preço, dados e primeiro teste
A linha Standard paga era US$ 1,50/7,50 por milhão e inclui thinking na saída. O Google diz que o nível gratuito pode usar conteúdo para melhorar produtos, enquanto o pago não. Confirme país e termos atuais antes de enviar dados sensíveis. Cache, Search grounding, ferramentas, retries e assinaturas são linhas separadas.
AI Studio, API, Antigravity, Android Studio e Enterprise podem ter cotas diferentes. Tabbit é outra rota; a automação de navegador ajuda a desenhar o teste, mas não transforma uma sessão em fatura do Gemini.
Não houve tarefa autenticada no Tabbit nem 4–8 capturas qualificadas. Portanto não afirmamos seletor, contexto, latência, cota, assinatura ou preço. Se o modelo aparecer, extraia cinco fatos de uma página pública, confira os links e não dê permissão de escrita na primeira execução.
Veredito
Gemini 3.6 Flash é um candidato eficiente para código multimodal e agentes delimitados. Os dados do Google sugerem avanço sobre 3.5, mas cota, supervisão e verificação podem apagar a economia. Faça um piloto com fixture fixo e passe para 3.7 ou 3.8 somente quando a autonomia compensar a revisão adicional.
Fontes
Perguntas frequentes
O que é o Gemini 3.6 Flash?
É o modelo Flash multimodal estável do Google para código, conhecimento e agentes. Aceita texto, imagem, vídeo, áudio e PDF, com 1.048.576 tokens de entrada e 65.536 de saída.
O que mudou em relação ao Gemini 3.5 Flash?
O Google cita 17% menos tokens de saída na comparação da Artificial Analysis e melhorias em código e multimodalidade. É uma comparação datada, não uma garantia de menor custo em todas as tarefas.
Quanto custa?
Em 20 de setembro de 2026, a linha Standard paga do Google mostrava US$ 1,50 por milhão de tokens de entrada e US$ 7,50 de saída. Ferramentas, tentativas e a camada gratuita têm condições próprias.
Serve para agentes de programação?
O cartão do Google indica 58,7% no SWE-Bench Pro, 78,0% no Terminal-Bench 2.1 e 83,0% no OSWorld-Verified. Relatos independentes favorecem tarefas delimitadas e supervisionadas.
Quais são as limitações?
O Google cita alucinações, lentidão ou timeouts ocasionais, reforço contínuo contra jailbreaks e corte de conhecimento em março de 2026. A comunidade relata cotas, testes esquecidos e repetição.
Posso usá-lo no Tabbit?
Este artigo não executou uma tarefa autenticada do Gemini 3.6 Flash no Tabbit. Confira o seletor e os termos da conta.