Três novos modelos e o Gemini 4 no horizonte
O Google anunciou nesta segunda-feira (21) três novos modelos da família Gemini Flash: o Gemini 3.6 Flash, o 3.5 Flash-Lite e o 3.5 Flash Cyber. Os lançamentos trazem melhorias significativas em eficiência, velocidade e segurança, mirando diretamente desenvolvedores que constroem agentes de IA em produção.
A empresa também revelou que o Gemini 3.5 Pro já está em testes com parceiros e que iniciou o treinamento do Gemini 4 — descrito como “o pré-treinamento mais ambicioso já feito pela equipe”.
Gemini 3.6 Flash: mais qualidade gastando menos tokens
O 3.6 Flash é o novo modelo carro-chefe da série. Segundo o Google, ele reduz em 17% o número de tokens de saída em comparação com o 3.5 Flash, segundo o índice Artificial Analysis, e em benchmarks como o DeepSWE a economia chega a 65%. Isso significa menos verborragia e menos etapas de raciocínio para completar tarefas com múltiplos passos.
O preço também caiu: US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída, mais barato que o 3.5 Flash. Os ganhos de desempenho são expressivos:
- DeepSWE (codificação): 49% vs. 37% do 3.5 Flash
- MLE Bench (pesquisa em ML): 63,9% vs. 49,7%
- OSWorld-Verified (computer use): 83,0% vs. 78,4%
- GDPval-AA v2 (trabalho de conhecimento): 1421 vs. 1349
Empresas como Hebbia e Harvey relataram que o modelo é especialmente bom em tarefas multimodais como análise de documentos, interpretação de gráficos e redação de relatórios.
3.5 Flash-Lite: 350 tokens por segundo
Para tarefas de alto volume que exigem latência mínima, o Google lançou o 3.5 Flash-Lite. Com 350 tokens de saída por segundo, é o modelo mais rápido da família 3.5. O preço é de US$ 0,30/1M tokens de entrada e US$ 2,50/1M tokens de saída.
Surpreendentemente, o Flash-Lite supera até mesmo o Gemini 3 Flash em várias tarefas de codificação e agentes:
- SWE-Bench Pro: 54,2% vs. 49,6% (3 Flash)
- OSWorld-Verified: 74,0% vs. 65,1% (3 Flash)
- Terminal-Bench 2.1: 54% vs. 31% (3.1 Flash-Lite)
O modelo suporta níveis de pensamento configuráveis — do modo mínimo para tarefas de alto volume ao modo avançado para cargas de trabalho complexas com múltiplos subagentes. Também inclui computer use como ferramenta nativa.
3.5 Flash Cyber: segurança ofensiva com acesso restrito
O terceiro lançamento é o 3.5 Flash Cyber, um modelo especializado em encontrar e corrigir vulnerabilidades de código. Integrado ao CodeMender — sistema que usa múltiplos agentes do modelo trabalhando em conjunto —, ele atinge desempenho competitivo no benchmark CyberGym.
Por questões de segurança (tecnologia de uso dual), o modelo será disponibilizado exclusivamente para governos e parceiros confiáveis em um programa piloto de acesso limitado. A ideia é dar aos defensores uma vantagem inicial na correção de vulnerabilidades críticas antes que possam ser exploradas.
Disponibilidade
O 3.6 Flash e o 3.5 Flash-Lite já estão disponíveis:
- Para desenvolvedores via Google AI Studio, Android Studio e Google Antigravity
- Para empresas via Gemini Enterprise Agent Platform
- Para usuários finais via aplicativo Gemini (3.6 Flash) e Google Search (3.5 Flash-Lite)
Por que isso importa
O movimento do Google revela uma tendência clara: a competição em modelos de IA está migrando do “quem tem o modelo mais inteligente” para “quem entrega a melhor relação custo-eficiência para agentes em produção”. A redução de 17% nos tokens de saída do 3.6 Flash, combinada com preço menor, representa economia real para empresas que processam milhões de chamadas de API por dia. E o Flash-Lite, com seus 350 tokens/segundo, estabelece um novo patamar de velocidade para implementações de busca e processamento de documentos em tempo real.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



