DeepMind muda a forma como o Gemini “assiste” a vídeos — e barateia a conta
O Google DeepMind anunciou nesta segunda-feira (1º) a chegada da compreensão agêntica de vídeo (agentic video understanding) aos modelos Gemini 3.7 Flash, 3.6 Flash e 3.5 Flash-Lite. A novidade altera a lógica de processamento de vídeo: em vez de “assistir” ao arquivo inteiro a uma taxa fixa de quadros por segundo, o Gemini passa a decidir ativamente o que olhar, em que velocidade e por qual modalidade — quadros visuais, áudio ou transcrição.
O resultado é uma combinação rara na indústria: mais precisão com menos custo. Segundo o DeepMind, a funcionalidade reduz o consumo de tokens em até 88% e o custo de análise em até 66%, ao mesmo tempo em que melhora a precisão em até 7%. Os ganhos são especialmente expressivos em vídeos longos — de tutoriais de 10 minutos a aulas de 90 minutos e gravações de várias horas.
Como funciona
No processamento “estático” tradicional, o modelo ingere o vídeo a uma taxa fixa de quadros por segundo (1 FPS por padrão, ajustável via API). Isso força o desenvolvedor a escolher entre pagar caro em tokens ou descartar detalhes críticos.
Com a abordagem agêntica, o Gemini entra em um loop agêntico: ele invoca uma ferramenta interna para carregar apenas os trechos relevantes do vídeo, buscando os momentos e sinais necessários. O mecanismo lembra a já existente “visão agêntica”, que combina execução de código com a compreensão nativa de imagens do Gemini. O que antes exigia trabalho manual do desenvolvedor agora acontece de forma automática dentro do próprio modelo.
O que dá para fazer na prática
- Recuperação de momentos em sub-segundo: identificar mudanças de estado e cortes precisos que passam despercebidos a 1 FPS, viabilizando edição automatizada de vídeo.
- Busca “agulha no palheiro” em vídeos longos: responder perguntas complexas em conteúdos de várias horas sem consumir milhões de tokens.
- Detecção de anomalias: reamostrar janelas de tempo em FPS mais alto para inspecionar movimentos rápidos e artefatos sutis.
- Contagem de ações e objetos: rastrear movimentos físicos repetidos e objetos distintos ao longo do tempo.
Disponibilidade e preço
O recurso já está disponível para uploads de vídeo e vídeos do YouTube via Gemini API no Google AI Studio e no Gemini Enterprise Agent Platform. Ele usa o preço padrão de tokens da API, sem taxa adicional. Para ativar, basta definir o parâmetro processing como "agentic" na configuração da API.
A empresa também anunciou que a funcionalidade chegará a bilhões de usuários em produtos Google: será liberada no app Gemini (modelos Flash e Flash-Lite) e, nos próximos meses, alimentará o recurso “Pergunte ao YouTube” (Ask YouTube), entregando respostas fundamentadas no conteúdo visual dos vídeos.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



