Por que isso importa agora
Vídeo sempre foi a modalidade mais cara de processar com IA. Até agora, um modelo Gemini recebendo uma palestra de 90 minutos processava tudo a uma taxa fixa de um quadro por segundo, independentemente da pergunta — fosse “resuma isso” ou “em que minuto o palestrante muda para o slide de preços?”. Esse processamento de passada única forçava uma troca ruim: ou você pagava pela linha do tempo inteira no contexto, ou pré-fragmentava o vídeo e corria o risco de perder justamente o detalhe que importava.
Esta semana, o Google lançou a compreensão de vídeo agêntica nos modelos Flash. Em vez de engolir a linha do tempo, o Gemini navega por ela decidindo o que assistir, em que taxa de quadros e por qual modalidade. O Google relata até 88% menos tokens, até 66% menos custo e até 7% mais precisão em benchmarks padrão de vídeo.
O que mudou na prática
O processamento estático — ainda o padrão em todos os modelos Gemini — extrai quadros a 1 FPS em uma única passada, processa áudio a 1 Kbps em canal único e insere timestamps a cada segundo. O processamento agêntico substitui isso por um laço: o modelo combina o próprio raciocínio com ferramentas nativas de vídeo para buscar, escanear e inspecionar segmentos-alvo entre quadros, áudio e transcrições, carregando apenas o que a pergunta exige.
Desenvolvedores já podiam montar esse fluxo manualmente; a mudança é que o Gemini executa o laço internamente, o que elimina a sobrecarga de desenvolvimento. Nas avaliações do Google, o Gemini 3.7 Flash com compreensão agêntica fica na fronteira de Pareto de precisão versus custo para análise de vídeo. Os ganhos de eficiência se concentram em conteúdo longo, de guias de 10 minutos a gravações de várias horas.
Como ativar
É um único campo na parte de vídeo da requisição:
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{"type": "video", "uri": "https://youtu.be/...", "processing": "agentic"},
{"type": "text", "text": "Quais são os 3 anúncios mais importantes deste keynote?"},
],
)Também dá para misturar modos por vídeo dentro de uma mesma requisição: agêntico na palestra longa, estático no clipe curto.
Limitações e disponibilidade
É implementável, mas apenas como recurso de API hospedada. Não há pesos abertos nem opção de auto-hospedagem. O recurso chega pela API Gemini no Google AI Studio e na Gemini Enterprise Agent Platform, funciona com upload de arquivos e URLs públicas do YouTube, e é cobrado no preço padrão de tokens da API Gemini, sem taxa adicional.
O modo estático continua melhor para clipes com menos de cinco minutos e para trabalho que exige precisão quadro a quadro. A contabilidade de tokens também muda: o raciocínio de navegação é cobrado como tokens de pensamento (total_thought_tokens), enquanto quadros, áudio e transcrições carregados sob demanda entram como tokens de uso de ferramenta (total_tool_use_tokens). O modo agêntico é suportado nos Gemini 3.8, 3.7, 3.6 Flash e 3.5 Flash-Lite.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



