O Google Research apresentou em 24 de setembro de 2026 um conjunto de quatro arquiteturas de agentes para atacar um limite ainda visível na geração de vídeo por IA: manter personagens, objetos, cenário e progressão narrativa coerentes durante vários planos e minutos de história. O trabalho não anuncia um novo produto público do Gemini ou do Veo. Trata-se de pesquisa que usa esses modelos como base e propõe uma camada de orquestração, memória visual e revisão iterativa para reduzir a deriva que hoje exige correção manual em produções mais longas.
A novidade importa porque gerar um clipe isolado já é uma tarefa relativamente madura para os principais modelos de vídeo; produzir uma sequência em que o mesmo personagem preserve roupas, rosto, posição e relação com objetos ao longo de cortes ainda não é. O Google reúne quatro linhas de pesquisa — AI video co-director, CANVAS, A²RD e VQQA — para tratar o problema como planejamento global e rastreamento de estado, não como uma fila de prompts independentes.
Resumo: o que o Google está propondo
- Co-Director escolhe uma direção criativa e coordena storyboard, imagens-chave, vídeo e áudio em uma hierarquia de agentes.
- CANVAS mantém memória visual persistente para personagens, ambientes e objetos que voltam a aparecer.
- A²RD gera o vídeo em segmentos, alternando entre avançar a narrativa e ancorar elementos já vistos.
- VQQA usa perguntas visuais e um modelo de visão-linguagem para criticar resultados e reescrever prompts em ciclos fechados.
Por que vídeos longos gerados por IA ainda se desfazem
Modelos de difusão e sistemas generativos podem renderizar cenas convincentes em poucos segundos, mas cada plano costuma ser produzido com informação parcial sobre os demais. Quando uma cadeia de agentes recebe prompts desenhados de modo independente, surgem dois problemas. O primeiro é a deriva semântica: uma roupa muda de cor, um objeto troca de forma ou um cômodo reaparece com outra geometria. O segundo são falhas em cascata: uma decisão errada no início vira referência para os planos seguintes e contamina o resultado final.
O desafio técnico é de atribuição de crédito. Se o filme final falhou, é difícil dizer se a causa foi a estratégia criativa, o storyboard, a imagem-chave, o prompt de um plano ou a avaliação de um agente posterior. A proposta do Google separa essas decisões e devolve sinais de avaliação para o planejamento, em vez de aceitar a primeira sequência produzida.

As quatro peças da arquitetura
1. Co-Director transforma criatividade em busca global
O AI video co-director usa um algoritmo de multi-armed bandit, uma técnica de decisão que equilibra testar alternativas e repetir escolhas promissoras. O Orchestrator Agent seleciona uma configuração em três dimensões: estratégia criativa, modo narrativo e arquétipo estético. Em seguida, o Pre-Production Agent constrói um storyboard; agentes especializados criam imagens-chave, movimento e áudio; e um juiz multimodal avalia o corte final.
O ponto central não é que um único agente “dirige” o vídeo, mas que a configuração escolhida passa por toda a cadeia. Isso reduz a chance de uma equipe de subagentes trabalhar com objetivos estéticos conflitantes. Segundo o Google, o sistema alcançou pontuação máxima de 81,4 no GenAD-Bench, benchmark criado para testar restrições de anúncios fictícios e evitar conflitos de direitos autorais ou de dados de treinamento.
2. CANVAS registra o estado do mundo visual
O CANVAS, sigla para Continuity-Aware Narratives via Visual Agentic Storyboarding, mantém representações estruturadas de personagens, locais e estado de objetos. Quando uma cena retorna, o sistema recupera âncoras visuais em vez de depender apenas de um novo prompt textual. A ideia é próxima de uma bíblia de produção: o agente precisa saber que o personagem, o cenário e o objeto continuam sendo os mesmos, ainda que a câmera tenha mudado de assunto por vários planos.

Nos testes descritos pela empresa, CANVAS foi comparado com geração direta e com o AutoStudio em uma narrativa de assalto a museu. A avaliação procura, por exemplo, se um boné desaparece, se uma joia muda e se o salão volta com outra configuração espacial. A relevância prática é clara para publicidade, treinamento corporativo e conteúdo seriado: revisão humana deixa de procurar apenas erros de estética e passa a auditar fatos do universo visual.
3. A²RD estende a coerência para minutos
O A²RD, ou Agentic Autoregressive Diffusion, trabalha segmento a segmento com uma memória multimodal de vídeo. Em cada etapa, ele recupera contexto, sintetiza um novo trecho, refina o resultado e atualiza a memória. O componente alterna entre extrapolação, para levar a narrativa adiante, e interpolação, para reconectar personagens, ambientes e objetos a referências anteriores.
O Google demonstra uma produção de dez minutos com a arquitetura, mas isso não deve ser confundido com uma promessa de vídeo de dez minutos disponível para qualquer usuário do Veo. O material publicado caracteriza A²RD como arquitetura de pesquisa; qualidade, custo computacional, latência e disponibilidade comercial ainda dependem dos modelos e do produto que a adotarem.
4. VQQA usa crítica visual para refinar prompts
O VQQA, de Video Quality Question Answering, não edita pixels diretamente. Ele formula perguntas visuais específicas para o prompt — por exemplo, se a textura de um balão corresponde ao objeto pedido ou se cada músico permanece com seu instrumento — e usa críticas de um modelo de visão e linguagem como feedback em linguagem natural. O prompt é então refeito e um novo vídeo é gerado.
Há uma precaução importante: o sistema não escolhe automaticamente a última tentativa. Um avaliador global compara todos os candidatos ao prompt original e seleciona o mais bem classificado. Isso busca evitar uma correção local que resolva um detalhe, mas descaracterize a cena inteira.
O que os benchmarks medem — e o que eles não provam
O conjunto de avaliação reúne GenAD-Bench, HardContinuityBench e LVBench-C. O primeiro traz 400 cenários de publicidade fictícia; o segundo força reintroduções de cenas, figurinos e objetos; o terceiro usa 120 cenários textuais em que ativos críticos somem por pelo menos dez segmentos antes de reaparecerem. São desenhos úteis para medir continuidade, mas foram criados pelos próprios grupos de pesquisa ou associados aos projetos.
Por isso, os resultados devem ser lidos como evidência de avanço técnico, não como garantia independente de qualidade em qualquer roteiro, idioma, estilo ou contexto comercial. A postagem do Google recomenda consultar os trabalhos individuais para detalhes de configurações e baselines. Também não informa preço, cronograma de lançamento, limites de uso ou se as quatro arquiteturas chegarão integralmente a produtos do Gemini, do Veo ou do Vertex AI.

Impacto prático para criadores e empresas brasileiras
Para produtoras, agências e equipes internas no Brasil, a pesquisa aponta uma mudança de processo mais do que uma solução pronta. Vídeos institucionais, treinamentos, campanhas com mascotes e séries educativas exigem consistência de marca entre cenas. Hoje, a equipe normalmente resolve esse problema com bibliotecas de referências, repetição de prompts, edição e checagem manual. Uma camada que guarde o estado visual pode reduzir retrabalho, mas acrescenta outra responsabilidade: definir referências autorizadas, aprovar o storyboard e verificar se o vídeo final não cria erros de contexto.
A arquitetura também preserva, segundo o Google, os mecanismos nativos dos modelos de base, incluindo a marca d’água SynthID. Isso é relevante, mas não substitui controles de direito de imagem, autorização de voz, uso de marcas e revisão para publicidade. Uma marca d’água indica procedência técnica; ela não concede direitos nem garante que uma peça esteja adequada ao Código de Defesa do Consumidor, à LGPD ou a regras setoriais.
Análise do NoticIA
O aspecto mais útil do anúncio é deslocar a conversa de “qual gerador faz o clipe mais bonito?” para “como manter um mundo visual verificável ao longo de uma produção?”. Coerência de longo prazo é um problema de memória, planejamento e avaliação, não apenas de resolução ou duração máxima. A divisão em Co-Director, CANVAS, A²RD e VQQA sugere que ferramentas de vídeo tenderão a expor controles de continuidade, referências de personagem e critérios de aprovação — recursos mais valiosos para trabalho profissional do que um botão de gerar mais longo.
Ao mesmo tempo, a pesquisa não elimina o gargalo editorial. Um agente pode manter um personagem consistente e ainda produzir uma narrativa ruim, uma alegação enganosa ou uma cena inadequada para uma marca. O ganho real virá quando a automação de continuidade for combinada com direção humana, fontes aprovadas e revisão jurídica e criativa. Até que haja produto e documentação de uso, equipes devem tratar os resultados como sinal de direção tecnológica, não como capacidade contratável.
O que acompanhar a seguir
Os próximos sinais relevantes serão a liberação de código, benchmarks, documentação de integração ou disponibilidade em produtos. Também será importante observar avaliações externas: cenários em português, personagens e marcas reais, duração, custo por minuto e taxa de correção humana ainda não foram detalhados no anúncio. Para quem já usa IA em vídeo, vale separar desde agora referências de personagens, objetos e cenários; elas são exatamente o tipo de estado que essas arquiteturas procuram recuperar e validar.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.


