Inteligência artificial, sem ruído.
Modelos e LLMs1 min

LingBot-World-Infinity: Ant Group lança modelo de mundo causal aberto com arnês agentivo

Robbyant, unidade do Ant Group, lançou o LingBot-World-Infinity, um modelo de 14B parâmetros que gera vídeo interativo quadro a quadro. O diferencial está na arquitetura MoBA que combate a deriva em horizontes longos e no arnês Director-Pilot que transforma o gerador em simulador interativo.

LingBot-World-Infinity: Ant Group lança modelo de mundo causal aberto com arnês agentivo

A Robbyant, unidade de inteligência incorporada do Ant Group, acaba de lançar o LingBot-World-Infinity (LingBot-World 2.0) — um modelo causal de geração de vídeo de 14 bilhões de parâmetros que funciona como um simulador de mundo interativo. É a resposta da equipe a dois modos de falha que atormentam os modelos de mundo atuais: a deriva em horizontes longos (long-horizon drift) e a latência de interação.

O que é um modelo de mundo interativo?

Um modelo de mundo interativo gera vídeo quadro a quadro, condicionado a um fluxo de ações do usuário. Cada estado depende apenas dos quadros passados e da entrada atual. A equipe formaliza isso como uma fatoração causal:

p_θ(x_1:T | a_1:T) = Π_t  p_θ(x_t | x_

Onde x_t representa o estado visual no instante t, e a ação a_t combina uma pose de câmera (usando embeddings de Plücker, injetados via AdaLN) com um prompt de texto (processado por cross-attention em blocos).

Quatro avanços sobre a versão anterior

A equipe de pesquisa reivindica quatro melhorias sobre o LingBot-World original:

  • Horizonte de interação ilimitado com qualidade de saída consistente;
  • Variante destilada em tempo real capaz de gerar vídeo 720p a 60 fps;
  • Espaço de ações ampliado, incluindo ataque, arco e flecha, magia e tiro;
  • Arnês agentivo Director-Pilot, que emparelha um agente diretor com um agente piloto.

O modelo principal tem 14 bilhões de parâmetros. Uma contraparte leve de 1.3B é descrita como implantável em uma única GPU.

Arquitetura: MoBA e o combate à deriva

A contribuição central é a Máscara de Atenção MoBA (Mixture of Bidirectional and Autoregressive). O treinamento autorregressivo padrão de vídeo usa uma máscara de teacher forcing: cada quadro ruidoso atende a si mesmo e ao seu contexto limpo. A equipe descobriu que, conforme o contexto cresce, o modelo se apoia cada vez mais nele em vez de prever quadros futuros — resultando em overfitting e degradação visual.

O MoBA anexa um bloco de atenção bidirecional completa à máscara de teacher forcing. Esse bloco atua como regularizador e também ajuda o modelo a lidar com geração de comprimento flexível. O pré-treinamento otimiza um objetivo de conditional flow-matching com interpolação de fluxo retificado.

No pós-treinamento, a equipe aplica Distribution Matching Distillation (DMD) sobre longas trajetórias de self-rollout, não apenas sobre estados com teacher forcing. O estudante é otimizado na distribuição de estados que suas próprias previsões induzem — este é o mecanismo declarado por trás da resistência à deriva.

O arnês agentivo: Director + Pilot

Um preditor de quadros não se joga sozinho. A equipe da Robbyant envolve o gerador em um framework de co-simulação Director-Pilot:

  • Director: um Vision-Language Model (VLM) que governa regras semânticas macroscópicas e raciocínio causal;
  • Pilot: o gerador de vídeo Diffusion Transformer (DiT) que simula a física de baixo nível e renderiza transições.

O arnês expõe dois modos de interação: Modo A (interação semântica direta, onde o VLM lê o quadro atual e gera cartas de evento sem precisar de máscaras de objeto) e Modo B (interação com rastreamento assistido por SAM, onde os usuários selecionam objetos rastreados e disparam ações como abrir portas ou girar bolas).

Usuários também podem intervir textualmente: mudanças globais de estado alteram hora do dia ou clima; injeção de entidades locais gera criaturas, com o VLM escolhendo pontos de entrada plausíveis. A interface segue convenções de jogos: WASD para movimento, IJKL para controle de visão, espaço para pular e teclas numéricas para slots de evento.

O que está disponível — e o que não está

É importante calibrar expectativas. Apenas o checkpoint lingbot-world-v2-14b-causal-fast pode ser baixado hoje. As variantes causal-pretrained 14B, bidirecional 14B e ambas as versões 1.3B estão marcadas como TODO no repositório.

O script de referência fornecido roda em 480×832 com oito GPUs. A afirmação de 720p a 60 fps descreve o sistema implantado, que passa por um refinador espaço-temporal que faz upsample dos quadros decodificados e sintetiza quadros intermediários — ambos compilados em engines TensorRT. O código dessa etapa de deployment não foi liberado.

Para quem quiser testar, há um checkpoint compatível com Diffusers da Hugging Face que permite inferência com poucas linhas de código. A licença é CC BY-NC-SA 4.0 (uso não comercial).

Casos de uso promissores

  • Prototipagem de jogos e níveis: gere uma cena a partir de uma imagem-semente e altere o prompt para transformar o ambiente em tempo real — itere sobre atmosfera antes mesmo de existir uma pipeline de assets;
  • Simulação incorporada: produza rollouts em primeira pessoa com poses de câmera roteirizadas para alimentar um aprendiz de política, sem precisar de Unreal Engine;
  • Dados sintéticos para compreensão de vídeo: prompts em bloco produzem eventos temporalmente localizados, com cada bloco carregando sua própria legenda por construção;
  • Avaliação de agentes: deixe o agente Director propor eventos e pontue como um agente downstream reage — a analogia do próprio paper é um scaffold de código como o Codex.

O que isso significa

O LingBot-World-Infinity representa um passo relevante na direção de simuladores de mundo abertos e interativos treinados com supervisionamento causal. A combinação de MoBA + DMD sobre self-rollout ataca diretamente o problema da deriva que limita a maioria dos modelos de mundo atuais. O arnês agentivo Director-Pilot transforma um preditor de quadros em algo muito mais próximo de um ambiente interativo real.

Dito isso, o lançamento é mais fino que o paper: um checkpoint, script em 480p, sem código de deployment, sem benchmarks quantitativos (VBench, FVD) e licença não comercial. A pesquisa é sólida, mas o ecossistema ao redor ainda está nos estágios iniciais.



Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.