A unidade de IA incorporada (embodied AI) do Ant Group, chamada Robbyant, acaba de lançar o LingBot-VA 2.0: o primeiro modelo fundacional nativamente projetado para IA física. Diferente dos modelos anteriores que reaproveitavam arquiteturas criadas para geração de vídeo digital, o LingBot-VA 2.0 foi pré-treinado do zero pensando em manipulação robótica de propósito geral.
O problema dos modelos atuais
A maioria dos modelos de vídeo-ação reutiliza dois componentes herdados da criação de conteúdo digital: um VAE orientado à reconstrução de pixels e um backbone de difusão bidirecional de vídeo com um módulo de ação anexado. Essa abordagem cria três limitações críticas:
- Latentes de pixel preservam aparência, mas carregam pouca estrutura física real
- Denoising iterativo sobre tokens de vídeo é lento demais para controle em malha fechada
- Objetivos genéricos de vídeo nunca ensinam como ações transformam o mundo físico
Um quarto problema é estrutural: backbones usam atenção bidirecional, enquanto o controle robótico se desdobra estritamente para frente no tempo. O LingBot-VA 2.0 resolve isso com um DiT causal pré-treinado nativamente.
Arquitetura em duas versões
Versão 1: Tokenizador Semântico Visual-Ação
O primeiro estágio substitui o VAE de compressão pura por um tokenizador que adiciona dois objetivos além da reconstrução. O alinhamento semântico aproxima os latentes visuais de um encoder de percepção congelado. Já o objetivo latente-ação extrai variáveis de transição compactas entre latentes consecutivos — um modelo de dinâmica inversa prevê cada ação latente; um modelo de dinâmica direta a decodifica em um mapa de transporte mais resíduo. O resultado: estados do mundo e ações compartilham um único espaço latente, permitindo que vídeos não rotulados da web carreguem supervisão relevante para ação.
Versão 2: DiT Causal com Mixture-of-Experts Esparso
Sobre esse espaço, a versão 2 pré-treina um DiT causal com layout Mixture-of-Transformers. Um especialista de vídeo e um especialista de ação compartilham a mesma atenção causal, mas cada um tem seu próprio caminho feed-forward. O stream de vídeo é escalado assimetricamente: o FFN denso é substituído por uma camada MoE esparsa com 128 especialistas SwiGLU roteados, top-8 routing, e um especialista compartilhado. O balanceamento de carga usa a estratégia Loss-Free Balancing (sem perda auxiliar).
O backbone de vídeo tem aproximadamente 13 bilhões de parâmetros, com cerca de 1,9 bilhão ativos por token. Com o especialista de ação e os heads de MCP, o treinamento cobre ~15,3 bilhões de parâmetros, com ~2,5 bilhões ativados por token na inferência. O treinamento usa objetivo de rectified flow com otimizador híbrido Muon + AdamW.
De onde vem o sinal de treinamento
Dois objetivos além da arquitetura moldam o aprendizado. A predição multi-chunk (MCP) resolve a supervisão míope do teacher forcing — anexa três módulos leves que preveem os próximos três chunks, acelerando o treinamento em 2,3x. Cinco objetivos são co-treinados simultaneamente (T2I, T2V, TI2VA, ICL e co-treinamento humano-robô), com agendamento coarse-to-fine que mantém todos os priors sem esquecimento catastrófico.
Planejamento hierárquico e Foresight Reasoning
Acima da política de controle, um planejador VLM com LoRA (torre de visão congelada) emite JSON estruturado a ~2 Hz: instrução, descrição de cena local e comando de geração. O buffer assíncrono garante que a latência do planejador nunca bloqueie a execução.
O Foresight Reasoning é a inovação mais prática: enquanto o robô executa o chunk de ação atual, o especialista de vídeo imagina o resultado futuro e o especialista de ação decodifica a próxima ação a partir dessa imaginação. Para evitar desvio (drift), cada observação real que retorna sobrescreve o latente imaginado, com uma perda de grounding de dinâmica direta treinando o especialista de vídeo para esse papel. Na prática, isso remove o gargalo serial da inferência: previsão e execução viram streams assíncronos.
Por que isso importa
O LingBot-VA 2.0 representa uma mudança de paradigma em IA física: em vez de adaptar modelos de vídeo para robótica, ele constrói a fundação inteira em torno da causalidade da ação no mundo real. A combinação de tokenizador semântico conjunto, DiT causal com MoE esparso e raciocínio prospectivo assíncrono aponta para robôs que não apenas reagem, mas antecipam — com inferência rápida o suficiente para controle em malha fechada.
Para o ecossistema de IA, é mais um sinal de que a China está investindo pesado em embodied AI — não apenas em LLMs de texto. O Ant Group, mais conhecido pelo Alipay, está construindo uma divisão de robótica com ambições de fundação. O código e o paper estão disponíveis no GitHub do Robbyant.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



