Inteligência artificial, sem ruído.
Pesquisa e Ciência3 min

TrAct usa trilhas visuais para unir controle de robôs e previsão de vídeo

Sistema combina política de ação com modelo de mundo para subir sucesso de 27% para 55% em simulação e de 49% para 76% no robô real.

TrAct usa trilhas visuais para unir controle de robôs e previsão de vídeo

Por que isso importa agora

Um dos problemas centrais da robótica com aprendizado é unir controle (o que o robô faz) e previsão (o que acontece depois). Um novo pré-print do arXiv descreve o TrAct, sistema que usa “trilhas visuais” como interface comum entre os dois, e relata ganhos consistentes de sucesso de tarefa em simulação e no mundo real.

Uma representação compartilhada para controlar e prever

O design de três partes do TrAct usa trilhas visuais como a ponte entre controle e previsão. O VLAT propõe pares de ação-trilha; o TWM, um modelo de mundo condicionado a trilhas, prevê vídeos futuros; e o VLAC pontua rollouts possíveis para escolher a ação. O sistema liga aprendizado de política com tomada de decisão baseada em modelo de mundo usando a mesma representação visual.

Os números mais claros vieram da previsão

Nos testes de vídeo, o TWM superou o AWM em todas as cinco métricas reportadas, nas duas visões de câmera. Na visão do agente em simulação, o PSNR do TWM foi 24,51 contra 15,12 do AWM, e o LPIPS 0,106 contra 0,438. Vale lembrar: o artigo trata esses números como medidas de qualidade de previsão, não como medida direta de conclusão de tarefa.

Ganhos que sobreviveram ao mundo real

No benchmark LIBERO-INTEGRAL, o sucesso médio foi 0,27 para o π0.5, 0,44 para VLAT, 0,49 para VLAT+AWM e 0,55 para TrAct. Nos testes físicos com um Franka Emika Panda e duas câmeras RGB — 400 demonstrações de treino e cinco tarefas inéditas de avaliação, cada uma com 10 episódios — o TrAct atingiu sucesso médio de 0,76, contra 0,66 do VLAT+AWM e 0,55 do VLAT.

O teste de mudança de fundo expôs a divisão mais nítida: sob condição de fundo nunca vista, o VLAT+AWM caiu para 0,40, enquanto o TrAct se manteve em 0,70. Uma verificação com três sementes independentes deu ao TrAct intervalo de confiança de 95% entre 0,53 e 0,56, contra 0,47 a 0,51 do VLAT+AWM — intervalos que não se sobrepõem.

Ressalvas necessárias

A base de testes ainda é limitada em tamanho e variedade: 20 tarefas de simulação e cinco tarefas físicas em uma única configuração de robô. Isso oferece prova de conceito, mas não garante que os ganhos persistam em outros robôs, câmeras, ambientes ou tarefas de horizonte longo. O documento é a versão 3 do arXiv, de 1º de setembro de 2026, e segue sem revisão por pares.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.