Por que isso importa agora
Enquanto os modelos de linguagem avançam a passos largos, os conjuntos de dados de manipulação robótica cresceram muito mais devagar. O motivo é estrutural: a coleta continua fechada e centralizada — operadores especializados reúnem demonstrações em hardware de laboratório, processam offline e publicam um benchmark fixo que nunca mais cresce. O AXIS, novo sistema da Axis Robotics em parceria com UC Berkeley, Georgia Tech e NTU, propõe inverter essa lógica: levar a coleta para o navegador e tratar o dataset como algo em expansão contínua.
O que é o AXIS
O AXIS move a coleta de demonstrações para o navegador e envia todo o resto para GPUs no backend. Colaboradores teleoperam um braço robótico Franka Research 3 com garra de mandíbulas paralelas dentro de um frontend MuJoCo WebAssembly, usando teclado, mouse, joystick virtual ou gamepad. A simulação de física e a renderização Three.js rodam fora da thread da interface React, mantendo as amostras estado-ação alinhadas ao simulador.
Tudo o que é caro acontece no backend: renderização em 8 GPUs RTX 4090, treinamento e avaliação em 8 GPUs A100. O resultado é que qualquer pessoa contribui sem precisar de GPU ou robô local.
Tarefas geradas, não escritas à mão
As tarefas são geradas automaticamente pelo TaskGen, que decompõe uma instrução em linguagem natural em configurações de tarefa, cena e objeto, recupera ou gera malhas por meio de um pipeline imagem-para-3D e propõe um layout 2.5D. Um supervisor de layout valida a cena e realoca objetos quando as restrições falham. Cada tarefa vem com um verificador de sucesso estruturado, re-executado no backend em vez de confiar no sinal do frontend.
O que o dataset contém
O snapshot liberado reúne 207 tarefas, 50.129 episódios e mais de 60 mil variantes de tarefa ou cena, distribuídas em sete categorias de cena. Cada trajetória carrega metadados da tarefa, embodiment, versão do simulador, estados do robô e objetos, ações, rótulos de sucesso e observações RGB-D de terceira pessoa e de pulso. O artigo credita mais de 70 mil membros da comunidade pelas contribuições.
O dataset no Hugging Face tem 2,36 TB, com acesso restrito a uso acadêmico não comercial. O código de treinamento é público, como uma camada sobre o OpenPI, mas os checkpoints de política não foram liberados.
Resultados no LIBERO-Plus
O ganho real aparece no benchmark LIBERO-Plus. Partindo do checkpoint π0.5 (backbone PaliGemma Gemma-2B com especialista de ação Gemma-300M), o pré-treinamento contínuo com o AXIS eleva a média geral de 83,9 para 88,8 pontos — um avanço de 4,9 pontos. Um grupo de controle RoboCasa365, pareado por contagem de trajetórias, marca apenas 57,5, o que mostra que o ganho não vem só do volume de simulação.
Os maiores ganhos por eixo ficam onde a pipeline de aumento randomiza: ruído de sensor (+13,7) e câmera (+11,3). Dois eixos — luz e linguagem — regridem ligeiramente, um lembrete de que o método ainda não resolve tudo.
Por que isso importa
O AXIS ataca um gargalo real da robótica: a escassez de dados de demonstração de alta qualidade. Ao democratizar a coleta via navegador e torná-la contínua, o projeto aponta para um futuro em que conjuntos de dados robóticos crescem como comunidades — não como artefatos congelados. Para pesquisadores e entusiastas brasileiros, é um sinal de que a fronteira da robótica com IA está se abrindo para colaboração distribuída.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



