A Mistral AI lançou o Robostral Navigate, seu primeiro modelo construído especificamente para navegação incorporada (embodied navigation). Com 8 bilhões de parâmetros, o modelo recebe imagens de uma única câmera RGB e uma instrução em linguagem natural — e move o robô até o destino. O resultado é impressionante: 76,6% de taxa de sucesso no benchmark R2R-CE (validação unseen) usando apenas uma câmera.
O que é o Robostral Navigate?
O Robostral Navigate é um modelo de 8B desenvolvido do zero pela Mistral para navegação robótica em ambientes complexos: escritórios, prédios residenciais, edifícios comerciais e espaços externos. Você dá uma instrução e ele completa a tarefa inteira sozinho. Exemplo real: “Saia do lobby, atravesse o corredor, entre na sala de suprimentos e pare de frente para a segunda prateleira.”
O mais notável: o modelo navega em espaços com pessoas e obstáculos que nunca viu durante o treinamento — sem mapa prévio, sem depth sensor, sem LiDAR. Apenas uma câmera RGB comum.
Navegação por apontamento (pointing)
O mecanismo de decisão do Robostral Navigate é baseado em pointing: dado o histórico de observações e a instrução, o modelo prevê as coordenadas do pixel-alvo na imagem atual da câmera e a orientação desejada ao chegar. Essa abordagem é mais robusta que comandos baseados em deslocamentos métricos, pois se mantém estável mesmo com variações nos parâmetros intrínsecos da câmera.
Quando o alvo está fora do campo de visão atual, o modelo automaticamente recorre a deslocamentos no sistema de coordenadas local do robô. Exemplo: “Mova 2 metros para frente, 1,5 metros para a esquerda e gire 25 graus.”
O pseudo-código abaixo ilustra o loop de decisão:
obs_history = [] # frames RGB anteriores
instruction = "Saia do lobby, vá até a segunda prateleira, pare."
done = False
while not done:
frame = camera.read() # única imagem RGB
obs_history.append(frame)
action = model.predict(instruction, obs_history)
if action.type == "point": # alvo visível na imagem
robot.move_to_pixel(action.x, action.y, action.heading)
else: # alvo fora do campo de visão
robot.move_local(action.forward_m, action.left_m, action.turn_deg)
done = action.stopTreinamento eficiente
O Robostral Navigate não parte de VLMs open-source existentes. A Mistral construiu tudo sobre seu próprio modelo de visão-linguagem treinado para tarefas de grounding: apontamento, contagem e localização de objetos. A navegação emerge como extensão natural: se o modelo sabe onde as coisas estão, ele aprende como se mover até elas.
Os dados de treinamento foram gerados inteiramente em simulação: aproximadamente 400.000 trajetórias coletadas em 6.000 cenários diferentes. Para o treinamento, a Mistral usou prefix-caching com uma estratégia de attention-masking em árvore que comprime um episódio inteiro em uma única sequência.
O resultado: 22× menos tokens de treinamento mantendo todos os sinais de aprendizado. Na prática, treinamentos que levariam meses agora terminam em dias.
Após o treinamento supervisionado, a Mistral aplicou CISPO, um algoritmo de reinforcement learning online. Essa fase permite que o modelo aprenda por tentativa e erro, se recupere de falhas e adquira comportamentos exploratórios. Sozinho, o CISPO adicionou +3,2% de taxa de sucesso.
Benchmarks: estado da arte
O Robostral Navigate foi avaliado no R2R-CE (Room-to-Room in Continuous Environments), o benchmark padrão para navegação por instrução. Os números são expressivos:
| Métrica | Resultado |
|---|---|
| Sucesso (val seen) | 79,4% |
| Sucesso (val unseen) | 76,6% |
| vs. melhor single-camera | +9,7 pontos |
| vs. melhor depth/multi-camera | +4,5 pontos |
Comparativo com sistemas tradicionais
| Atributo | Robostral Navigate | Sistemas VLN multi-sensor típicos |
|---|---|---|
| Sensores | Única câmera RGB | Depth, LiDAR ou múltiplas câmeras |
| Modelo | 8B, construído in-house | Varia por abordagem |
| Modelo base | VLM de grounding próprio | Geralmente VLMs open-source |
| Dados de treino | ~400k trajetórias simuladas, 6k cenários | Mistura de simulação e dados reais |
| Decisão | Pointing + fallback local | Deslocamentos métricos ou planejamento com mapa |
| R2R-CE val-unseen | 76,6% | 4,5 pts abaixo (melhor multi-sensor) |
| Robôs suportados | Rodados, com pernas, drones; múltiplos tamanhos | Frequentemente específico por plataforma |
Casos de uso práticos
- Manufatura: robô carrega peças entre estações de trabalho com uma única instrução em linguagem natural
- Logística: robô com rodas transporta pacotes em armazéns sem necessidade de mapa pré-programado
- Hotelaria: robô guia hóspedes do lobby até o quarto, navegando entre pessoas em movimento
- Frotas heterogêneas: o mesmo modelo funciona em robôs com rodas, pernas e até drones, mantendo robustez a diferentes câmeras
Por que isso importa
O Robostral Navigate redefine o trade-off entre hardware e software na robótica móvel. Até agora, a navegação autônoma confiável exigia sensores caros (LiDAR pode custar dezenas de milhares de reais) ou múltiplas câmeras calibradas. A Mistral mostra que um modelo de 8B bem treinado extrai informação espacial suficiente de uma única câmera para superar sistemas muito mais complexos em hardware.
A eficiência do treinamento também é um sinal importante: reduzir em 22× os tokens necessários e treinar em dias em vez de meses aproxima a robótica do ritmo de iteração que vimos em LLMs nos últimos dois anos. Se essa tendência se mantiver, a robótica pode estar entrando em sua própria era de scaling laws.
Os detalhes técnicos completos estão disponíveis no site da Mistral AI.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



