Robostral Navigate da Mistral: Robô Vê por uma Câmera e Navega Sozinho
Mistral apresentou Robostral Navigate — modelo de 8B para navegação autônoma de robôs que funciona apenas com vídeo de uma câmera RGB. Outros sistemas usam LiDAR, sensores de profundidade ou múltiplas câmeras simultaneamente. Robostral atinge 76,6% de sucesso em testes de referência R2R-CE (Room-to-Room) e supera abordagens multissensoriais por 4,5 pontos percentuais. Funciona em robôs com rodas, andadores e voadores. Treinado inteiramente em simulação em 400 mil trajetórias.
Processado por IA de Mistral AI News; editado por Hamidun News
Mistral AI apresentou Robostral Navigate — seu primeiro modelo para navegação autônoma de robôs, que se orienta no espaço usando vídeo de uma única câmera RGB padrão e demonstra 76,6% de tentativas bem-sucedidas no teste R2R-CE para ambientes não encontrados durante o treinamento.
O que o modelo pode fazer
Robostral Navigate é um modelo de 8 bilhões de parâmetros que, com base em um quadro de câmera e instruções de texto, guia um robô através de ambientes complexos: escritórios, edifícios residenciais ou comerciais, espaços ao ar livre. A instrução poderia soar como: "Saia do saguão, caminhe pelo corredor, entre no armário de armazenamento e pare na frente da segunda prateleira" — e o modelo guia o robô por toda a rota autonomamente, sem intervenção humana.
- Taxa de sucesso de 79,4% na validação R2R-CE em cenários familiares e 76,6% em cenários não vistos
- Superioridade sobre a melhor abordagem de câmera única — 9,7 pontos, sobre o melhor sistema com lidar ou múltiplas câmeras — 4,5 pontos
- Funciona em robôs com rodas, com pernas e voadores, resistente a diferenças nos parâmetros da câmera
- Conjunto de dados de treinamento — aproximadamente 400.000 trajetórias coletadas em 6.000 cenários simulados
Como o modelo encontra o caminho
Robostral Navigate não prediz deslocamento métrico, mas um ponto na imagem: coordenadas alvo no quadro de câmera atual e a orientação necessária na chegada. Este método de navegação por "apontamento" é resistente a mudanças de lente e variações de escala de cena — ao contrário de comandos baseados em distâncias métricas. Quando o alvo sai do campo de visão, o modelo muda para deslocamentos de coordenadas locais relativos ao robô, por exemplo: "Avance 2 metros para frente, 1,5 metros para a esquerda e gire 25 graus para a esquerda".
Como Robostral Navigate foi treinado
O modelo é construído inteiramente dentro de Mistral AI e não depende de modelos de linguagem visual de código aberto — é inicializado com base no próprio modelo da empresa, especializado em tarefas de apontamento, contagem e localização de objetos. Um elemento-chave do treinamento é o método de cache de prefixo: ele comprime um episódio inteiro em uma sequência e permite treinar em todas as etapas de tempo em uma única passagem, reduzindo tokens de treinamento em 22 vezes em comparação com o treinamento em etapas individuais. Após a etapa de aprendizado supervisionado, o modelo é ainda melhorado através de aprendizado por reforço online usando o algoritmo CISPO, que permite que aprenda com seus próprios erros e se recupere de falhas.
"Hoje apresentamos
Robostral Navigate — nosso primeiro modelo para navegação incorporada", de acordo com o blog oficial do Mistral AI.
O que isto significa
Navegação usando apenas uma câmera única sem lidar e sensores de profundidade reduz o custo e a complexidade dos robôs para armazéns, entrega, hotéis e fabricação — Mistral AI nomeia diretamente estas indústrias como os primeiros beneficiários da tecnologia.
Perguntas frequentes
Em quais robôs o Robostral Navigate pode funcionar?
O modelo funciona em robôs com rodas, com pernas e voadores e se generaliza para diferentes tamanhos de plataforma — Mistral AI confirma isto na descrição do modelo.
Quantos dados foram necessários para o treinamento?
A empresa coletou aproximadamente 400.000 trajetórias em 6.000 cenários simulados — todo o pipeline de geração de dados é construído inteiramente em simulação, sem usar robôs reais na etapa de coleta de dados.
Qual é a precisão do
Robostral Navigate comparado aos concorrentes?
No teste R2R-CE para ambientes não vistos, o modelo supera a melhor abordagem de câmera única em 9,7 pontos e o melhor sistema com múltiplas câmeras ou sensor de profundidade — em 4,5 pontos, com 76,6% final de tentativas bem-sucedidas.
Como a métrica R2R-CE difere dos testes de navegação padrão?
R2R-CE (Room-to-Room in Continuous Environments) testa quão bem o modelo segue instruções de texto em ambientes não incluídos na amostra de treinamento — neste cenário Robostral Navigate alcança resultado de 76,6%, não em cenários familiares onde o resultado é ainda mais alto.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.