Mistral AI News→ original

Robostral Navigate da Mistral: Robô Vê por uma Câmera e Navega Sozinho

Mistral apresentou Robostral Navigate — modelo de 8B para navegação autônoma de robôs que funciona apenas com vídeo de uma câmera RGB. Outros sistemas usam LiDAR, sensores de profundidade ou múltiplas câmeras simultaneamente. Robostral atinge 76,6% de sucesso em testes de referência R2R-CE (Room-to-Room) e supera abordagens multissensoriais por 4,5 pontos percentuais. Funciona em robôs com rodas, andadores e voadores. Treinado inteiramente em simulação em 400 mil trajetórias.

Processado por IA de Mistral AI News; editado por Hamidun News
Robostral Navigate da Mistral: Robô Vê por uma Câmera e Navega Sozinho
Fonte: Mistral AI News. Colagem: Hamidun News.
◐ Ouvir artigo

Mistral AI apresentou Robostral Navigate — seu primeiro modelo para navegação autônoma de robôs, que se orienta no espaço usando vídeo de uma única câmera RGB padrão e demonstra 76,6% de tentativas bem-sucedidas no teste R2R-CE para ambientes não encontrados durante o treinamento.

O que o modelo pode fazer

Robostral Navigate é um modelo de 8 bilhões de parâmetros que, com base em um quadro de câmera e instruções de texto, guia um robô através de ambientes complexos: escritórios, edifícios residenciais ou comerciais, espaços ao ar livre. A instrução poderia soar como: "Saia do saguão, caminhe pelo corredor, entre no armário de armazenamento e pare na frente da segunda prateleira" — e o modelo guia o robô por toda a rota autonomamente, sem intervenção humana.

  • Taxa de sucesso de 79,4% na validação R2R-CE em cenários familiares e 76,6% em cenários não vistos
  • Superioridade sobre a melhor abordagem de câmera única — 9,7 pontos, sobre o melhor sistema com lidar ou múltiplas câmeras — 4,5 pontos
  • Funciona em robôs com rodas, com pernas e voadores, resistente a diferenças nos parâmetros da câmera
  • Conjunto de dados de treinamento — aproximadamente 400.000 trajetórias coletadas em 6.000 cenários simulados

Como o modelo encontra o caminho

Robostral Navigate não prediz deslocamento métrico, mas um ponto na imagem: coordenadas alvo no quadro de câmera atual e a orientação necessária na chegada. Este método de navegação por "apontamento" é resistente a mudanças de lente e variações de escala de cena — ao contrário de comandos baseados em distâncias métricas. Quando o alvo sai do campo de visão, o modelo muda para deslocamentos de coordenadas locais relativos ao robô, por exemplo: "Avance 2 metros para frente, 1,5 metros para a esquerda e gire 25 graus para a esquerda".

Como Robostral Navigate foi treinado

O modelo é construído inteiramente dentro de Mistral AI e não depende de modelos de linguagem visual de código aberto — é inicializado com base no próprio modelo da empresa, especializado em tarefas de apontamento, contagem e localização de objetos. Um elemento-chave do treinamento é o método de cache de prefixo: ele comprime um episódio inteiro em uma sequência e permite treinar em todas as etapas de tempo em uma única passagem, reduzindo tokens de treinamento em 22 vezes em comparação com o treinamento em etapas individuais. Após a etapa de aprendizado supervisionado, o modelo é ainda melhorado através de aprendizado por reforço online usando o algoritmo CISPO, que permite que aprenda com seus próprios erros e se recupere de falhas.

"Hoje apresentamos

Robostral Navigate — nosso primeiro modelo para navegação incorporada", de acordo com o blog oficial do Mistral AI.

O que isto significa

Navegação usando apenas uma câmera única sem lidar e sensores de profundidade reduz o custo e a complexidade dos robôs para armazéns, entrega, hotéis e fabricação — Mistral AI nomeia diretamente estas indústrias como os primeiros beneficiários da tecnologia.

Perguntas frequentes

Em quais robôs o Robostral Navigate pode funcionar?

O modelo funciona em robôs com rodas, com pernas e voadores e se generaliza para diferentes tamanhos de plataforma — Mistral AI confirma isto na descrição do modelo.

Quantos dados foram necessários para o treinamento?

A empresa coletou aproximadamente 400.000 trajetórias em 6.000 cenários simulados — todo o pipeline de geração de dados é construído inteiramente em simulação, sem usar robôs reais na etapa de coleta de dados.

Qual é a precisão do

Robostral Navigate comparado aos concorrentes?

No teste R2R-CE para ambientes não vistos, o modelo supera a melhor abordagem de câmera única em 9,7 pontos e o melhor sistema com múltiplas câmeras ou sensor de profundidade — em 4,5 pontos, com 76,6% final de tentativas bem-sucedidas.

Como a métrica R2R-CE difere dos testes de navegação padrão?

R2R-CE (Room-to-Room in Continuous Environments) testa quão bem o modelo segue instruções de texto em ambientes não incluídos na amostra de treinamento — neste cenário Robostral Navigate alcança resultado de 76,6%, não em cenários familiares onde o resultado é ainda mais alto.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…