Robostral Navigate de Mistral: Robot ve a Través de una Cámara y se Navega Solo
Mistral presentó Robostral Navigate — modelo de 8B para navegación autónoma de robots que funciona solo con video de una sola cámara RGB. Otros sistemas usan LiDAR, sensores de profundidad o múltiples cámaras simultáneamente. Robostral alcanza 76,6% de éxito en pruebas de referencia R2R-CE (Room-to-Room) y supera enfoques multisensoriales por 4,5 puntos porcentuales. Funciona en robots con ruedas, caminantes y voladores. Entrenado completamente en simulación en 400 mil trayectorias.
Procesado por IA desde Mistral AI News; editado por Hamidun News
Mistral AI presentó Robostral Navigate — su primer modelo para navegación autónoma de robots, que se orienta en el espacio utilizando video de una sola cámara RGB estándar y demuestra un 76,6% de intentos exitosos en la prueba R2R-CE para entornos no encontrados durante el entrenamiento.
Qué puede hacer el modelo
Robostral Navigate es un modelo de 8 mil millones de parámetros que, basado en un fotograma de cámara e instrucciones de texto, guía un robot a través de entornos complejos: oficinas, edificios residenciales o comerciales, espacios al aire libre. La instrucción podría sonar como: "Sal del vestíbulo, camina por el pasillo, entra en el armario de almacenamiento y detente frente a la segunda estantería" — y el modelo guía al robot a través de toda la ruta de forma autónoma, sin intervención humana.
- Tasa de éxito del 79,4% en validación R2R-CE en escenarios familiares y 76,6% en los no vistos
- Superioridad sobre el mejor enfoque de cámara única — 9,7 puntos, sobre el mejor sistema con lidar o múltiples cámaras — 4,5 puntos
- Funciona en robots con ruedas, de patas y voladores, resistente a diferencias en parámetros de cámara
- Conjunto de datos de entrenamiento — aproximadamente 400.000 trayectorias recopiladas en 6.000 escenarios simulados
Cómo el modelo encuentra el camino
Robostral Navigate no predice desplazamiento métrico, sino un punto en la imagen: coordenadas objetivo en el fotograma de cámara actual y la orientación requerida al llegar. Este método de navegación por "señalamiento" es resistente a cambios de lentes y variaciones de escala de escena — a diferencia de comandos basados en distancias métricas. Cuando el objetivo se sale del campo de visión, el modelo cambia a desplazamientos de coordenadas locales relativos al robot, por ejemplo: "Avanza 2 metros hacia adelante, 1,5 metros hacia la izquierda y gira 25 grados hacia la izquierda".
Cómo se entrenó Robostral Navigate
El modelo se construyó completamente dentro de Mistral AI y no se basa en modelos de visión-lenguaje de código abierto — se inicializa en función del propio modelo de la empresa, especializado en tareas de señalamiento, conteo y localización de objetos. Un elemento clave del entrenamiento es el método de almacenamiento en caché de prefijo: comprime un episodio completo en una secuencia y permite entrenar en todos los pasos de tiempo en una sola pasada, reduciendo tokens de entrenamiento en 22 veces en comparación con entrenar en pasos individuales. Después de la etapa de aprendizaje supervisado, el modelo se mejora aún más mediante aprendizaje por refuerzo en línea usando el algoritmo CISPO, que le permite aprender de sus propios errores y recuperarse de fallas.
"Hoy presentamos
Robostral Navigate — nuestro primer modelo para navegación incorporada", según el blog oficial de Mistral AI.
Qué significa esto
La navegación utilizando solo una sola cámara sin lidar y sensores de profundidad reduce el costo y la complejidad de los robots para almacenes, entrega, hoteles y fabricación — Mistral AI nombra directamente estas industrias como los primeros beneficiarios de la tecnología.
Preguntas frecuentes
¿En qué robots puede funcionar Robostral Navigate?
El modelo funciona en robots con ruedas, de patas y voladores y se generaliza a diferentes tamaños de plataforma — Mistral AI confirma esto en la descripción del modelo.
¿Cuántos datos fueron requeridos para el entrenamiento?
La empresa recopiló aproximadamente 400.000 trayectorias en 6.000 escenarios simulados — todo el pipeline de generación de datos se construye completamente en simulación, sin usar robots reales en la etapa de recopilación de datos.
¿Cuánto más preciso es
Robostral Navigate que los competidores?
En la prueba R2R-CE para entornos no vistos, el modelo supera al mejor enfoque de cámara única en 9,7 puntos y al mejor sistema con múltiples cámaras o sensor de profundidad — en 4,5 puntos, con un 76,6% final de intentos exitosos.
¿Cómo difiere la métrica R2R-CE de las pruebas de navegación estándar?
R2R-CE (Room-to-Room in Continuous Environments) prueba qué tan bien el modelo sigue instrucciones de texto en entornos no incluidos en la muestra de entrenamiento — en este escenario Robostral Navigate logra un resultado del 76,6%, no en escenarios familiares donde el resultado es aún más alto.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.