Ant Group Presentó LingBot-VLA 2.0 — Modelo Abierto para Controlar Robots de Cualquier Diseño
Robbyant, parte de Ant Group, lanzó LingBot-VLA 2.0, un modelo abierto de visión-lenguaje-acción para control de robot multiplataforma. El modelo de 6 mil millones de parámetros entrenado en 60 mil horas de datos: 50 mil horas de video de 20 configuraciones de robot y 10 mil horas de video en primera persona. Mapea cualquier robot a un espacio de acción unificado de 55 dimensiones para brazos, pinzas deltoides, torsos y bases móviles. En benchmark GM-100 LingBot-VLA 2.0 supera π0.5 y versión 1.0.
Procesado por IA desde MarkTechPost; editado por Hamidun News
Robbyant, la división de robótica de Ant Group, lanzó LingBot-VLA 2.0 el 8 de julio de 2026 — un modelo abierto de visión-lenguaje-acción con 6 mil millones de parámetros para controlar robots de diferentes diseños bajo la licencia Apache 2.0.
Con qué datos se entrenó el modelo
LingBot-VLA 2.0 fue preentrenado aproximadamente en 60,000 horas de datos, según MarkTechPost. De estos, 50,000 horas son trayectorias de robots recopiladas en 20 configuraciones de robots diferentes, y otras 10,000 horas son video egocéntrico de personas grabado desde la perspectiva de primera persona mientras realizan acciones domésticas y de manipulación.
- Desarrollador — Robbyant, la división de robótica de Ant Group; el lanzamiento ocurrió el 8 de julio de 2026
- Licencia — Apache 2.0, el checkpoint del modelo está abierto para descarga
- Tamaño del modelo — 6 mil millones de parámetros (6B)
- Volumen de datos de preentrenamiento — aproximadamente 60,000 horas (50,000 horas de trayectorias de robots en 20 configuraciones de robots + 10,000 horas de video con personas)
- Espacio de acción unificado — 55 dimensiones para todos los tipos de robots
Cómo el modelo controla diferentes robots
LingBot-VLA 2.0 convierte el control de cualquier robot en un espacio de acción canónico unificado de 55 dimensiones que abarca brazos, pinzas diestras, cintura, cabeza y plataformas móviles, explica MarkTechPost. Este enfoque resuelve el problema principal de los modelos cross-embodiment: previamente, para cada construcción de robot — con diferentes números de articulaciones, tipo de pinza o presencia de base móvil — tenías que entrenar un modelo de control separado, y un espacio de acción unificado permite que el mismo checkpoint funcione en 20 configuraciones.
El módulo de acción a nivel de token basado en Mixture-of-Experts ayuda a escalar el modelo sin pérdida de calidad, evitando la necesidad de una función de pérdida auxiliar para equilibrar la carga entre expertos. Esto permite aumentar la capacidad del modelo sin agregar un término adicional a la función de pérdida, que típicamente ralentiza y complica el entrenamiento de tales arquitecturas.
De dónde el modelo obtiene la geometría y el tiempo
La destilación de doble consulta de modelos LingBot-Depth y DINO-Video agrega supervisión geométrica y temporal, lo que ayuda a LingBot-VLA 2.0 a tener en cuenta el estado futuro de la escena al elegir una acción, según MarkTechPost. En otras palabras, el modelo "entiende" de antemano cómo cambiará la geometría de la escena y las posiciones de los objetos después de realizar el paso actual, en lugar de solo reaccionar a un fotograma estático.
Cuánto LingBot-VLA 2.0 supera a los competidores
En el conjunto de pruebas GM-100 para agentes de robots universales, LingBot-VLA 2.0 superó tanto al modelo π0.5 como a la versión anterior LingBot-VLA-1.0 en ambas plataformas de robots probadas, reporta MarkTechPost. El desempeño superior sobre el predecesor y el modelo de terceros π0.5 en el mismo benchmark confirma que las mejoras — espacio de acción unificado, módulo MoE y destilación de doble consulta — proporcionan ganancias de calidad medibles, no solo aumento de parámetros.
Qué significa esto
Un modelo abierto con 6 mil millones de parámetros que funciona igualmente bien en 20 configuraciones de robots diferentes reduce la barrera de entrada para equipos que desean entrenar agentes de robots universales sin recopilar conjuntos de datos separados para cada diseño de robot específico.
Preguntas Frecuentes
¿Qué significa la abreviatura VLA en el nombre del modelo?
VLA significa vision-language-action — el modelo procesa una imagen e instrucción de texto y genera una acción de robot en un solo paso.
¿Se puede usar LingBot-VLA 2.0 de forma gratuita?
Sí, el modelo se lanza bajo la licencia Apache 2.0, que permite el uso libre, modificación y aplicación comercial del checkpoint, incluyendo integración en productos de robótica propietarios.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.