Habr AI→ original

Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы

МТС в RnD-направлении Physical AI разрабатывает VLA-политику (Vision-Language-Action) для полноростового гуманоида. Главная проблема: робот уверенно берёт предмет со стола в статичной сцене, но начинает промахиваться, когда объект едет по конвейеру. Полноростовой робот при этом должен ещё и делать шаги, удерживая баланс тела, — а это многократно усложняет расчёт движений.

Procesado por IA desde Habr AI; editado por Hamidun News
Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы
Fuente: Habr AI. Collage: Hamidun News.
◐ Escuchar artículo

El 22 de julio de 2026, la ingeniera de ML de MTS Dania publicó en el blog corporativo de Habr un análisis sobre cómo el equipo de I+D de Physical AI de la compañía enseña a un humanoide de tamaño completo a agarrar objetos que se mueven por una cinta transportadora mediante una política VLA (Vision-Language-Action, "visión-lenguaje-acción").

Cuál es el problema principal

El humanoide agarra con seguridad un objeto de una mesa, pero empieza a fallar cuando ese mismo objeto se mueve por una cinta transportadora; precisamente en esta tarea se concentra el equipo de MTS. En una escena estática el objeto está inmóvil, la iluminación es estable y la cámara apunta al área de trabajo, por lo que los modelos VLA actuales muestran una calidad de control alta. En cuanto el objeto empieza a moverse, la precisión habitual de agarre desaparece: un modelo entrenado con escenas estáticas no logra seguir el ritmo de la geometría cambiante de la tarea.

Según la ingeniera, no se trata de un fallo aislado, sino de una limitación sistémica de un enfoque que funciona muy bien en demostraciones de laboratorio, pero se traslada mal a una cinta transportadora real.

El robot agarra con seguridad un objeto de una mesa, pero empieza a

fallar cuando el objeto se mueve por una cinta transportadora.

— Dania, ingeniera de ML, MTC Web Services

Por qué una escena dinámica es más difícil que una estática

Un entorno dinámico añade dos niveles de dificultad a la vez: se mueve el propio objeto y se mueve el robot, que debe adaptarse a él. La mayoría de las demostraciones espectaculares de robots todavía se graban en estático: los objetos están cuidadosamente colocados sobre una mesa y la escena apenas cambia. Las tareas reales, tanto domésticas como industriales, no se ven así: como mínimo los objetos se desplazan por una cinta transportadora, y el agarre debe calcularse teniendo en cuenta su velocidad y su trayectoria.

Datos clave del proyecto:

  • Equipo — unidad de I+D de Physical AI en MTC Web Services
  • Tecnología — política VLA (Vision-Language-Action) para un humanoide
  • Autora del análisis — Dania, ingeniera de ML de MTS
  • Enfoque — agarre de objetos que se mueven por una cinta transportadora, no objetos colocados sobre una mesa
  • Fecha de publicación del análisis — 22 de julio de 2026

Por qué es más difícil para un humanoide que para un manipulador

Un robot de tamaño completo no solo tiene que alcanzar el objeto, sino también mantener el equilibrio de todo su cuerpo. Un manipulador fijo resuelve una tarea más simple: tiene la base fija y todo el modelo solo se ocupa del movimiento del brazo. El humanoide, para el mismo agarre, se ve obligado a dar pasos y compensar el desplazamiento de su centro de gravedad con movimientos adicionales del cuerpo.

Cada uno de esos movimientos cambia la posición de la cámara y del brazo respecto al objeto, que en ese mismo momento también se está moviendo. Como resultado, el cálculo de los movimientos se complica de forma exponencial: el modelo debe predecir simultáneamente la trayectoria del objeto, planificar el agarre y mantener la estabilidad del robot. Precisamente esa combinación es la que el equipo de MTS está tratando de resolver ahora dentro de su dirección de Physical AI.

Qué significa esto

El paso de las demostraciones estáticas al trabajo con objetos en movimiento es una de las principales barreras en el camino de los humanoides desde el laboratorio hasta la producción real. El análisis de MTS muestra que incluso la operación básica de "tomar un objeto" deja de ser trivial en cuanto la escena cobra vida, y que la aplicación industrial de los robots VLA no tropieza con la fuerza de agarre, sino con la dinámica del entorno.

Preguntas frecuentes

¿Qué es una política VLA?

VLA (Vision-Language-Action) es un modelo de control de robots que conecta la visión, una instrucción en lenguaje natural y la acción: el robot "ve" la escena, entiende la tarea y planifica el movimiento. En escenas estáticas, según el análisis de MTS, estos modelos muestran una calidad de agarre alta.

¿Por qué un entorno dinámico es más difícil para un humanoide?

Porque se mueven tanto el objeto como el propio robot. Para agarrar el objeto, un humanoide de tamaño completo tiene que dar pasos y mantener el equilibrio del cuerpo con movimientos adicionales, por lo que el cálculo de los movimientos se complica de forma exponencial en comparación con un manipulador fijo.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…