Habr AI→ original

Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы

МТС в RnD-направлении Physical AI разрабатывает VLA-политику (Vision-Language-Action) для полноростового гуманоида. Главная проблема: робот уверенно берёт предмет со стола в статичной сцене, но начинает промахиваться, когда объект едет по конвейеру. Полноростовой робот при этом должен ещё и делать шаги, удерживая баланс тела, — а это многократно усложняет расчёт движений.

Traité par IA depuis Habr AI ; édité par Hamidun News
Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы
Source : Habr AI. Collage: Hamidun News.
◐ Écouter l'article

Le 22 juillet 2026, Dania, ingénieure ML chez MTS, a publié sur le blog d'entreprise sur Habr une analyse de la manière dont l'équipe R&D Physical AI de l'entreprise apprend à un humanoïde grandeur nature à saisir des objets se déplaçant sur un tapis roulant à l'aide d'une politique VLA (Vision-Language-Action, « vision-langage-action »).

Quel est le principal problème

L'humanoïde saisit sans problème un objet posé sur une table, mais commence à le manquer lorsque ce même objet se déplace sur un tapis roulant — c'est précisément sur cette tâche que se concentre l'équipe de MTS. Dans une scène statique, l'objet est immobile, l'éclairage est stable et la caméra est dirigée vers la zone de travail, si bien que les modèles VLA actuels affichent une grande qualité de contrôle. Dès que l'objet se met en mouvement, la précision de préhension habituelle disparaît : un modèle entraîné sur des scènes statiques ne parvient pas à suivre la géométrie changeante de la tâche.

Selon l'ingénieure, il ne s'agit pas d'un échec isolé, mais d'une limite systémique d'une approche qui fonctionne très bien lors de démonstrations en laboratoire, mais se transpose mal à un tapis roulant réel.

Le robot saisit sans problème un objet posé sur une table, mais

commence à le manquer lorsque l'objet se déplace sur un tapis roulant.

— Dania, ingénieure ML, MTC Web Services

En quoi une scène dynamique est plus difficile qu'une scène statique

Un environnement dynamique ajoute d'un coup deux niveaux de complexité : l'objet lui-même se déplace, et le robot, qui doit s'adapter à lui, se déplace aussi. La plupart des démonstrations spectaculaires de robots sont encore filmées en conditions statiques — les objets sont soigneusement disposés sur une table, et la scène change à peine. Les tâches réelles, tant domestiques qu'industrielles, ne ressemblent pas à cela : au minimum, les objets se déplacent sur un tapis roulant, et la préhension doit être calculée en tenant compte de leur vitesse et de leur trajectoire.

Les données clés du projet :

  • Équipe — unité R&D Physical AI chez MTC Web Services
  • Technologie — politique VLA (Vision-Language-Action) pour un humanoïde
  • Autrice de l'analyse — Dania, ingénieure ML chez MTS
  • Objectif — saisir des objets se déplaçant sur un tapis roulant, et non posés sur une table
  • Date de publication de l'analyse — 22 juillet 2026

Pourquoi c'est plus difficile pour un humanoïde que pour un bras manipulateur

Un robot grandeur nature doit non seulement tendre vers l'objet, mais aussi maintenir l'équilibre de tout son corps. Un bras manipulateur fixe résout une tâche plus simple : sa base est fixée, et tout le modèle ne gère que le mouvement du bras. L'humanoïde, pour la même préhension, est contraint de faire des pas et de compenser le déplacement de son centre de gravité par des mouvements supplémentaires du corps.

Chacun de ces mouvements modifie la position de la caméra et du bras par rapport à l'objet, qui à ce même moment est également en mouvement. Résultat : le calcul des mouvements se complique considérablement : le modèle doit à la fois prédire la trajectoire de l'objet, planifier la préhension et maintenir la stabilité du robot. C'est précisément cette combinaison que l'équipe de MTS essaie aujourd'hui de mettre en place dans le cadre de sa direction Physical AI.

Ce que cela signifie

Le passage des démonstrations statiques au travail avec des objets en mouvement est l'un des principaux obstacles sur le chemin des humanoïdes, du laboratoire à la production réelle. L'analyse de MTS montre que même l'opération de base consistant à « saisir un objet » cesse d'être triviale dès que la scène s'anime, et que l'application industrielle des robots VLA ne bute pas sur la force de préhension, mais sur la dynamique de l'environnement.

Questions fréquentes

Qu'est-ce qu'une politique VLA ?

VLA (Vision-Language-Action) est un modèle de contrôle de robot qui relie la vision, une instruction en langage naturel et l'action : le robot « voit » la scène, comprend la tâche et planifie le mouvement. Dans les scènes statiques, selon l'analyse de MTS, ces modèles affichent une grande qualité de préhension.

Pourquoi un environnement dynamique est-il plus difficile pour un humanoïde ?

Parce que l'objet et le robot lui-même se déplacent tous les deux. Pour saisir l'objet, un humanoïde grandeur nature doit faire des pas et maintenir l'équilibre de son corps par des mouvements supplémentaires, si bien que le calcul des mouvements se complique considérablement par rapport à un bras manipulateur fixe.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…