Habr AI→ оригинал

Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы

МТС в RnD-направлении Physical AI разрабатывает VLA-политику (Vision-Language-Action) для полноростового гуманоида. Главная проблема: робот уверенно берёт предмет со стола в статичной сцене, но начинает промахиваться, когда объект едет по конвейеру. Полноростовой робот при этом должен ещё и делать шаги, удерживая баланс тела, — а это многократно усложняет расчёт движений.

AI-обработка оригинала Habr AI; редакция Hamidun News
Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы
Источник: Habr AI. Коллаж: Hamidun News.
◐ Слушать статью

22 июля 2026 года ML-инженер МТС Дания опубликовала в корпоративном блоге на Habr разбор того, как в RnD-направлении Physical AI компании учат полноростового гуманоида брать предметы, движущиеся по конвейеру, с помощью VLA-политики (Vision-Language-Action, «зрение — язык — действие»).

В чём главная проблема

Гуманоид уверенно берёт предмет со стола, но начинает промахиваться, когда тот же предмет едет по конвейеру, — именно на этой задаче сосредоточена команда МТС. В статичной сцене объект неподвижен, освещение стабильно, а камера направлена в рабочую зону, поэтому современные VLA-модели показывают высокое качество управления. Как только предмет приходит в движение, привычная точность захвата пропадает: модель, обученная на неподвижных сценах, не успевает за меняющейся геометрией задачи.

По словам инженера, это не единичный сбой, а системное ограничение подхода, который отлично работает в лабораторных демонстрациях, но плохо переносится на реальный конвейер.

Робот уверенно берёт предмет со стола, но начинает промахиваться,

когда предмет едет по конвейеру.

— Дания, ML-инженер MTC Web Services

Чем динамическая сцена сложнее статичной

Динамическая среда добавляет сразу два уровня сложности: движется сам объект и движется робот, который должен под него подстроиться. Большинство эффектных демонстраций роботов до сих пор снимают в статике — предметы аккуратно разложены на столе, сцена почти не меняется. Реальные задачи в быту и на производстве так не выглядят: как минимум объекты едут по конвейеру, и захват нужно рассчитывать с учётом их скорости и траектории.

Ключевые вводные проекта:

  • Команда — RnD-направление Physical AI в MTC Web Services
  • Технология — VLA-политика (Vision-Language-Action) для гуманоида
  • Автор разбора — Дания, ML-инженер МТС
  • Фокус — захват предметов, движущихся по конвейеру, а не лежащих на столе
  • Дата публикации разбора — 22 июля 2026 года

Почему гуманоиду тяжелее, чем манипулятору

Полноростовому роботу приходится не только тянуться к предмету, но и удерживать баланс всего тела. Закреплённый манипулятор решает более простую задачу: у него зафиксировано основание, и вся модель отвечает только за движение руки. Гуманоид же для того же захвата вынужден делать шаги и компенсировать смещение центра тяжести дополнительными движениями корпуса.

Каждое такое движение меняет положение камеры и руки относительно предмета, который в этот момент тоже едет. В результате расчёт движений усложняется многократно: модель должна одновременно предсказывать траекторию объекта, планировать захват и поддерживать устойчивость робота. Именно эту связку команда МТС сейчас и пытается собрать в рамках направления Physical AI.

Что это значит

Переход от статичных демонстраций к работе с движущимися объектами — один из главных барьеров на пути гуманоидов из лаборатории на реальное производство. Разбор МТС показывает, что даже базовая операция «взять предмет» перестаёт быть тривиальной, как только сцена оживает, и что промышленное применение VLA-роботов упирается не в силу захвата, а в динамику среды.

Частые вопросы

Что такое VLA-политика?

VLA (Vision-Language-Action) — это модель управления роботом, которая связывает зрение, языковую инструкцию и действие: робот «видит» сцену, понимает задачу и планирует движение. В статичных сценах, по данным разбора МТС, такие модели показывают высокое качество захвата.

Почему динамическая среда сложнее для гуманоида?

Потому что двигается и предмет, и сам робот. Полноростовому гуманоиду для захвата приходится делать шаги и удерживать баланс тела дополнительными движениями, поэтому расчёт движений усложняется многократно по сравнению с закреплённым манипулятором.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…