Ant Group представила LingBot-VLA 2.0 — открытую модель для управления роботами любой конструкции
Подразделение Ant Group — Robbyant — выпустило LingBot-VLA 2.0, открытую vision-language-action модель на 6 миллиардов параметров под лицензией Apache 2.0. Модель предобучена на 60 000 часов данных и управляет роботами 20 разных конфигураций через единое 55-мерное пространство действий. На бенчмарке GM-100 она обходит модель π0.5 и предыдущую версию LingBot-VLA-1.0.
AI-обработка оригинала MarkTechPost; редакция Hamidun News
Робототехническое подразделение Ant Group — Robbyant — 8 июля 2026 года выпустило LingBot-VLA 2.0, открытую vision-language-action модель на 6 миллиардов параметров для управления роботами разных конструкций под лицензией Apache 2.0.
На каких данных обучена модель
LingBot-VLA 2.0 предобучена примерно на 60 000 часов данных, сообщает издание MarkTechPost. Из них 50 000 часов — это траектории роботов, собранные на 20 разных конфигурациях роботов, а ещё 10 000 часов — эгоцентрическое видео с людьми, снятое от первого лица во время выполнения бытовых и манипуляционных действий.
- Разработчик — Robbyant, подразделение Ant Group; релиз состоялся 8 июля 2026 года
- Лицензия — Apache 2.0, чекпоинт модели открыт для скачивания
- Размер модели — 6 млрд параметров (6B)
- Объём предобучающих данных — около 60 000 часов (50 000 часов роботических траекторий на 20 конфигурациях роботов + 10 000 часов видео с людьми)
- Единое пространство действий — 55 измерений на все типы роботов
Как модель управляет разными роботами
LingBot-VLA 2.0 переводит управление любым роботом в единое 55-мерное каноническое пространство действий, которое охватывает руки, ловкие кисти, талию, голову и мобильные платформы, поясняет MarkTechPost. Такой подход решает главную проблему cross-embodiment моделей: раньше под каждую конструкцию робота — с разным числом суставов, типом захвата или наличием мобильной базы — приходилось обучать отдельную модель управления, а единое пространство действий позволяет одному и тому же чекпоинту работать сразу на 20 конфигурациях.
Масштабировать модель без потери качества помогает token-level модуль действий на основе Mixture-of-Experts, который обходится без вспомогательной функции потерь для балансировки нагрузки между экспертами. Это позволяет наращивать ёмкость модели, не добавляя лишний член в функцию потерь, который обычно замедляет и усложняет обучение подобных архитектур.
Откуда модель берёт геометрию и время
Dual-query дистилляция из моделей LingBot-Depth и DINO-Video добавляет геометрическую и временную супервизию, которая помогает LingBot-VLA 2.0 учитывать будущее состояние сцены при выборе действия, говорится в материале MarkTechPost. Иными словами, модель заранее «понимает», как изменится геометрия сцены и положение объектов после выполнения текущего шага, а не реагирует только на статичный кадр.
Насколько LingBot-VLA 2.0 обгоняет конкурентов
На тестовом наборе GM-100 для универсальных роботов-агентов LingBot-VLA 2.0 превзошла модель π0.5 и предыдущую версию LingBot-VLA-1.0 на обеих проверенных робото-платформах, сообщает MarkTechPost. Превосходство сразу над предшественником и над сторонней моделью π0.5 на одном и том же бенчмарке подтверждает, что улучшения — единое пространство действий, MoE-модуль и dual-query дистилляция — дают измеримый прирост качества, а не просто увеличивают число параметров.
Что это значит
Открытая модель на 6 млрд параметров, которая одинаково хорошо работает на 20 разных конфигурациях роботов, снижает порог входа для команд, которые хотят обучать универсальных роботов-агентов без сбора отдельного датасета под каждую конкретную конструкцию робота.
Частые вопросы
Что означает аббревиатура VLA в названии модели?
VLA расшифровывается как vision-language-action — модель обрабатывает изображение и текстовую инструкцию и генерирует действие робота в одном проходе.
Можно ли использовать LingBot-VLA 2.0 бесплатно?
Да, модель выпущена под лицензией Apache 2.0, которая разрешает свободное использование, изменение и коммерческое применение чекпоинта, включая интеграцию в собственные робототехнические продукты.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.