MarkTechPost→ оригинал

Ant Group представила LingBot-VLA 2.0 — открытую модель для управления роботами любой конструкции

Подразделение Ant Group — Robbyant — выпустило LingBot-VLA 2.0, открытую vision-language-action модель на 6 миллиардов параметров под лицензией Apache 2.0. Модель предобучена на 60 000 часов данных и управляет роботами 20 разных конфигураций через единое 55-мерное пространство действий. На бенчмарке GM-100 она обходит модель π0.5 и предыдущую версию LingBot-VLA-1.0.

AI-обработка оригинала MarkTechPost; редакция Hamidun News
Ant Group представила LingBot-VLA 2.0 — открытую модель для управления роботами любой конструкции
Источник: MarkTechPost. Коллаж: Hamidun News.
◐ Слушать статью

Робототехническое подразделение Ant Group — Robbyant — 8 июля 2026 года выпустило LingBot-VLA 2.0, открытую vision-language-action модель на 6 миллиардов параметров для управления роботами разных конструкций под лицензией Apache 2.0.

На каких данных обучена модель

LingBot-VLA 2.0 предобучена примерно на 60 000 часов данных, сообщает издание MarkTechPost. Из них 50 000 часов — это траектории роботов, собранные на 20 разных конфигурациях роботов, а ещё 10 000 часов — эгоцентрическое видео с людьми, снятое от первого лица во время выполнения бытовых и манипуляционных действий.

  • Разработчик — Robbyant, подразделение Ant Group; релиз состоялся 8 июля 2026 года
  • Лицензия — Apache 2.0, чекпоинт модели открыт для скачивания
  • Размер модели — 6 млрд параметров (6B)
  • Объём предобучающих данных — около 60 000 часов (50 000 часов роботических траекторий на 20 конфигурациях роботов + 10 000 часов видео с людьми)
  • Единое пространство действий — 55 измерений на все типы роботов

Как модель управляет разными роботами

LingBot-VLA 2.0 переводит управление любым роботом в единое 55-мерное каноническое пространство действий, которое охватывает руки, ловкие кисти, талию, голову и мобильные платформы, поясняет MarkTechPost. Такой подход решает главную проблему cross-embodiment моделей: раньше под каждую конструкцию робота — с разным числом суставов, типом захвата или наличием мобильной базы — приходилось обучать отдельную модель управления, а единое пространство действий позволяет одному и тому же чекпоинту работать сразу на 20 конфигурациях.

Масштабировать модель без потери качества помогает token-level модуль действий на основе Mixture-of-Experts, который обходится без вспомогательной функции потерь для балансировки нагрузки между экспертами. Это позволяет наращивать ёмкость модели, не добавляя лишний член в функцию потерь, который обычно замедляет и усложняет обучение подобных архитектур.

Откуда модель берёт геометрию и время

Dual-query дистилляция из моделей LingBot-Depth и DINO-Video добавляет геометрическую и временную супервизию, которая помогает LingBot-VLA 2.0 учитывать будущее состояние сцены при выборе действия, говорится в материале MarkTechPost. Иными словами, модель заранее «понимает», как изменится геометрия сцены и положение объектов после выполнения текущего шага, а не реагирует только на статичный кадр.

Насколько LingBot-VLA 2.0 обгоняет конкурентов

На тестовом наборе GM-100 для универсальных роботов-агентов LingBot-VLA 2.0 превзошла модель π0.5 и предыдущую версию LingBot-VLA-1.0 на обеих проверенных робото-платформах, сообщает MarkTechPost. Превосходство сразу над предшественником и над сторонней моделью π0.5 на одном и том же бенчмарке подтверждает, что улучшения — единое пространство действий, MoE-модуль и dual-query дистилляция — дают измеримый прирост качества, а не просто увеличивают число параметров.

Что это значит

Открытая модель на 6 млрд параметров, которая одинаково хорошо работает на 20 разных конфигурациях роботов, снижает порог входа для команд, которые хотят обучать универсальных роботов-агентов без сбора отдельного датасета под каждую конкретную конструкцию робота.

Частые вопросы

Что означает аббревиатура VLA в названии модели?

VLA расшифровывается как vision-language-action — модель обрабатывает изображение и текстовую инструкцию и генерирует действие робота в одном проходе.

Можно ли использовать LingBot-VLA 2.0 бесплатно?

Да, модель выпущена под лицензией Apache 2.0, которая разрешает свободное использование, изменение и коммерческое применение чекпоинта, включая интеграцию в собственные робототехнические продукты.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…