MarkTechPost→ original

Ant Group a Présenté LingBot-VLA 2.0 — Modèle Ouvert pour Contrôler des Robots de Tout Design

Robbyant, partie d'Ant Group, a lancé LingBot-VLA 2.0, un modèle vision-langage-action ouvert pour contrôle de robot multiplateforme. Le modèle de 6 milliards de paramètres entraîné sur 60 mille heures de données: 50 mille heures de vidéo de 20 configurations de robot et 10 mille heures de vidéo en première personne. Il mappe n'importe quel robot à un espace d'action unifiée de 55 dimensions pour bras, pinces deltoïdes, troncs et bases mobiles. Sur benchmark GM-100 LingBot-VLA 2.0 dépasse π0.5 et version 1.0.

Traité par IA depuis MarkTechPost ; édité par Hamidun News
Ant Group a Présenté LingBot-VLA 2.0 — Modèle Ouvert pour Contrôler des Robots de Tout Design
Source : MarkTechPost. Collage: Hamidun News.
◐ Écouter l'article

Robbyant, la division robotique d'Ant Group, a lancé LingBot-VLA 2.0 le 8 juillet 2026 — un modèle ouvert vision-langage-action avec 6 milliards de paramètres pour contrôler des robots de différentes conceptions sous la licence Apache 2.0.

Sur quelles données le modèle a été entraîné

LingBot-VLA 2.0 a été pré-entraîné sur environ 60 000 heures de données, selon MarkTechPost. Parmi celles-ci, 50 000 heures sont des trajectoires de robots collectées sur 20 configurations de robots différentes, et 10 000 heures supplémentaires sont des vidéos égocentriques de personnes filmées à la première personne tout en effectuant des actions ménagères et de manipulation.

  • Développeur — Robbyant, division robotique d'Ant Group; la version est sortie le 8 juillet 2026
  • Licence — Apache 2.0, le checkpoint du modèle est ouvert au téléchargement
  • Taille du modèle — 6 milliards de paramètres (6B)
  • Volume des données de pré-entraînement — environ 60 000 heures (50 000 heures de trajectoires de robots sur 20 configurations de robots + 10 000 heures de vidéos avec des personnes)
  • Espace d'action unifié — 55 dimensions pour tous les types de robots

Comment le modèle contrôle différents robots

LingBot-VLA 2.0 convertit le contrôle de tout robot en un espace d'action canonique unifié de 55 dimensions qui englobe les bras, les pinces dextres, la taille, la tête et les plates-formes mobiles, explique MarkTechPost. Cette approche résout le principal problème des modèles cross-embodiment : auparavant, pour chaque construction de robot — avec différents nombres d'articulations, type de pince ou présence d'une base mobile — vous deviez entraîner un modèle de contrôle séparé, et un espace d'action unifié permet au même checkpoint de fonctionner sur 20 configurations.

Le module d'action au niveau du token basé sur Mixture-of-Experts aide à dimensionner le modèle sans perte de qualité, en contournant le besoin d'une fonction de perte auxiliaire pour équilibrer la charge entre les experts. Cela permet d'augmenter la capacité du modèle sans ajouter un terme supplémentaire à la fonction de perte, qui ralentit généralement et complique l'entraînement de telles architectures.

D'où le modèle obtient la géométrie et le temps

La distillation à double requête des modèles LingBot-Depth et DINO-Video ajoute une supervision géométrique et temporelle, ce qui aide LingBot-VLA 2.0 à prendre en compte l'état futur de la scène lors du choix d'une action, selon MarkTechPost. En d'autres termes, le modèle « comprend » d'avance comment la géométrie de la scène et les positions des objets changeront après l'exécution de l'étape actuelle, plutôt que de simplement réagir à une image statique.

Dans quelle mesure LingBot-VLA 2.0 surpasse les concurrents

Sur l'ensemble de tests GM-100 pour les agents de robots universels, LingBot-VLA 2.0 a surpassé à la fois le modèle π0.5 et la version précédente LingBot-VLA-1.0 sur les deux plates-formes de robots testées, rapporte MarkTechPost. Les performances supérieures au prédécesseur et au modèle tiers π0.5 sur le même benchmark confirment que les améliorations — espace d'action unifié, module MoE et distillation à double requête — apportent des gains de qualité mesurables, pas seulement une augmentation du nombre de paramètres.

Que cela signifie

Un modèle ouvert avec 6 milliards de paramètres qui fonctionne aussi bien sur 20 configurations de robots différentes réduit la barrière à l'entrée pour les équipes qui souhaitent entraîner des agents robots universels sans collecter d'ensembles de données séparés pour chaque conception de robot spécifique.

Questions Fréquemment Posées

Que signifie l'abréviation VLA dans le nom du modèle?

VLA signifie vision-language-action — le modèle traite une image et une instruction textuelle et génère une action de robot en un seul passage.

LingBot-VLA 2.0 peut-il être utilisé gratuitement?

Oui, le modèle est publié sous la licence Apache 2.0, qui permet l'utilisation libre, la modification et l'application commerciale du checkpoint, y compris l'intégration dans des produits de robotique propriétaires.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…