Ant Group Apresentou LingBot-VLA 2.0 — Modelo Aberto para Controlar Robôs de Qualquer Design
Robbyant, parte da Ant Group, lançou LingBot-VLA 2.0, um modelo de visão-linguagem-ação aberto para controle de robô multiplataforma. O modelo de 6 bilhões de parâmetros treinado em 60 mil horas de dados: 50 mil horas de vídeo de 20 configurações de robôs e 10 mil horas de vídeo em primeira pessoa. Ele mapeia qualquer robô para um espaço de ação unificado de 55 dimensões para braços, garras deltoides, troncos e bases móveis. No benchmark GM-100 LingBot-VLA 2.0 supera π0.5 e versão 1.0.
Processado por IA de MarkTechPost; editado por Hamidun News
Robbyant, a divisão de robótica do Ant Group, lançou LingBot-VLA 2.0 em 8 de julho de 2026 — um modelo aberto de visão-linguagem-ação com 6 bilhões de parâmetros para controlar robôs de diferentes designs sob a licença Apache 2.0.
Que dados o modelo foi treinado
LingBot-VLA 2.0 foi pré-treinado em aproximadamente 60.000 horas de dados, segundo MarkTechPost. Destes, 50.000 horas são trajetórias de robôs coletadas em 20 configurações diferentes de robôs, e outras 10.000 horas são vídeos egocêntricos de pessoas filmados em primeira pessoa enquanto realizam ações domésticas e de manipulação.
- Desenvolvedor — Robbyant, divisão de robótica do Ant Group; lançamento ocorreu em 8 de julho de 2026
- Licença — Apache 2.0, checkpoint do modelo está aberto para download
- Tamanho do modelo — 6 bilhões de parâmetros (6B)
- Volume de dados de pré-treinamento — aproximadamente 60.000 horas (50.000 horas de trajetórias de robôs em 20 configurações de robôs + 10.000 horas de vídeo com pessoas)
- Espaço de ação unificado — 55 dimensões para todos os tipos de robôs
Como o modelo controla diferentes robôs
LingBot-VLA 2.0 converte o controle de qualquer robô em um espaço de ação canônico unificado de 55 dimensões que abrange braços, garras dextras, cintura, cabeça e plataformas móveis, explica MarkTechPost. Esta abordagem resolve o principal problema dos modelos cross-embodiment: anteriormente, para cada construção de robô — com diferentes números de articulações, tipo de garra ou presença de base móvel — você precisava treinar um modelo de controle separado, e um espaço de ação unificado permite que o mesmo checkpoint funcione em 20 configurações.
O módulo de ação em nível de token baseado em Mixture-of-Experts ajuda a escalar o modelo sem perda de qualidade, contornando a necessidade de uma função de perda auxiliar para equilibrar a carga entre especialistas. Isto permite aumentar a capacidade do modelo sem adicionar um termo extra à função de perda, que tipicamente desacelera e complica o treinamento de tais arquiteturas.
De onde o modelo obtém geometria e tempo
A destilação de dupla consulta dos modelos LingBot-Depth e DINO-Video adiciona supervisão geométrica e temporal, o que ajuda LingBot-VLA 2.0 a levar em conta o estado futuro da cena ao escolher uma ação, segundo MarkTechPost. Em outras palavras, o modelo "compreende" antecipadamente como a geometria da cena e as posições dos objetos mudarão após realizar o passo atual, em vez de apenas reagir a um quadro estático.
Quanto LingBot-VLA 2.0 supera os concorrentes
No conjunto de testes GM-100 para agentes de robôs universais, LingBot-VLA 2.0 superou tanto o modelo π0.5 quanto a versão anterior LingBot-VLA-1.0 em ambas as plataformas de robô testadas, relata MarkTechPost. O desempenho superior tanto sobre o antecessor quanto sobre o modelo de terceiros π0.5 no mesmo benchmark confirma que as melhorias — espaço de ação unificado, módulo MoE e destilação de dupla consulta — fornecem ganhos de qualidade mensuráveis, não apenas aumento de parâmetros.
O que significa isso
Um modelo aberto com 6 bilhões de parâmetros que funciona igualmente bem em 20 configurações diferentes de robôs reduz a barreira de entrada para equipes que desejam treinar agentes robóticos universais sem coletar conjuntos de dados separados para cada design específico de robô.
Perguntas Frequentes
O que significa a abreviatura VLA no nome do modelo?
VLA significa vision-language-action — o modelo processa uma imagem e uma instrução de texto e gera uma ação de robô em uma única passagem.
LingBot-VLA 2.0 pode ser usado gratuitamente?
Sim, o modelo é lançado sob a licença Apache 2.0, que permite uso livre, modificação e aplicação comercial do checkpoint, incluindo integração em produtos de robótica proprietários.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.