MarkTechPost→ original

Ant Group Apresentou LingBot-VLA 2.0 — Modelo Aberto para Controlar Robôs de Qualquer Design

Robbyant, parte da Ant Group, lançou LingBot-VLA 2.0, um modelo de visão-linguagem-ação aberto para controle de robô multiplataforma. O modelo de 6 bilhões de parâmetros treinado em 60 mil horas de dados: 50 mil horas de vídeo de 20 configurações de robôs e 10 mil horas de vídeo em primeira pessoa. Ele mapeia qualquer robô para um espaço de ação unificado de 55 dimensões para braços, garras deltoides, troncos e bases móveis. No benchmark GM-100 LingBot-VLA 2.0 supera π0.5 e versão 1.0.

Processado por IA de MarkTechPost; editado por Hamidun News
Ant Group Apresentou LingBot-VLA 2.0 — Modelo Aberto para Controlar Robôs de Qualquer Design
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

Robbyant, a divisão de robótica do Ant Group, lançou LingBot-VLA 2.0 em 8 de julho de 2026 — um modelo aberto de visão-linguagem-ação com 6 bilhões de parâmetros para controlar robôs de diferentes designs sob a licença Apache 2.0.

Que dados o modelo foi treinado

LingBot-VLA 2.0 foi pré-treinado em aproximadamente 60.000 horas de dados, segundo MarkTechPost. Destes, 50.000 horas são trajetórias de robôs coletadas em 20 configurações diferentes de robôs, e outras 10.000 horas são vídeos egocêntricos de pessoas filmados em primeira pessoa enquanto realizam ações domésticas e de manipulação.

  • Desenvolvedor — Robbyant, divisão de robótica do Ant Group; lançamento ocorreu em 8 de julho de 2026
  • Licença — Apache 2.0, checkpoint do modelo está aberto para download
  • Tamanho do modelo — 6 bilhões de parâmetros (6B)
  • Volume de dados de pré-treinamento — aproximadamente 60.000 horas (50.000 horas de trajetórias de robôs em 20 configurações de robôs + 10.000 horas de vídeo com pessoas)
  • Espaço de ação unificado — 55 dimensões para todos os tipos de robôs

Como o modelo controla diferentes robôs

LingBot-VLA 2.0 converte o controle de qualquer robô em um espaço de ação canônico unificado de 55 dimensões que abrange braços, garras dextras, cintura, cabeça e plataformas móveis, explica MarkTechPost. Esta abordagem resolve o principal problema dos modelos cross-embodiment: anteriormente, para cada construção de robô — com diferentes números de articulações, tipo de garra ou presença de base móvel — você precisava treinar um modelo de controle separado, e um espaço de ação unificado permite que o mesmo checkpoint funcione em 20 configurações.

O módulo de ação em nível de token baseado em Mixture-of-Experts ajuda a escalar o modelo sem perda de qualidade, contornando a necessidade de uma função de perda auxiliar para equilibrar a carga entre especialistas. Isto permite aumentar a capacidade do modelo sem adicionar um termo extra à função de perda, que tipicamente desacelera e complica o treinamento de tais arquiteturas.

De onde o modelo obtém geometria e tempo

A destilação de dupla consulta dos modelos LingBot-Depth e DINO-Video adiciona supervisão geométrica e temporal, o que ajuda LingBot-VLA 2.0 a levar em conta o estado futuro da cena ao escolher uma ação, segundo MarkTechPost. Em outras palavras, o modelo "compreende" antecipadamente como a geometria da cena e as posições dos objetos mudarão após realizar o passo atual, em vez de apenas reagir a um quadro estático.

Quanto LingBot-VLA 2.0 supera os concorrentes

No conjunto de testes GM-100 para agentes de robôs universais, LingBot-VLA 2.0 superou tanto o modelo π0.5 quanto a versão anterior LingBot-VLA-1.0 em ambas as plataformas de robô testadas, relata MarkTechPost. O desempenho superior tanto sobre o antecessor quanto sobre o modelo de terceiros π0.5 no mesmo benchmark confirma que as melhorias — espaço de ação unificado, módulo MoE e destilação de dupla consulta — fornecem ganhos de qualidade mensuráveis, não apenas aumento de parâmetros.

O que significa isso

Um modelo aberto com 6 bilhões de parâmetros que funciona igualmente bem em 20 configurações diferentes de robôs reduz a barreira de entrada para equipes que desejam treinar agentes robóticos universais sem coletar conjuntos de dados separados para cada design específico de robô.

Perguntas Frequentes

O que significa a abreviatura VLA no nome do modelo?

VLA significa vision-language-action — o modelo processa uma imagem e uma instrução de texto e gera uma ação de robô em uma única passagem.

LingBot-VLA 2.0 pode ser usado gratuitamente?

Sim, o modelo é lançado sob a licença Apache 2.0, que permite uso livre, modificação e aplicação comercial do checkpoint, incluindo integração em produtos de robótica proprietários.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…