Habr AI→ original

Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы

МТС в RnD-направлении Physical AI разрабатывает VLA-политику (Vision-Language-Action) для полноростового гуманоида. Главная проблема: робот уверенно берёт предмет со стола в статичной сцене, но начинает промахиваться, когда объект едет по конвейеру. Полноростовой робот при этом должен ещё и делать шаги, удерживая баланс тела, — а это многократно усложняет расчёт движений.

Processado por IA de Habr AI; editado por Hamidun News
Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы
Fonte: Habr AI. Colagem: Hamidun News.
◐ Ouvir artigo

Em 22 de julho de 2026, a engenheira de ML da MTS, Dania, publicou no blog corporativo no Habr uma análise de como a área de P&D de Physical AI da empresa está ensinando um humanoide de corpo inteiro a pegar objetos que se movem em uma esteira transportadora usando uma política VLA (Vision-Language-Action, "visão-linguagem-ação").

Qual é o principal problema

O humanoide pega com segurança um objeto sobre uma mesa, mas começa a errar quando o mesmo objeto se move em uma esteira transportadora — é exatamente nessa tarefa que a equipe da MTS está concentrada. Em uma cena estática o objeto está parado, a iluminação é estável e a câmera está apontada para a área de trabalho, por isso os modelos VLA atuais mostram alta qualidade de controle. Assim que o objeto começa a se mover, a precisão habitual de preensão desaparece: um modelo treinado em cenas estáticas não consegue acompanhar a geometria da tarefa, que muda constantemente.

Segundo a engenheira, isso não é uma falha isolada, mas uma limitação sistêmica de uma abordagem que funciona muito bem em demonstrações de laboratório, mas se transfere mal para uma esteira real.

O robô pega com segurança um objeto sobre uma mesa, mas começa a errar

quando o objeto se move em uma esteira transportadora.

— Dania, engenheira de ML, MTC Web Services

Por que uma cena dinâmica é mais difícil do que uma estática

Um ambiente dinâmico soma dois níveis de complexidade de uma vez: o próprio objeto se move e o robô, que precisa se ajustar a ele, também se move. A maioria das demonstrações impressionantes de robôs ainda é filmada em condições estáticas — os objetos ficam cuidadosamente arrumados sobre uma mesa e a cena quase não muda. As tarefas reais, tanto do dia a dia quanto da produção industrial, não são assim: no mínimo os objetos se movem em uma esteira transportadora, e a preensão precisa ser calculada considerando sua velocidade e trajetória.

Principais dados do projeto:

  • Equipe — área de P&D de Physical AI na MTC Web Services
  • Tecnologia — política VLA (Vision-Language-Action) para um humanoide
  • Autora da análise — Dania, engenheira de ML da MTS
  • Foco — preensão de objetos em movimento em uma esteira transportadora, e não objetos parados sobre uma mesa
  • Data de publicação da análise — 22 de julho de 2026

Por que é mais difícil para um humanoide do que para um manipulador

Um robô de corpo inteiro precisa não só alcançar o objeto, mas também manter o equilíbrio do corpo todo. Um manipulador fixo resolve uma tarefa mais simples: sua base é fixa, e todo o modelo só precisa cuidar do movimento do braço. Já o humanoide, para a mesma preensão, é obrigado a dar passos e compensar o deslocamento do centro de gravidade com movimentos adicionais do corpo.

Cada um desses movimentos muda a posição da câmera e do braço em relação ao objeto, que nesse mesmo momento também está se movendo. Como resultado, o cálculo dos movimentos se torna muito mais complexo: o modelo precisa prever simultaneamente a trajetória do objeto, planejar a preensão e manter a estabilidade do robô. É exatamente essa combinação que a equipe da MTS está tentando construir agora dentro da área de Physical AI.

O que isso significa

A transição das demonstrações estáticas para o trabalho com objetos em movimento é uma das principais barreiras no caminho dos humanoides do laboratório até a produção real. A análise da MTS mostra que até a operação básica de "pegar um objeto" deixa de ser trivial assim que a cena ganha vida, e que a aplicação industrial de robôs VLA esbarra não na força de preensão, mas na dinâmica do ambiente.

Perguntas frequentes

O que é uma política VLA?

VLA (Vision-Language-Action) é um modelo de controle de robôs que conecta visão, instrução em linguagem natural e ação: o robô "vê" a cena, entende a tarefa e planeja o movimento. Em cenas estáticas, segundo a análise da MTS, esses modelos mostram alta qualidade de preensão.

Por que um ambiente dinâmico é mais difícil para um humanoide?

Porque tanto o objeto quanto o próprio robô estão se movendo. Para realizar a preensão, um humanoide de corpo inteiro precisa dar passos e manter o equilíbrio do corpo com movimentos adicionais, por isso o cálculo dos movimentos se torna muito mais complexo do que no caso de um manipulador fixo.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…