Как МТС учит гуманоида с VLA-моделью брать движущиеся по конвейеру предметы
МТС в RnD-направлении Physical AI разрабатывает VLA-политику (Vision-Language-Action) для полноростового гуманоида. Главная проблема: робот уверенно берёт предмет со стола в статичной сцене, но начинает промахиваться, когда объект едет по конвейеру. Полноростовой робот при этом должен ещё и делать шаги, удерживая баланс тела, — а это многократно усложняет расчёт движений.
Processado por IA de Habr AI; editado por Hamidun News
Em 22 de julho de 2026, a engenheira de ML da MTS, Dania, publicou no blog corporativo no Habr uma análise de como a área de P&D de Physical AI da empresa está ensinando um humanoide de corpo inteiro a pegar objetos que se movem em uma esteira transportadora usando uma política VLA (Vision-Language-Action, "visão-linguagem-ação").
Qual é o principal problema
O humanoide pega com segurança um objeto sobre uma mesa, mas começa a errar quando o mesmo objeto se move em uma esteira transportadora — é exatamente nessa tarefa que a equipe da MTS está concentrada. Em uma cena estática o objeto está parado, a iluminação é estável e a câmera está apontada para a área de trabalho, por isso os modelos VLA atuais mostram alta qualidade de controle. Assim que o objeto começa a se mover, a precisão habitual de preensão desaparece: um modelo treinado em cenas estáticas não consegue acompanhar a geometria da tarefa, que muda constantemente.
Segundo a engenheira, isso não é uma falha isolada, mas uma limitação sistêmica de uma abordagem que funciona muito bem em demonstrações de laboratório, mas se transfere mal para uma esteira real.
O robô pega com segurança um objeto sobre uma mesa, mas começa a errar
quando o objeto se move em uma esteira transportadora.
— Dania, engenheira de ML, MTC Web Services
Por que uma cena dinâmica é mais difícil do que uma estática
Um ambiente dinâmico soma dois níveis de complexidade de uma vez: o próprio objeto se move e o robô, que precisa se ajustar a ele, também se move. A maioria das demonstrações impressionantes de robôs ainda é filmada em condições estáticas — os objetos ficam cuidadosamente arrumados sobre uma mesa e a cena quase não muda. As tarefas reais, tanto do dia a dia quanto da produção industrial, não são assim: no mínimo os objetos se movem em uma esteira transportadora, e a preensão precisa ser calculada considerando sua velocidade e trajetória.
Principais dados do projeto:
- Equipe — área de P&D de Physical AI na MTC Web Services
- Tecnologia — política VLA (Vision-Language-Action) para um humanoide
- Autora da análise — Dania, engenheira de ML da MTS
- Foco — preensão de objetos em movimento em uma esteira transportadora, e não objetos parados sobre uma mesa
- Data de publicação da análise — 22 de julho de 2026
Por que é mais difícil para um humanoide do que para um manipulador
Um robô de corpo inteiro precisa não só alcançar o objeto, mas também manter o equilíbrio do corpo todo. Um manipulador fixo resolve uma tarefa mais simples: sua base é fixa, e todo o modelo só precisa cuidar do movimento do braço. Já o humanoide, para a mesma preensão, é obrigado a dar passos e compensar o deslocamento do centro de gravidade com movimentos adicionais do corpo.
Cada um desses movimentos muda a posição da câmera e do braço em relação ao objeto, que nesse mesmo momento também está se movendo. Como resultado, o cálculo dos movimentos se torna muito mais complexo: o modelo precisa prever simultaneamente a trajetória do objeto, planejar a preensão e manter a estabilidade do robô. É exatamente essa combinação que a equipe da MTS está tentando construir agora dentro da área de Physical AI.
O que isso significa
A transição das demonstrações estáticas para o trabalho com objetos em movimento é uma das principais barreiras no caminho dos humanoides do laboratório até a produção real. A análise da MTS mostra que até a operação básica de "pegar um objeto" deixa de ser trivial assim que a cena ganha vida, e que a aplicação industrial de robôs VLA esbarra não na força de preensão, mas na dinâmica do ambiente.
Perguntas frequentes
O que é uma política VLA?
VLA (Vision-Language-Action) é um modelo de controle de robôs que conecta visão, instrução em linguagem natural e ação: o robô "vê" a cena, entende a tarefa e planeja o movimento. Em cenas estáticas, segundo a análise da MTS, esses modelos mostram alta qualidade de preensão.
Por que um ambiente dinâmico é mais difícil para um humanoide?
Porque tanto o objeto quanto o próprio robô estão se movendo. Para realizar a preensão, um humanoide de corpo inteiro precisa dar passos e manter o equilíbrio do corpo com movimentos adicionais, por isso o cálculo dos movimentos se torna muito mais complexo do que no caso de um manipulador fixo.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.