arXiv cs.LG→ original

Гибридное обучение VLA-моделей: качество онлайн-RL за половину вычислений

Новый препринт на arXiv (июль 2026 года) предлагает гибрид offline-online для обучения крупных vision-language-action (VLA) моделей. Онлайн-RL здесь регуляризуют offline-данными или offline-обученной эталонной политикой. Итог — та же устойчивость к ситуациям вне обучающего распределения, что и у чистого RL, но при вдвое меньшем бюджете обучения.

Processado por IA de arXiv cs.LG; editado por Hamidun News
Гибридное обучение VLA-моделей: качество онлайн-RL за половину вычислений
Fonte: arXiv cs.LG. Colagem: Hamidun News.
◐ Ouvir artigo

Em julho de 2026, surgiu no arXiv um preprint (arXiv:2607.19399) que propõe combinar aprendizado por reforço offline e online para grandes modelos de vision-language-action (VLA) e obter a qualidade do RL online puro por aproximadamente metade do orçamento computacional.

Por que o RL online é mais caro, mas melhor

O aprendizado por reforço online (online RL) produz de forma consistente estratégias mais fortes do que os métodos offline — os autores partem dessa observação. A diferença é especialmente grande em dados fora da distribuição de treinamento (out-of-distribution, OOD): em cenas incomuns, o modelo precisa agir onde não havia exemplos semelhantes no treinamento.

Modelos treinados apenas por imitation learning ou por supervised fine-tuning (SFT) muitas vezes "se perdem" nessas cenas OOD: reproduzem bem o que já viram, mas generalizam mal para o novo. Os próprios modelos VLA preveem uma ação a partir de uma imagem e uma instrução textual — é isso que os diferencia dos modelos de linguagem comuns. O RL online, ao contrário, aprende com suas próprias ações e as consequências delas, por isso se mantém mais confiante.

Os autores citam um estudo recente que introduziu um benchmark orientado a OOD e mostrou: as políticas VLA treinadas via RL são visivelmente melhores em OOD e um pouco melhores dentro da distribuição (in-distribution) do que os mesmos modelos após SFT. O preço dessa vantagem é uma interação online cara e um orçamento de treinamento grande.

O que exatamente os autores propuseram

Os pesquisadores verificam se é possível combinar as vantagens das duas abordagens em um esquema híbrido offline-online. A ideia é regularizar o RL online por meio de supervisão offline, para não perder estabilidade, mas também não pagar o preço total do treinamento online.

A supervisão é introduzida de duas formas: diretamente por meio de dados offline, ou por meio de uma política de referência (reference policy) treinada offline, que impede o RL de divergir durante o treinamento. A política de referência funciona como uma âncora suave: o RL melhora livremente a estratégia, mas a supervisão offline não deixa que ela derive para soluções instáveis.

*Preprint: arXiv:2607.19399, publicado em julho de 2026

*Objeto — modelos de vision-language-action (VLA) em larga escala, que mapeiam visão e linguagem em ações

*Método — RL online regularizado com dados offline ou com uma política de referência treinada offline

*Comparação — com treinamento offline puro e com RL padrão em um benchmark OOD

*Resultado — qualidade próxima à do RL padrão, com aproximadamente metade do orçamento de treinamento

Todas as variantes foram testadas no mesmo benchmark OOD e comparadas com dois extremos: treinamento apenas offline e RL online padrão.

Quanto o híbrido economiza?

O híbrido atinge uma qualidade próxima à do RL padrão, gastando aproximadamente metade do orçamento de treinamento — esse é o principal resultado do trabalho. Na prática, isso significa que é possível chegar ao mesmo nível gastando duas vezes menos em computação — ou, com o mesmo orçamento, treinar um modelo mais forte. Ao mesmo tempo, a forte robustez OOD é preservada, sem ser sacrificada em nome da velocidade.

O treinamento apenas offline, segundo os dados dos autores, oferece apenas uma qualidade OOD limitada. Mas assim que a supervisão offline é incorporada dentro do RL, a robustez a situações fora do padrão permanece alta, e o treinamento se torna aproximadamente duas vezes mais eficiente. Um detalhe importante: não se trata de uma troca "mais rápido, porém pior" — o ganho de velocidade não consome a qualidade.

"Em vez de uma troca entre velocidade e qualidade OOD, a abordagem

híbrida preserva forte robustez fora da distribuição e, ao mesmo tempo, alcança um ganho de eficiência", afirma o resumo do estudo no arXiv.

O que isso significa

Treinar grandes modelos VLA é uma das direções mais intensivas em recursos da IA robótica, e a mesma precisão pela metade do orçamento representa uma economia significativa para laboratórios e equipes que treinam agentes de ação. Trata-se de modelos para robôs e agentes que atuam em ambientes físicos ou de software, onde é impossível coletar de antemão dados para todos os casos — por isso a robustez a OOD é especialmente valiosa. A abordagem elimina a escolha entre confiabilidade em cenários incomuns e velocidade de treinamento — tornando, assim, o RL online mais prático para tarefas reais.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…