Гибридное обучение VLA-моделей: качество онлайн-RL за половину вычислений
Новый препринт на arXiv (июль 2026 года) предлагает гибрид offline-online для обучения крупных vision-language-action (VLA) моделей. Онлайн-RL здесь регуляризуют offline-данными или offline-обученной эталонной политикой. Итог — та же устойчивость к ситуациям вне обучающего распределения, что и у чистого RL, но при вдвое меньшем бюджете обучения.
Processado por IA de arXiv cs.LG; editado por Hamidun News
Em julho de 2026, surgiu no arXiv um preprint (arXiv:2607.19399) que propõe combinar aprendizado por reforço offline e online para grandes modelos de vision-language-action (VLA) e obter a qualidade do RL online puro por aproximadamente metade do orçamento computacional.
Por que o RL online é mais caro, mas melhor
O aprendizado por reforço online (online RL) produz de forma consistente estratégias mais fortes do que os métodos offline — os autores partem dessa observação. A diferença é especialmente grande em dados fora da distribuição de treinamento (out-of-distribution, OOD): em cenas incomuns, o modelo precisa agir onde não havia exemplos semelhantes no treinamento.
Modelos treinados apenas por imitation learning ou por supervised fine-tuning (SFT) muitas vezes "se perdem" nessas cenas OOD: reproduzem bem o que já viram, mas generalizam mal para o novo. Os próprios modelos VLA preveem uma ação a partir de uma imagem e uma instrução textual — é isso que os diferencia dos modelos de linguagem comuns. O RL online, ao contrário, aprende com suas próprias ações e as consequências delas, por isso se mantém mais confiante.
Os autores citam um estudo recente que introduziu um benchmark orientado a OOD e mostrou: as políticas VLA treinadas via RL são visivelmente melhores em OOD e um pouco melhores dentro da distribuição (in-distribution) do que os mesmos modelos após SFT. O preço dessa vantagem é uma interação online cara e um orçamento de treinamento grande.
O que exatamente os autores propuseram
Os pesquisadores verificam se é possível combinar as vantagens das duas abordagens em um esquema híbrido offline-online. A ideia é regularizar o RL online por meio de supervisão offline, para não perder estabilidade, mas também não pagar o preço total do treinamento online.
A supervisão é introduzida de duas formas: diretamente por meio de dados offline, ou por meio de uma política de referência (reference policy) treinada offline, que impede o RL de divergir durante o treinamento. A política de referência funciona como uma âncora suave: o RL melhora livremente a estratégia, mas a supervisão offline não deixa que ela derive para soluções instáveis.
*Preprint: arXiv:2607.19399, publicado em julho de 2026
*Objeto — modelos de vision-language-action (VLA) em larga escala, que mapeiam visão e linguagem em ações
*Método — RL online regularizado com dados offline ou com uma política de referência treinada offline
*Comparação — com treinamento offline puro e com RL padrão em um benchmark OOD
*Resultado — qualidade próxima à do RL padrão, com aproximadamente metade do orçamento de treinamento
Todas as variantes foram testadas no mesmo benchmark OOD e comparadas com dois extremos: treinamento apenas offline e RL online padrão.
Quanto o híbrido economiza?
O híbrido atinge uma qualidade próxima à do RL padrão, gastando aproximadamente metade do orçamento de treinamento — esse é o principal resultado do trabalho. Na prática, isso significa que é possível chegar ao mesmo nível gastando duas vezes menos em computação — ou, com o mesmo orçamento, treinar um modelo mais forte. Ao mesmo tempo, a forte robustez OOD é preservada, sem ser sacrificada em nome da velocidade.
O treinamento apenas offline, segundo os dados dos autores, oferece apenas uma qualidade OOD limitada. Mas assim que a supervisão offline é incorporada dentro do RL, a robustez a situações fora do padrão permanece alta, e o treinamento se torna aproximadamente duas vezes mais eficiente. Um detalhe importante: não se trata de uma troca "mais rápido, porém pior" — o ganho de velocidade não consome a qualidade.
"Em vez de uma troca entre velocidade e qualidade OOD, a abordagem
híbrida preserva forte robustez fora da distribuição e, ao mesmo tempo, alcança um ganho de eficiência", afirma o resumo do estudo no arXiv.
O que isso significa
Treinar grandes modelos VLA é uma das direções mais intensivas em recursos da IA robótica, e a mesma precisão pela metade do orçamento representa uma economia significativa para laboratórios e equipes que treinam agentes de ação. Trata-se de modelos para robôs e agentes que atuam em ambientes físicos ou de software, onde é impossível coletar de antemão dados para todos os casos — por isso a robustez a OOD é especialmente valiosa. A abordagem elimina a escolha entre confiabilidade em cenários incomuns e velocidade de treinamento — tornando, assim, o RL online mais prático para tarefas reais.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.