arXiv cs.LG→ original

Гибридное обучение VLA-моделей: качество онлайн-RL за половину вычислений

Новый препринт на arXiv (июль 2026 года) предлагает гибрид offline-online для обучения крупных vision-language-action (VLA) моделей. Онлайн-RL здесь регуляризуют offline-данными или offline-обученной эталонной политикой. Итог — та же устойчивость к ситуациям вне обучающего распределения, что и у чистого RL, но при вдвое меньшем бюджете обучения.

Procesado por IA desde arXiv cs.LG; editado por Hamidun News
Гибридное обучение VLA-моделей: качество онлайн-RL за половину вычислений
Fuente: arXiv cs.LG. Collage: Hamidun News.
◐ Escuchar artículo

En julio de 2026 apareció en arXiv un preprint (arXiv:2607.19399) que propone combinar el aprendizaje por refuerzo offline y online para grandes modelos de vision-language-action (VLA) y obtener la calidad del RL online puro con aproximadamente la mitad del presupuesto computacional.

Por qué el RL online es más caro, pero mejor

El aprendizaje por refuerzo online (online RL) produce de manera consistente estrategias más fuertes que los métodos offline; los autores parten de esta observación. La diferencia es especialmente grande en datos fuera de la distribución de entrenamiento (out-of-distribution, OOD): en escenas inusuales, el modelo debe actuar en situaciones donde no hubo ejemplos similares durante el entrenamiento.

Los modelos entrenados solo mediante imitation learning o mediante supervised fine-tuning (SFT) a menudo "se pierden" en esas escenas OOD: repiten bien lo que han visto, pero generalizan mal a lo nuevo. Los propios modelos VLA predicen una acción a partir de una imagen y una instrucción de texto; en esto se diferencian de los modelos de lenguaje habituales. El RL online, en cambio, aprende de sus propias acciones y sus consecuencias, por lo que se mantiene con más seguridad.

Los autores citan un estudio reciente que introdujo un benchmark orientado a OOD y mostró que las políticas VLA entrenadas mediante RL son notablemente mejores en OOD y algo mejores dentro de la distribución (in-distribution) que los mismos modelos tras SFT. El precio de esta ventaja es una interacción online costosa y un presupuesto de entrenamiento elevado.

Qué proponen exactamente los autores

Los investigadores comprueban si se pueden combinar las ventajas de ambos enfoques en un esquema híbrido offline-online. La idea es regularizar el RL online mediante supervisión offline, para no perder estabilidad, pero tampoco pagar el precio completo del entrenamiento online.

La supervisión se introduce de dos maneras: directamente a través de datos offline, o mediante una política de referencia (reference policy) entrenada offline, que evita que el RL diverja durante el entrenamiento. La política de referencia funciona como un ancla suave: el RL mejora libremente la estrategia, pero la supervisión offline le impide derivar hacia soluciones inestables.

*Preprint: arXiv:2607.19399, publicado en julio de 2026

*Objeto — modelos de vision-language-action (VLA) a gran escala, que traducen visión y lenguaje en acciones

*Método — RL online regularizado con datos offline o con una política de referencia entrenada offline

*Comparación — con entrenamiento offline puro y con RL estándar en un benchmark OOD

*Resultado — calidad cercana al RL estándar, con aproximadamente la mitad del presupuesto de entrenamiento

Todas las variantes se probaron en el mismo benchmark OOD y se compararon con dos extremos: el entrenamiento solo offline y el RL online estándar.

¿Cuánto ahorra el híbrido?

El híbrido alcanza una calidad cercana a la del RL estándar, gastando aproximadamente la mitad del presupuesto de entrenamiento; este es el resultado principal del trabajo. En la práctica, esto significa que se puede llegar al mismo nivel dos veces más barato en cómputo, o entrenar un modelo más fuerte con el mismo presupuesto. Al mismo tiempo, se conserva una fuerte robustez OOD, sin sacrificarla por la velocidad.

El entrenamiento offline por sí solo, según los datos de los autores, ofrece solo una calidad OOD limitada. Pero en cuanto la supervisión offline se integra dentro del RL, la robustez ante situaciones no estándar se mantiene alta y el entrenamiento resulta aproximadamente el doble de eficiente. Un matiz importante: no se trata de un compromiso "más rápido, pero peor": la ganancia en velocidad no se come la calidad.

«En lugar de un compromiso entre velocidad y calidad OOD, el enfoque

híbrido conserva una fuerte robustez fuera de la distribución y al mismo tiempo logra una ganancia de eficiencia», se afirma en el resumen del estudio en arXiv.

Qué significa esto

El entrenamiento de grandes modelos VLA es una de las direcciones más intensivas en recursos de la IA robótica, y la misma precisión con la mitad del presupuesto supone un ahorro notable para los laboratorios y equipos que entrenan agentes de acción. Se trata de modelos para robots y agentes que actúan en entornos físicos o de software, donde es imposible recopilar de antemano datos para todos los casos, por lo que la robustez OOD resulta especialmente valiosa. El enfoque elimina la disyuntiva entre fiabilidad en escenarios inusuales y velocidad de entrenamiento, lo que hace que el RL online sea más práctico para tareas reales.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…