Modelos

Modelo del Mundo

Un modelo del mundo es una representación interna que un sistema de IA aprende sobre la dinámica de su entorno, permitiéndole predecir las consecuencias de las acciones y simular estados futuros sin interactuar directamente con el mundo real.

Un modelo del mundo es una representación compacta aprendida de la dinámica de transición de un entorno — cómo evolucionan los estados en respuesta a acciones, qué observaciones son probables en cada estado y qué recompensas resultan. En lugar de mapear observaciones directamente a acciones (una política reactiva), un agente con un modelo del mundo puede simular mentalmente futuros hipotéticos: imaginando qué sucedería bajo la acción A versus la acción B y eligiendo basándose en los resultados simulados. El concepto se origina en ciencia cognitiva, donde la capacidad de simular mentalmente el entorno se considera central para la planificación humana y el razonamiento causal.

Los modelos del mundo típicamente se implementan como redes neuronales entrenadas para predecir futuros estados latentes — u observaciones brutas — dado un historial de observaciones y acciones anteriores. DreamerV3 (Google DeepMind, 2023) aprende un modelo de dinámica de espacio latente compacto en el cual una política y una función de valor se optimizan conjuntamente completamente dentro de imaginaciones, reduciendo sustancialmente el número de interacciones de entorno real requeridas para dominar una tarea. En el dominio visual, grandes modelos de generación de video — incluyendo Sora de OpenAI (2024) y Genie de Google DeepMind (2024) — funcionan como modelos del mundo implícitos: entrenados para predecir fotogramas de video futuros plausibles, codifican plausibilidad física, permanencia de objeto y dinámicas de escena como propiedades emergentes. Google DeepMind y otros han enmarcado explícitamente la predicción de fotogramas siguientes de video como un camino tractable hacia modelos del mundo de propósito general para agentes encarnados.

Los modelos del mundo importan por varias razones. Primero, permiten aprendizaje eficiente en muestras: un agente que simula su entorno internamente necesita muchas menos interacciones costosas o peligrosas del mundo real. Segundo, soportan planificación interpretable, porque un agente puede informar qué futuro simulado justificó su acción elegida — una propiedad valiosa en dominios críticos para la seguridad. Tercero, los modelos del mundo generalizan mejor a situaciones novedosas codificando estructura causal en lugar de mapeados estímulo-respuesta, permitiéndoles extrapolar a combinaciones estado-acción no vistas durante el entrenamiento.

Desde 2026, los modelos del mundo son un enfoque de investigación primario en robótica, conducción autónoma e IA para juegos. En robótica, Physical Intelligence (pi0), la división de robótica de Google DeepMind y Figure usan preentrenamiento de video al estilo modelo del mundo para transferir habilidades de manipulación entre objetos y entornos diversos. En conducción autónoma, Waymo y Wayve entrenan entornos de simulación aprendidos que sustituyen a costosas millas de prueba del mundo real. El límite entre modelos del mundo y generación de video de propósito general se ha vuelto productivamente ambiguo: sistemas que producen video físicamente consistente se están reciclando activamente como simuladores de entorno para entrenar agentes encarnados.

Ejemplo

Un brazo robótico autónomo en un almacén usa un modelo del mundo aprendido para simular mentalmente doce trayectorias de agarre candidatas en menos de 200 milisegundos, seleccionando la que su modelo predice que tendrá éxito contra un paquete de forma irregular, antes de ejecutar cualquier movimiento físico.

Términos relacionados

← Glosario