Modelos

Modelo de Razonamiento

Un modelo de razonamiento es un sistema de IA diseñado para resolver problemas complejos de múltiples pasos generando pasos de razonamiento intermedios explícitos — a menudo llamado cadena de pensamiento — antes de producir una respuesta final.

Un modelo de razonamiento es un modelo de lenguaje específicamente optimizado para participar en descomposición de problemas deliberada y paso a paso en lugar de mapear una entrada a una salida en un único pase directo. Antes de comprometerse con una respuesta, el modelo genera una secuencia interna o visible de pasos de razonamiento — verificando subproblemas, identificando errores en pasos anteriores e integrando conclusiones intermedias. Esta computación adicional en tiempo de prueba permite que el modelo intercambie latencia de inferencia por precisión en tareas que la generación autorregresiva estándar maneja pobremente.

La técnica dominante para producir modelos de razonamiento es el aprendizaje por refuerzo de recompensas verificables (RLVR). Los modelos se entrenan en dominios donde la corrección puede verificarse automáticamente — problemas de matemáticas con respuestas numéricas, lógica formal y código con suites de pruebas ejecutables. Las respuestas finales correctas producen recompensa positiva; las incorrectas producen recompensa negativa. No se requieren etiquetas humanas en pasos intermedios de razonamiento. El o1 de OpenAI (lanzado en septiembre de 2024) demostró este enfoque a escala; los sistemas posteriores incluyendo OpenAI o3, DeepSeek-R1 (enero de 2025, pesos abiertos), el modo de pensamiento extendido de Anthropic en Claude 3.7, y Google Gemini 2.5 Pro siguieron el mismo paradigma. Los tokens de razonamiento intermedio — a veces miles de palabras de computación interna — a menudo se ocultan de los usuarios finales o se presentan en un bloque de pensamiento desplegable.

Los modelos de razonamiento mejoran sustancialmente el rendimiento en tareas que requieren inferencia lógica de múltiples pasos, donde errores en pasos anteriores se propagan en cascada en respuestas finales incorrectas. En el Examen Invitacional Americano de Matemáticas (AIME), los modelos de razonamiento alcanzaron rendimiento de puntuación alta en 2024–2025 que los coloca entre los mejores competidores humanos. En GPQA Diamond, un punto de referencia de preguntas de ciencia a nivel de PhD, el o3 de OpenAI superó las puntuaciones promedio de expertos humanos. En ingeniería de software, los modelos de razonamiento resuelven una fracción sustancialmente mayor de bugs del mundo real en el punto de referencia SWE-bench que sus contrapartes sin razonamiento.

La principal compensación es el costo y latencia de inferencia: un modelo de razonamiento puede gastar segundos a minutos generando una cadena de pensamiento antes de responder, y los tokens adicionales consumidos pueden aumentar significativamente los costos de API. Esto ha impulsado el desarrollo de variantes de eficiencia — o3-mini, series DeepSeek-R1-Distill, Gemini 2.5 Flash — que retienen la mayoría de la capacidad de razonamiento a menor computación. Seleccionar entre un modelo estándar y uno de razonamiento típicamente depende de si la complejidad de la tarea justifica el aumento de latencia y costo.

Ejemplo

Un equipo de software envía un informe de bug algorítmico complejo a un modelo de razonamiento; después de varios segundos de cadena interna de pensamiento, el modelo identifica que la causa raíz es un error de uno en condiciones de frontera de entrada vacía específicas, genera una corrección dirigida y produce una prueba de regresión — considerando que la misma consulta a un modelo estándar devolvió un parche plausible pero incorrecto.

Términos relacionados

Últimas noticias sobre el tema

← Glosario