OpenAI Blog→ original

OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%

OpenAI утверждает: официальный harness бенчмарка ARC-AGI-3 занижал её модель. Он выбрасывал приватные рассуждения GPT-5.6 Sol после каждого хода, и та разбиралась в игре заново. Стоило включить две настройки Responses API — retained reasoning и compaction — и результат утроился: с 13,3% до 38,3%, при этом выходных токенов на игру уходит примерно в 6 раз меньше. С такой конфигурацией GPT-5.6 обошла Anthropic Opus 5 (30,2%).

Procesado por IA desde OpenAI Blog; editado por Hamidun News
OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%
Fuente: OpenAI Blog. Collage: Hamidun News.
◐ Escuchar artículo

OpenAI anunció el 30 de julio de 2026 que activar dos configuraciones de su Responses API —retención de razonamiento (retained reasoning) y compactación (compaction)— triplicó el resultado del modelo GPT-5.6 Sol en el benchmark ARC-AGI-3: del 13,3% al 38,3% en el conjunto público de tareas. Además, el gasto de tokens de salida por partida cayó aproximadamente seis veces, y con la nueva configuración el modelo superó a Anthropic Opus 5.

Qué evalúa ARC-AGI-3

ARC-AGI-3 es un benchmark interactivo de razonamiento abstracto en el que un agente de IA resuelve tareas de juego desconocidas turno a turno: realiza una acción, observa el resultado y planifica el siguiente movimiento. A diferencia de las pruebas estáticas, aquí la memoria entre turnos es crítica: el agente debe ir acumulando comprensión de las reglas del juego a medida que avanza. Precisamente con esta memoria está relacionado todo el salto del 13,3% al 38,3% del que habla OpenAI.

En qué consisten las dos configuraciones

Las dos configuraciones —retained reasoning y compaction— son los mismos mecanismos que OpenAI aplica en sus productos ChatGPT y Codex. Retained reasoning conserva la cadena privada de razonamiento del modelo entre distintas ventanas de contexto. Compaction resume el contexto acumulado cuando este se acerca al límite, en lugar de recortar mecánicamente lo más antiguo. Ambos parámetros están disponibles a través de la Responses API, la interfaz de OpenAI para escenarios agénticos.

  • Modelo — GPT-5.6 Sol de OpenAI
  • Harness oficial de ARC-AGI-3: 13,3% en el conjunto público
  • Con retained reasoning y compaction a través de la Responses API: 38,3%
  • Tokens de salida por partida — aproximadamente 6 veces menos
  • Publicación — blog de OpenAI, 30 de julio de 2026

Por qué el resultado era más bajo

El harness oficial de ARC-AGI-3 descartaba el razonamiento privado del agente después de cada turno, lo que mantenía el resultado estancado en 13,3%. GPT-5.6 Sol veía el registro de acciones pasadas y breves notas sobre ellas, pero no el pensamiento que había generado esos movimientos, así que en cada paso, en la práctica, volvía a analizar el juego desde cero. Cuando el historial de movimientos superaba la ventana de contexto, el harness además eliminaba las acciones más antiguas. En esencia, el modelo recordaba que había "movido el bloque morado", pero olvidaba por qué lo había hecho.

"Los benchmarks nunca miden solo al modelo: también miden el andamiaje técnico que lo rodea", señala el blog de

OpenAI.

Cómo se comparó GPT-5.6 con Opus 5

Con las configuraciones activadas, GPT-5.6 Sol obtuvo 38,3% y superó a Anthropic Opus 5, que obtuvo 30,2% en ARC-AGI-3. Según OpenAI, la brecha no se debió al modelo en sí, sino a la configuración de la prueba: el harness oficial carece de capacidades específicas del proveedor, como retained reasoning, que están disponibles a través de la Responses API. Esa misma técnica tuvo un efecto secundario: un ahorro de aproximadamente seis veces en tokens de salida por partida.

Qué significa esto

El resultado en un benchmark no depende solo del modelo, sino también de cómo esté configurada la API y de cómo esté diseñado el harness de prueba. El mismo GPT-5.6 Sol muestra 13,3% o 38,3% según la configuración, y esto cambia la forma de leer las tablas comparativas con las que los laboratorios de IA se miden entre sí.

Preguntas frecuentes

¿Qué son retained reasoning y compaction?

Retained reasoning conserva la cadena privada de razonamiento del modelo entre ventanas de contexto, mientras que compaction resume el contexto antiguo en lugar de simplemente recortarlo. OpenAI ya utiliza ambas configuraciones en ChatGPT y Codex.

¿Cuánto mejoraron los resultados de GPT-5.6 Sol?

En el conjunto público de ARC-AGI-3, el resultado subió del 13,3% al 38,3%, aproximadamente el triple. Al mismo tiempo, el gasto de tokens de salida por partida se redujo alrededor de seis veces.

¿Superó GPT-5.6 Sol al modelo Opus 5?

Sí. Con las dos configuraciones, GPT-5.6 Sol obtuvo 38,3% frente al 30,2% de Anthropic Opus 5 en ARC-AGI-3, según datos de OpenAI.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…