OpenAI lanzó el modelo flagship GPT-5.6 en tres versiones — Luna, Terra y Sol
OpenAI lanzó la familia GPT-5.6 de tres modelos — Luna, Terra y Sol — con precios de $1 a $30 por 1M de tokens. En el benchmark Agents' Last Exam, el Sol senior superó a Claude Fable 5 por 13,1 puntos, pero perdió ante ella en SWE-Bench Pro — 64,6% versus 80%. OpenAI afirmó que casi un tercio de las asignaciones del SWE-Bench Pro son incorrectas.
Procesado por IA desde Simon Willison; editado por Hamidun News
OpenAI el 17 de julio de 2026 lanzó su familia de modelos insignia GPT-5.6 en disponibilidad general en tres tamaños — Luna, Terra y Sol — y según su propio punto de referencia, el modelo senior Sol superó a Claude Fable 5 de Anthropic por 13,1 puntos en la prueba Agents' Last Exam para tareas de agentes largos.
Cuánto cuestan los nuevos modelos
Los precios se fijan por "1 millón de tokens" por separado para entrada y salida, y los tres tamaños de GPT-5.6 difieren notablemente en costo.
- Luna (modelo junior) — $1 por 1M de tokens de entrada / $6 por 1M de tokens de salida
- Terra (modelo medio) — $2,50 por 1M de tokens de entrada / $15 por 1M de tokens de salida
- Sol (modelo senior) — $5 por 1M de tokens de entrada / $30 por 1M de tokens de salida
- Para comparación: la línea Claude Opus cuesta $5/$25 por 1M de tokens, y Claude Fable 5 — $10/$50
- Los tres modelos GPT-5.6 tienen una fecha de corte de conocimiento del 16 de febrero de 2026, una ventana de contexto de 1 millón de tokens y un límite de salida de 128.000 tokens
Cuánto supera GPT-5.6 a los competidores
OpenAI se basa en el punto de referencia Agents' Last Exam — una prueba de flujos de trabajo de agentes largos en 55 dominios profesionales. Según la empresa, GPT-5.6 Sol puntuó 53,6 puntos en esta prueba — un nuevo máximo, superando a Claude Fable 5 (en modo razonamiento adaptativo) por 13,1 puntos. Incluso en modo razonamiento medio, Sol lidera a Fable 5 por 11,4 puntos a un costo aproximadamente cuatro veces menor. Los modelos junior, Terra y Luna, según OpenAI, superan a Fable 5 a un gasto aproximadamente 16 veces menor.
Sin embargo, en otro punto de referencia popular — SWE-Bench Pro, una prueba de resolución de problemas de ingeniería reales — Claude Fable 5 puntuó 80%, mientras que GPT-5.6 Sol puntuó solo 64,6%. Posiblemente sea por esto que, en la víspera del lanzamiento, OpenAI publicó un artículo separado reclamando que aproximadamente el 30% de las tareas en SWE-bench Pro son incorrectas (rotas), e instó a otros desarrolladores de modelos a verificar más cuidadosamente los resultados en este punto de referencia.
Qué dicen las primeras pruebas
El autor de un blog que tuvo acceso temprano a GPT-5.6 Sol describe el modelo como "definitivamente muy competente", pero nota que en tareas complejas de escritura de código con las que trabaja, el modelo no le pareció mejor que Claude Fable 5 de Anthropic. Según él, los detalles más interesantes están contenidos en la guía oficial de OpenAI para usar GPT-5.6 — describe una serie de nuevas capacidades de API que los desarrolladores de herramientas de terceros aún tienen que explorar.
Qué significa esto
El lanzamiento de GPT-5.6 en tres versiones continúa la carrera entre OpenAI y Anthropic por el liderazgo en tareas de agentes — aquellas donde un modelo ejecuta de forma independiente largas cadenas de acciones en lugar de simplemente responder a una solicitud única. Al mismo tiempo, la comparación entre diferentes puntos de referencia da una imagen mixta: OpenAI gana en su propia prueba de flujo de trabajo de agentes, pero pierde en SWE-Bench Pro — a pesar de que OpenAI misma cuestionó públicamente la calidad de un tercio de las tareas de ese punto de referencia.
Para los desarrolladores, esta es una señal: la elección del modelo debe verificarse en sus propias tareas, no confiarse en una clasificación única promediada.
Preguntas frecuentes
¿Cuánto cuesta GPT-5.6 Sol?
El modelo senior GPT-5.6 Sol cuesta $5 por 1 millón de tokens de entrada y $30 por 1 millón de tokens de salida — más caro que Luna ($1/$6) y Terra ($2,50/$15), pero más barato que Claude Fable 5 ($10/$50).
¿Cómo difiere GPT-5.6 de Claude Fable 5 en capacidades?
En el punto de referencia Agents' Last Exam, GPT-5.6 Sol lidera a Fable 5 por 13,1 puntos (53,6 frente a la puntuación de Fable 5), pero en SWE-Bench Pro Fable 5 puntúa 80% frente a 64,6% para Sol — lo que significa que la superioridad depende del tipo de tarea.
¿Cuál es el contexto y los límites para los modelos GPT-5.6?
Los tres modelos — Luna, Terra y Sol — tienen una ventana de contexto de 1 millón de tokens, un límite de salida de 128.000 tokens y una fecha de corte de conocimiento del 16 de febrero de 2026.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.