Simon Willison→ original

OpenAI a lancé le modèle flagship GPT-5.6 en trois versions — Luna, Terra et Sol

OpenAI a lancé la famille GPT-5.6 de trois modèles — Luna, Terra et Sol — avec des prix de 1 $ à 30 $ par 1M de jetons. Sur le benchmark Agents' Last Exam, le Sol senior a surpassé Claude Fable 5 de 13,1 points, mais a perdu face à lui sur SWE-Bench Pro — 64,6% contre 80%. OpenAI a affirmé que près d'un tiers des affectations de SWE-Bench Pro sont incorrectes.

Traité par IA depuis Simon Willison ; édité par Hamidun News
OpenAI a lancé le modèle flagship GPT-5.6 en trois versions — Luna, Terra et Sol
Source : Simon Willison. Collage: Hamidun News.
◐ Écouter l'article

OpenAI le 17 juillet 2026 a lancé sa famille de modèles phares GPT-5.6 en disponibilité générale en trois tailles — Luna, Terra et Sol — et selon son propre benchmark, le modèle senior Sol a surpassé Claude Fable 5 d'Anthropic de 13,1 points au test Agents' Last Exam pour les tâches d'agents longues.

Combien coûtent les nouveaux modèles

Les prix sont fixés par "1 million de tokens" séparément pour l'entrée et la sortie, et les trois tailles de GPT-5.6 diffèrent notablement en coût.

  • Luna (modèle junior) — $1 par 1M tokens d'entrée / $6 par 1M tokens de sortie
  • Terra (modèle moyen) — $2,50 par 1M tokens d'entrée / $15 par 1M tokens de sortie
  • Sol (modèle senior) — $5 par 1M tokens d'entrée / $30 par 1M tokens de sortie
  • Pour comparaison : la gamme Claude Opus coûte $5/$25 par 1M de tokens, et Claude Fable 5 — $10/$50
  • Tous les trois modèles GPT-5.6 ont une date limite de connaissance du 16 février 2026, une fenêtre de contexte de 1 million de tokens et une limite de sortie de 128 000 tokens

Combien GPT-5.6 surpasse les concurrents

OpenAI s'appuie sur le benchmark Agents' Last Exam — un test de flux de travail d'agents longs dans 55 domaines professionnels. Selon l'entreprise, GPT-5.6 Sol a marqué 53,6 points à ce test — un nouveau maximum, surpassant Claude Fable 5 (en mode raison adaptative) de 13,1 points. Même en mode raison moyen, Sol devance Fable 5 de 11,4 points à environ quatre fois moins de frais. Les modèles junior, Terra et Luna, selon OpenAI, surpassent Fable 5 à environ 16 fois moins de dépenses.

Cependant, sur un autre benchmark populaire — SWE-Bench Pro, un test de résolution de problèmes d'ingénierie réels — Claude Fable 5 a marqué 80%, tandis que GPT-5.6 Sol a marqué seulement 64,6%. C'est peut-être pour cela qu'à la veille du lancement, OpenAI a publié un article séparé affirmant qu'environ 30% des tâches dans SWE-bench Pro sont incorrectes (cassées), et a exhorté d'autres développeurs de modèles à vérifier plus attentivement les résultats sur ce benchmark.

Ce que disent les premiers tests

Un auteur d'un blog qui a eu un accès précoce à GPT-5.6 Sol décrit le modèle comme "définitivement très compétent", mais note que sur des tâches complexes d'écriture de code avec lesquelles il travaille, le modèle ne lui a pas semblé meilleur que Claude Fable 5 d'Anthropic. Selon lui, les détails les plus intéressants sont contenus dans le guide officiel d'OpenAI pour utiliser GPT-5.6 — il décrit un certain nombre de nouvelles capacités d'API que les développeurs d'outils tiers ont encore à explorer.

Qu'est-ce que cela signifie

Le lancement de GPT-5.6 en trois versions poursuit la course entre OpenAI et Anthropic pour le leadership dans les tâches d'agents — celles où un modèle exécute indépendamment de longues chaînes d'actions au lieu de simplement répondre à une seule demande. En même temps, la comparaison entre différents benchmarks donne une image mitigée : OpenAI gagne à son propre test de flux de travail d'agents, mais perd sur SWE-Bench Pro — bien qu'OpenAI elle-même ait publiquement remis en question la qualité d'un tiers des tâches de ce benchmark. Pour les développeurs, c'est un signal : le choix du modèle doit être vérifié sur vos propres tâches, et non basé sur une seule notation moyenne.

Questions fréquemment posées

Combien coûte GPT-5.6 Sol ?

Le modèle senior GPT-5.6 Sol coûte $5 par 1 million de tokens d'entrée et $30 par 1 million de tokens de sortie — plus cher que Luna ($1/$6) et Terra ($2,50/$15), mais moins cher que Claude Fable 5 ($10/$50).

Comment GPT-5.6 diffère-t-il de

Claude Fable 5 en termes de capacités ?

Sur le benchmark Agents' Last Exam, GPT-5.6 Sol devance Fable 5 de 13,1 points (53,6 par rapport au score de Fable 5), mais sur SWE-Bench Pro Fable 5 marque 80% contre 64,6% pour Sol — ce qui signifie que la supériorité dépend du type de tâche.

Quel est le contexte et les limites pour les modèles GPT-5.6 ?

Tous les trois modèles — Luna, Terra et Sol — ont une fenêtre de contexte de 1 million de tokens, une limite de sortie de 128 000 tokens et une date limite de connaissance du 16 février 2026.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…