OpenAI Blog→ original

OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%

OpenAI утверждает: официальный harness бенчмарка ARC-AGI-3 занижал её модель. Он выбрасывал приватные рассуждения GPT-5.6 Sol после каждого хода, и та разбиралась в игре заново. Стоило включить две настройки Responses API — retained reasoning и compaction — и результат утроился: с 13,3% до 38,3%, при этом выходных токенов на игру уходит примерно в 6 раз меньше. С такой конфигурацией GPT-5.6 обошла Anthropic Opus 5 (30,2%).

Traité par IA depuis OpenAI Blog ; édité par Hamidun News
OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%
Source : OpenAI Blog. Collage: Hamidun News.
◐ Écouter l'article

OpenAI a annoncé le 30 juillet 2026 que l'activation de deux paramètres de son Responses API — la rétention du raisonnement (retained reasoning) et la compaction (compaction) — a triplé le score du modèle GPT-5.6 Sol sur le benchmark ARC-AGI-3 : de 13,3 % à 38,3 % sur l'ensemble public de tâches. Dans le même temps, la consommation de tokens de sortie par partie a chuté d'environ six fois, et avec la nouvelle configuration, le modèle a dépassé Anthropic Opus 5.

Ce que teste ARC-AGI-3

ARC-AGI-3 est un benchmark interactif de raisonnement abstrait, dans lequel un agent IA résout des tâches de jeu inconnues tour par tour : il effectue une action, observe le résultat et planifie le coup suivant. Contrairement aux tests statiques, la mémoire entre les tours y est essentielle — l'agent doit accumuler une compréhension des règles du jeu au fur et à mesure. C'est précisément à cette mémoire qu'est lié tout le bond de 13,3 % à 38,3 % dont parle OpenAI.

En quoi consistent les deux paramètres

Les deux paramètres — retained reasoning et compaction — sont les mêmes mécanismes qu'OpenAI applique dans ses produits ChatGPT et Codex. Retained reasoning conserve la chaîne de raisonnement privée du modèle entre différentes fenêtres de contexte. Compaction résume le contexte accumulé lorsque celui-ci approche de la limite, au lieu de couper mécaniquement les éléments les plus anciens. Les deux paramètres sont disponibles via la Responses API — l'interface d'OpenAI pour les scénarios agentiques.

  • Modèle — GPT-5.6 Sol d'OpenAI
  • Harness officiel d'ARC-AGI-3 : 13,3 % sur l'ensemble public
  • Avec retained reasoning et compaction via la Responses API : 38,3 %
  • Tokens de sortie par partie — environ 6 fois moins
  • Publication — blog d'OpenAI, 30 juillet 2026

Pourquoi le score était plus bas

Le harness officiel d'ARC-AGI-3 supprimait le raisonnement privé de l'agent après chaque tour, ce qui maintenait le score bloqué à 13,3 %. GPT-5.6 Sol voyait le journal des actions passées et de brèves notes les concernant, mais pas la réflexion à l'origine de ces coups — de sorte qu'à chaque étape, il devait en réalité redécouvrir le jeu depuis le début. Lorsque l'historique des coups dépassait la fenêtre de contexte, le harness supprimait en plus les actions les plus anciennes. En somme, le modèle se souvenait avoir « déplacé le bloc violet », mais oubliait pourquoi il l'avait fait.

«

Les benchmarks ne mesurent jamais seulement le modèle — ils mesurent aussi l'infrastructure technique qui l'entoure », indique le blog d'OpenAI.

Comment GPT-5.6 s'est comparé à Opus 5

Avec les paramètres activés, GPT-5.6 Sol a obtenu 38,3 % et a dépassé Anthropic Opus 5, qui a obtenu 30,2 % sur ARC-AGI-3. Selon OpenAI, l'écart ne provient pas du modèle lui-même, mais de la configuration du test : le harness officiel est dépourvu de fonctionnalités spécifiques au fournisseur, telles que retained reasoning, disponibles via la Responses API. Cette même technique a eu un effet secondaire — une économie d'environ six fois sur les tokens de sortie par partie.

Ce que cela signifie

Le résultat d'un benchmark ne dépend pas seulement du modèle, mais aussi de la configuration de l'API et de la conception du harness de test. Le même GPT-5.6 Sol affiche 13,3 % ou 38,3 % selon la configuration — ce qui change la façon de lire les tableaux comparatifs avec lesquels les laboratoires d'IA se mesurent les uns aux autres.

Questions fréquentes

Que sont retained reasoning et compaction ?

Retained reasoning conserve la chaîne de raisonnement privée du modèle entre les fenêtres de contexte, tandis que compaction résume l'ancien contexte au lieu de simplement le couper. OpenAI utilise déjà les deux paramètres dans ChatGPT et Codex.

De combien les résultats de GPT-5.6 Sol ont-ils augmenté ?

Sur l'ensemble public d'ARC-AGI-3, le score est passé de 13,3 % à 38,3 %, soit environ le triple. Dans le même temps, la consommation de tokens de sortie par partie a diminué d'environ six fois.

GPT-5.6 Sol a-t-il dépassé le modèle Opus 5 ?

Oui. Avec les deux paramètres, GPT-5.6 Sol a obtenu 38,3 % contre 30,2 % pour Anthropic Opus 5 sur ARC-AGI-3, selon OpenAI.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…