OpenAI Blog→ оригинал

OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%

OpenAI утверждает: официальный harness бенчмарка ARC-AGI-3 занижал её модель. Он выбрасывал приватные рассуждения GPT-5.6 Sol после каждого хода, и та разбиралась в игре заново. Стоило включить две настройки Responses API — retained reasoning и compaction — и результат утроился: с 13,3% до 38,3%, при этом выходных токенов на игру уходит примерно в 6 раз меньше. С такой конфигурацией GPT-5.6 обошла Anthropic Opus 5 (30,2%).

AI-обработка оригинала OpenAI Blog; редакция Hamidun News
OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%
Источник: OpenAI Blog. Коллаж: Hamidun News.
◐ Слушать статью

OpenAI 30 июля 2026 года сообщила, что включение двух настроек её Responses API — сохранения рассуждений (retained reasoning) и компактизации (compaction) — утроило результат модели GPT-5.6 Sol на бенчмарке ARC-AGI-3: с 13,3% до 38,3% на публичном наборе задач. При этом расход выходных токенов на одну игру упал примерно в шесть раз, а с новой конфигурацией модель обошла Anthropic Opus 5.

Что проверяет ARC-AGI-3

ARC-AGI-3 — интерактивный бенчмарк на абстрактное рассуждение, где ИИ-агент проходит незнакомые игровые задачи по ходам: делает действие, видит результат, планирует следующее. В отличие от статичных тестов, здесь критична память между ходами — агент должен накапливать понимание правил игры по мере прохождения. Именно с этой памятью и связан весь скачок с 13,3% до 38,3%, о котором пишет OpenAI.

Что за две настройки

Две настройки — retained reasoning и compaction — это те же механизмы, что OpenAI применяет в своих продуктах ChatGPT и Codex. Retained reasoning сохраняет приватную цепочку рассуждений модели между отдельными окнами контекста. Compaction суммирует накопленный контекст, когда тот подходит к лимиту, вместо того чтобы механически обрезать самое старое. Оба параметра доступны через Responses API — интерфейс OpenAI для агентных сценариев.

  • Модель — GPT-5.6 Sol от OpenAI
  • Официальный harness ARC-AGI-3: 13,3% на публичном наборе
  • С retained reasoning и compaction через Responses API: 38,3%
  • Выходных токенов на одну игру — примерно в 6 раз меньше
  • Публикация — блог OpenAI, 30 июля 2026 года

Почему падал результат

Официальный harness ARC-AGI-3 после каждого хода агента выбрасывал его приватные рассуждения, из-за чего результат застревал на 13,3%. GPT-5.6 Sol видела лог прошлых действий и короткие заметки к ним, но не то мышление, которое эти ходы породило, — и на каждом шаге фактически разбиралась в игре заново. Когда история ходов превышала окно контекста, harness дополнительно удалял самые старые действия. По сути модель помнила, что «передвинула фиолетовый блок», но забывала, зачем она это сделала.

«Бенчмарки никогда не измеряют только модель — они измеряют и техническую обвязку вокруг неё», — говорится в блоге

OpenAI.

Как GPT-5.6 сравнилась с Opus 5

С включёнными настройками GPT-5.6 Sol набрала 38,3% и обошла Anthropic Opus 5 с её 30,2% на ARC-AGI-3. По версии OpenAI, разрыв возник не из-за самой модели, а из-за конфигурации теста: официальный harness лишён провайдер-специфичных возможностей вроде retained reasoning, которые доступны через Responses API. Тот же приём дал и побочный эффект — примерно шестикратную экономию выходных токенов на одну игру.

Что это значит

Результат на бенчмарке зависит не только от модели, но и от того, как настроен API и спроектирован тестовый harness. Одна и та же GPT-5.6 Sol показывает 13,3% или 38,3% в зависимости от конфигурации — и это меняет прочтение сравнительных таблиц, которыми AI-лаборатории меряются друг с другом.

Частые вопросы

Что такое retained reasoning и compaction?

Retained reasoning сохраняет приватную цепочку рассуждений модели между окнами контекста, а compaction суммирует старый контекст вместо простой обрезки. Обе настройки OpenAI уже использует в ChatGPT и Codex.

Насколько выросли результаты GPT-5.6 Sol?

На публичном наборе ARC-AGI-3 результат вырос с 13,3% до 38,3% — примерно втрое. При этом расход выходных токенов на одну игру снизился около шести раз.

Обошла ли GPT-5.6 Sol модель Opus 5?

Да. С двумя настройками GPT-5.6 Sol набрала 38,3% против 30,2% у Anthropic Opus 5 на ARC-AGI-3, по данным OpenAI.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…