OpenAI Blog→ original

OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%

OpenAI утверждает: официальный harness бенчмарка ARC-AGI-3 занижал её модель. Он выбрасывал приватные рассуждения GPT-5.6 Sol после каждого хода, и та разбиралась в игре заново. Стоило включить две настройки Responses API — retained reasoning и compaction — и результат утроился: с 13,3% до 38,3%, при этом выходных токенов на игру уходит примерно в 6 раз меньше. С такой конфигурацией GPT-5.6 обошла Anthropic Opus 5 (30,2%).

Processado por IA de OpenAI Blog; editado por Hamidun News
OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%
Fonte: OpenAI Blog. Colagem: Hamidun News.
◐ Ouvir artigo

A OpenAI anunciou em 30 de julho de 2026 que a ativação de duas configurações de sua Responses API — retenção de raciocínio (retained reasoning) e compactação (compaction) — triplicou o resultado do modelo GPT-5.6 Sol no benchmark ARC-AGI-3: de 13,3% para 38,3% no conjunto público de tarefas. Ao mesmo tempo, o gasto de tokens de saída por partida caiu cerca de seis vezes, e com a nova configuração o modelo superou o Anthropic Opus 5.

O que o ARC-AGI-3 avalia

O ARC-AGI-3 é um benchmark interativo de raciocínio abstrato, no qual um agente de IA percorre tarefas de jogo desconhecidas turno a turno: executa uma ação, observa o resultado e planeja o próximo movimento. Diferentemente de testes estáticos, aqui a memória entre os turnos é crucial — o agente precisa acumular compreensão das regras do jogo à medida que avança. É justamente a essa memória que se deve todo o salto de 13,3% para 38,3% mencionado pela OpenAI.

O que são as duas configurações

As duas configurações — retained reasoning e compaction — são os mesmos mecanismos que a OpenAI aplica em seus produtos ChatGPT e Codex. O retained reasoning preserva a cadeia privada de raciocínio do modelo entre janelas de contexto separadas. O compaction resume o contexto acumulado quando este se aproxima do limite, em vez de simplesmente cortar mecanicamente o material mais antigo. Ambos os parâmetros estão disponíveis via Responses API — a interface da OpenAI para cenários de agentes.

  • Modelo — GPT-5.6 Sol, da OpenAI
  • Harness oficial do ARC-AGI-3: 13,3% no conjunto público
  • Com retained reasoning e compaction via Responses API: 38,3%
  • Tokens de saída por partida — cerca de 6 vezes menos
  • Publicação — blog da OpenAI, 30 de julho de 2026

Por que o resultado era mais baixo

O harness oficial do ARC-AGI-3 descartava o raciocínio privado do agente após cada turno, o que mantinha o resultado travado em 13,3%. O GPT-5.6 Sol via o registro de ações passadas e breves anotações sobre elas, mas não o pensamento que havia gerado esses movimentos — e, na prática, tinha que decifrar o jogo do zero a cada passo. Quando o histórico de movimentos ultrapassava a janela de contexto, o harness também apagava as ações mais antigas. Em essência, o modelo lembrava que "moveu o bloco roxo", mas esquecia por que havia feito isso.

"Benchmarks nunca medem apenas o modelo — eles também medem a estrutura técnica ao redor dele", afirma o blog da

OpenAI.

Como o GPT-5.6 se comparou ao Opus 5

Com as configurações ativadas, o GPT-5.6 Sol atingiu 38,3% e superou o Anthropic Opus 5, que obteve 30,2% no ARC-AGI-3. Segundo a OpenAI, a diferença não surgiu por causa do modelo em si, mas da configuração do teste: o harness oficial carece de recursos específicos do provedor, como o retained reasoning, disponíveis via Responses API. A mesma técnica gerou um efeito colateral — uma economia de cerca de seis vezes nos tokens de saída por partida.

O que isso significa

O resultado em um benchmark não depende apenas do modelo, mas também de como a API está configurada e de como o harness de teste foi projetado. O mesmo GPT-5.6 Sol apresenta 13,3% ou 38,3% dependendo da configuração — e isso muda a leitura das tabelas comparativas com as quais os laboratórios de IA se medem entre si.

Perguntas frequentes

O que são retained reasoning e compaction?

O retained reasoning preserva a cadeia privada de raciocínio do modelo entre janelas de contexto, enquanto o compaction resume o contexto antigo em vez de simplesmente cortá-lo. A OpenAI já usa as duas configurações no ChatGPT e no Codex.

O quanto os resultados do GPT-5.6 Sol melhoraram?

No conjunto público do ARC-AGI-3, o resultado subiu de 13,3% para 38,3% — cerca do triplo. Ao mesmo tempo, o gasto de tokens de saída por partida caiu cerca de seis vezes.

O GPT-5.6 Sol superou o modelo Opus 5?

Sim. Com as duas configurações, o GPT-5.6 Sol atingiu 38,3% contra 30,2% do Anthropic Opus 5 no ARC-AGI-3, segundo a OpenAI.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…