OpenAI: две настройки API утроили результат GPT-5.6 на ARC-AGI-3 — до 38,3%
OpenAI утверждает: официальный harness бенчмарка ARC-AGI-3 занижал её модель. Он выбрасывал приватные рассуждения GPT-5.6 Sol после каждого хода, и та разбиралась в игре заново. Стоило включить две настройки Responses API — retained reasoning и compaction — и результат утроился: с 13,3% до 38,3%, при этом выходных токенов на игру уходит примерно в 6 раз меньше. С такой конфигурацией GPT-5.6 обошла Anthropic Opus 5 (30,2%).
Processado por IA de OpenAI Blog; editado por Hamidun News
A OpenAI anunciou em 30 de julho de 2026 que a ativação de duas configurações de sua Responses API — retenção de raciocínio (retained reasoning) e compactação (compaction) — triplicou o resultado do modelo GPT-5.6 Sol no benchmark ARC-AGI-3: de 13,3% para 38,3% no conjunto público de tarefas. Ao mesmo tempo, o gasto de tokens de saída por partida caiu cerca de seis vezes, e com a nova configuração o modelo superou o Anthropic Opus 5.
O que o ARC-AGI-3 avalia
O ARC-AGI-3 é um benchmark interativo de raciocínio abstrato, no qual um agente de IA percorre tarefas de jogo desconhecidas turno a turno: executa uma ação, observa o resultado e planeja o próximo movimento. Diferentemente de testes estáticos, aqui a memória entre os turnos é crucial — o agente precisa acumular compreensão das regras do jogo à medida que avança. É justamente a essa memória que se deve todo o salto de 13,3% para 38,3% mencionado pela OpenAI.
O que são as duas configurações
As duas configurações — retained reasoning e compaction — são os mesmos mecanismos que a OpenAI aplica em seus produtos ChatGPT e Codex. O retained reasoning preserva a cadeia privada de raciocínio do modelo entre janelas de contexto separadas. O compaction resume o contexto acumulado quando este se aproxima do limite, em vez de simplesmente cortar mecanicamente o material mais antigo. Ambos os parâmetros estão disponíveis via Responses API — a interface da OpenAI para cenários de agentes.
- Modelo — GPT-5.6 Sol, da OpenAI
- Harness oficial do ARC-AGI-3: 13,3% no conjunto público
- Com retained reasoning e compaction via Responses API: 38,3%
- Tokens de saída por partida — cerca de 6 vezes menos
- Publicação — blog da OpenAI, 30 de julho de 2026
Por que o resultado era mais baixo
O harness oficial do ARC-AGI-3 descartava o raciocínio privado do agente após cada turno, o que mantinha o resultado travado em 13,3%. O GPT-5.6 Sol via o registro de ações passadas e breves anotações sobre elas, mas não o pensamento que havia gerado esses movimentos — e, na prática, tinha que decifrar o jogo do zero a cada passo. Quando o histórico de movimentos ultrapassava a janela de contexto, o harness também apagava as ações mais antigas. Em essência, o modelo lembrava que "moveu o bloco roxo", mas esquecia por que havia feito isso.
"Benchmarks nunca medem apenas o modelo — eles também medem a estrutura técnica ao redor dele", afirma o blog da
OpenAI.
Como o GPT-5.6 se comparou ao Opus 5
Com as configurações ativadas, o GPT-5.6 Sol atingiu 38,3% e superou o Anthropic Opus 5, que obteve 30,2% no ARC-AGI-3. Segundo a OpenAI, a diferença não surgiu por causa do modelo em si, mas da configuração do teste: o harness oficial carece de recursos específicos do provedor, como o retained reasoning, disponíveis via Responses API. A mesma técnica gerou um efeito colateral — uma economia de cerca de seis vezes nos tokens de saída por partida.
O que isso significa
O resultado em um benchmark não depende apenas do modelo, mas também de como a API está configurada e de como o harness de teste foi projetado. O mesmo GPT-5.6 Sol apresenta 13,3% ou 38,3% dependendo da configuração — e isso muda a leitura das tabelas comparativas com as quais os laboratórios de IA se medem entre si.
Perguntas frequentes
O que são retained reasoning e compaction?
O retained reasoning preserva a cadeia privada de raciocínio do modelo entre janelas de contexto, enquanto o compaction resume o contexto antigo em vez de simplesmente cortá-lo. A OpenAI já usa as duas configurações no ChatGPT e no Codex.
O quanto os resultados do GPT-5.6 Sol melhoraram?
No conjunto público do ARC-AGI-3, o resultado subiu de 13,3% para 38,3% — cerca do triplo. Ao mesmo tempo, o gasto de tokens de saída por partida caiu cerca de seis vezes.
O GPT-5.6 Sol superou o modelo Opus 5?
Sim. Com as duas configurações, o GPT-5.6 Sol atingiu 38,3% contra 30,2% do Anthropic Opus 5 no ARC-AGI-3, segundo a OpenAI.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.