Simon Willison→ original

A OpenAI lançou o modelo flagship GPT-5.6 em três versões — Luna, Terra e Sol

A OpenAI lançou a família GPT-5.6 de três modelos — Luna, Terra e Sol — com preços de $1 a $30 por 1M de tokens. No benchmark Agents' Last Exam, o Sol sênior superou Claude Fable 5 por 13,1 pontos, mas perdeu para ela no SWE-Bench Pro — 64,6% versus 80%. A OpenAI afirmou que quase um terço das atribuições do SWE-Bench Pro estão incorretas.

Processado por IA de Simon Willison; editado por Hamidun News
A OpenAI lançou o modelo flagship GPT-5.6 em três versões — Luna, Terra e Sol
Fonte: Simon Willison. Colagem: Hamidun News.
◐ Ouvir artigo

OpenAI em 17 de julho de 2026 lançou sua família de modelos insignia GPT-5.6 em disponibilidade geral em três tamanhos — Luna, Terra e Sol — e de acordo com seu próprio benchmark, o modelo senior Sol superou Claude Fable 5 do Anthropic por 13,1 pontos no teste Agents' Last Exam para tarefas de agentes longos.

Quanto custam os novos modelos

Os preços são definidos por "1 milhão de tokens" separadamente para entrada e saída, e os três tamanhos do GPT-5.6 diferem notavelmente em custo.

  • Luna (modelo junior) — $1 por 1M de tokens de entrada / $6 por 1M de tokens de saída
  • Terra (modelo médio) — $2,50 por 1M de tokens de entrada / $15 por 1M de tokens de saída
  • Sol (modelo senior) — $5 por 1M de tokens de entrada / $30 por 1M de tokens de saída
  • Para comparação: a linha Claude Opus custa $5/$25 por 1M de tokens, e Claude Fable 5 — $10/$50
  • Todos os três modelos GPT-5.6 têm uma data limite de conhecimento de 16 de fevereiro de 2026, uma janela de contexto de 1 milhão de tokens e um limite de saída de 128.000 tokens

Quanto o GPT-5.6 supera os concorrentes

OpenAI confia no benchmark Agents' Last Exam — um teste de fluxos de trabalho de agentes longos em 55 domínios profissionais. De acordo com a empresa, GPT-5.6 Sol marcou 53,6 pontos neste teste — um novo máximo, superando Claude Fable 5 (no modo raciocínio adaptativo) por 13,1 pontos. Mesmo no modo de raciocínio médio, Sol lidera Fable 5 por 11,4 pontos com um custo aproximadamente quatro vezes menor. Os modelos junior, Terra e Luna, de acordo com OpenAI, superam Fable 5 em custos aproximadamente 16 vezes menores.

Porém, em outro benchmark popular — SWE-Bench Pro, um teste de resolução de problemas de engenharia reais — Claude Fable 5 marcou 80%, enquanto GPT-5.6 Sol marcou apenas 64,6%. Possivelmente por isso, na véspera do lançamento, OpenAI publicou um artigo separado alegando que cerca de 30% das tarefas no SWE-bench Pro estão incorretas (quebradas), e pediu a outros desenvolvedores de modelos que verificassem mais cuidadosamente os resultados neste benchmark.

O que dizem os primeiros testes

Um autor de um blog que teve acesso antecipado a GPT-5.6 Sol descreve o modelo como "definitivamente muito competente", mas observa que em tarefas complexas de escrita de código com as quais trabalha, o modelo não pareceu melhor que Claude Fable 5 do Anthropic. Segundo ele, os detalhes mais interessantes estão contidos no guia oficial do OpenAI para usar GPT-5.6 — descreve uma série de novas capacidades de API que desenvolvedores de ferramentas de terceiros ainda têm que explorar.

O que isso significa

O lançamento do GPT-5.6 em três versões continua a corrida entre OpenAI e Anthropic pela liderança em tarefas de agentes — aquelas onde um modelo executa independentemente longas cadeias de ações em vez de simplesmente responder a uma única solicitação. Ao mesmo tempo, a comparação entre benchmarks diferentes oferece uma imagem mista: OpenAI vence em seu próprio teste de fluxo de trabalho de agentes, mas perde no SWE-Bench Pro — mesmo sendo que a própria OpenAI questionou publicamente a qualidade de um terço das tarefas deste benchmark. Para desenvolvedores, este é um sinal: a escolha do modelo deve ser verificada em suas próprias tarefas, não confiado em uma única classificação média.

Perguntas frequentes

Quanto custa GPT-5.6 Sol?

O modelo senior GPT-5.6 Sol custa $5 por 1 milhão de tokens de entrada e $30 por 1 milhão de tokens de saída — mais caro que Luna ($1/$6) e Terra ($2,50/$15), mas mais barato que Claude Fable 5 ($10/$50).

Como GPT-5.6 difere de Claude Fable 5 em capacidades?

No benchmark Agents' Last Exam, GPT-5.6 Sol lidera Fable 5 por 13,1 pontos (53,6 versus a pontuação de Fable 5), mas no SWE-Bench Pro Fable 5 marca 80% contra 64,6% para Sol — significando que a superioridade depende do tipo de tarefa.

Quais são o contexto e limites para os modelos GPT-5.6?

Todos os três modelos — Luna, Terra e Sol — têm uma janela de contexto de 1 milhão de tokens, um limite de saída de 128.000 tokens e uma data limite de conhecimento de 16 de fevereiro de 2026.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…