arXiv cs.CL→ original

Relay-Bench: даже GPT-5.5 набрала лишь 43,3% на мультидоменном тесте рассуждений

Исследователи представили Relay-Bench — текстовый бенчмарк, где модели решают связанные задачи сразу из нескольких доменов: код, математика, анализ данных, веб-поиск, визуальное рассуждение. Лучший результат показала GPT-5.5 в режиме xHigh — всего 43,3%. Задания склеены из 2–13 подзадач с намеренным раздуванием контекста.

Processado por IA de arXiv cs.CL; editado por Hamidun News
Relay-Bench: даже GPT-5.5 набрала лишь 43,3% на мультидоменном тесте рассуждений
Fonte: arXiv cs.CL. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores publicaram em julho de 2026 no arXiv o benchmark Relay-Bench, que avalia a capacidade dos modelos de linguagem de resolver tarefas encadeadas de diferentes áreas temáticas dentro de uma única consulta. O melhor modelo testado, o GPT-5.5 no modo xHigh, obteve apenas 43,3% — ou seja, nem mesmo o sistema mais forte conseguiu resolver metade das tarefas.

O que o Relay-Bench mede

O Relay-Bench avalia se um modelo consegue manter vários domínios de raciocínio dentro de um único prompt. O conjunto de testes é composto inteiramente por tarefas compostas: várias subtarefas de um único domínio são encadeadas em uma sequência que não pode ser resolvida raciocinando apenas dentro de uma área. Cada tarefa contém de 2 a 13 subtarefas e permanece totalmente textual — não é necessária entrada ou saída multimodal, o que facilita reproduzir o teste em qualquer modelo.

Os autores chamam o benchmark de "não saturado" (unsaturated): os modelos atuais ainda têm uma margem enorme para crescer, o teto está distante e não pode ser alcançado com uma única atualização. Isso diferencia o Relay-Bench de muitos testes antigos, nos quais os modelos de ponta já estão estagnados entre 90% e 100% e deixaram de se diferenciar entre si.

  • O líder do ranking é o GPT-5.5 (xHigh), com resultado de 43,3%
  • Cada tarefa é composta de 2 a 13 subtarefas relacionadas
  • Domínios: raciocínio visual, código, matemática, extração de informação (busca na web), resolução de problemas, conhecimentos gerais, análise de dados
  • O formato é somente textual — sem imagens na entrada ou na saída
  • Os modelos podem executar código, buscar na web e usar quaisquer ferramentas disponíveis

Por que até o GPT-5.5 obteve apenas 43%

As tarefas são propositalmente complicadas, por isso os resultados são baixos mesmo para os modelos mais fortes. De acordo com a descrição no arXiv, camadas de complexidade são adicionadas às cadeias básicas por meio da codificação do prompt (prompt encoding) e do inchaço proposital do contexto (context bloat) — o modelo precisa filtrar o ruído sem perder o fio condutor entre os domínios. Não há restrições fora do model harness: os autores incentivam explicitamente o uso de execução de código, busca na web e todas as ferramentas disponíveis, mas mesmo assim a marca de 43,3% permanece invicta.

O problema central é a alternância entre áreas. Um modelo pode resolver com segurança uma subtarefa de matemática e uma subtarefa de código separadamente, mas tropeça quando o resultado de uma subtarefa precisa ser transferido para a próxima dentro de uma única cadeia de raciocínio. É justamente esse "revezamento" (relay) que dá nome ao benchmark.

"Um benchmark não saturado, holístico e somente textual, que mede a capacidade de um LLM de executar um conjunto de tarefas de diferentes domínios dentro de um único prompt" — da descrição do

Relay-Bench no arXiv.

Em que isso difere dos testes convencionais

O Relay-Bench não avalia habilidades isoladas, mas sua combinação dentro de uma única tarefa. Os benchmarks clássicos medem código, matemática ou conhecimentos gerais separadamente — aqui, sete domínios estão entrelaçados em uma única cadeia, e uma falha em qualquer elo derruba toda a tarefa. Esse formato está mais próximo de cenários de trabalho reais, em que um agente precisa buscar dados na web, fazer cálculos e escrever código dentro de uma mesma tarefa.

O que isso significa

O Relay-Bench revela a lacuna entre as habilidades pontuais dos modelos e o raciocínio de ponta a ponta: os LLMs conseguem lidar com cada área isoladamente, mas conectá-las em uma longa cadeia multidomínio — ainda não. O espaço para crescimento é enorme: de 43,3% até o teto ainda há um longo caminho, e são justamente testes "não saturados" como esse que vão definir o patamar para as próximas gerações de modelos e sistemas agênticos.

Perguntas frequentes

O que é o Relay-Bench?

O Relay-Bench é um benchmark somente textual, apresentado no arXiv em julho de 2026. Ele avalia como os modelos de linguagem resolvem tarefas compostas de sete domínios (código, matemática, busca na web, análise de dados, entre outros), reunidas em uma única cadeia dentro de um único prompt.

Qual modelo obteve o melhor resultado?

O melhor resultado é do GPT-5.5 no modo xHigh: 43,3%. Isso significa que até o modelo mais forte testado resolveu menos da metade das tarefas, e o benchmark continua "não saturado" e distante do teto.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…