arXiv cs.CL→ original

Relay-Bench: даже GPT-5.5 набрала лишь 43,3% на мультидоменном тесте рассуждений

Исследователи представили Relay-Bench — текстовый бенчмарк, где модели решают связанные задачи сразу из нескольких доменов: код, математика, анализ данных, веб-поиск, визуальное рассуждение. Лучший результат показала GPT-5.5 в режиме xHigh — всего 43,3%. Задания склеены из 2–13 подзадач с намеренным раздуванием контекста.

Traité par IA depuis arXiv cs.CL ; édité par Hamidun News
Relay-Bench: даже GPT-5.5 набрала лишь 43,3% на мультидоменном тесте рассуждений
Source : arXiv cs.CL. Collage: Hamidun News.
◐ Écouter l'article

Des chercheurs ont publié en juillet 2026 sur arXiv le benchmark Relay-Bench, qui évalue la capacité des modèles de langage à résoudre des tâches liées relevant de domaines différents au sein d'une seule requête. Le meilleur modèle testé, GPT-5.5 en mode xHigh, n'a obtenu que 43,3 % — c'est-à-dire que même le système le plus puissant n'a pas réussi à résoudre la moitié des tâches.

Ce que mesure Relay-Bench

Relay-Bench évalue si un modèle parvient à maintenir plusieurs domaines de raisonnement au sein d'un même prompt. Le jeu de test est entièrement composé de tâches composites : plusieurs sous-tâches d'un seul domaine sont enchaînées pour former une séquence qui ne peut être résolue en raisonnant dans un seul domaine. Chaque tâche contient de 2 à 13 sous-tâches et reste entièrement textuelle — aucune entrée ni sortie multimodale n'est requise, ce qui facilite la reproduction du test sur n'importe quel modèle.

Les auteurs qualifient le benchmark de « non saturé » (unsaturated) : les modèles actuels disposent encore d'une marge de progression énorme, le plafond est encore loin, et une seule mise à jour ne suffira pas à l'atteindre. Cela distingue Relay-Bench de nombreux anciens tests, où les modèles de pointe stagnent depuis longtemps entre 90 et 100 % et ont cessé de se différencier les uns des autres.

  • Le leader du classement est GPT-5.5 (xHigh), avec un score de 43,3 %
  • Chaque tâche est composée de 2 à 13 sous-tâches liées
  • Domaines : raisonnement visuel, code, mathématiques, extraction d'information (recherche web), résolution de problèmes, connaissances générales, analyse de données
  • Le format est exclusivement textuel — sans images en entrée ni en sortie
  • Les modèles sont autorisés à exécuter du code, à effectuer des recherches sur le web et à utiliser tous les outils disponibles

Pourquoi même GPT-5.5 n'a obtenu que 43 %

Les tâches sont volontairement complexifiées, ce qui explique des résultats faibles même pour les modèles les plus performants. Selon la description publiée sur arXiv, des couches de complexité sont ajoutées aux chaînes de base via l'encodage du prompt (prompt encoding) et un gonflement délibéré du contexte (context bloat) — le modèle doit filtrer le bruit sans perdre le fil entre les domaines. Il n'existe aucune restriction en dehors du model harness : les auteurs encouragent explicitement le recours à l'exécution de code, à la recherche web et à tous les outils disponibles, mais même ainsi, la barre des 43,3 % reste invaincue.

Le problème central est le changement de domaine. Un modèle peut résoudre avec assurance une sous-tâche de mathématiques et une sous-tâche de code prises séparément, mais trébuche lorsqu'il faut transmettre le résultat d'une sous-tâche à la suivante au sein d'une même chaîne de raisonnement. C'est précisément ce « relais » (relay) qui donne son nom au benchmark.

«

Un benchmark non saturé, holistique et purement textuel, mesurant la capacité d'un LLM à accomplir un ensemble de tâches de domaines différents au sein d'un même prompt » — extrait de la description de Relay-Bench sur arXiv.

En quoi cela diffère des tests habituels

Relay-Bench n'évalue pas des compétences isolées, mais leur combinaison au sein d'une même tâche. Les benchmarks classiques mesurent le code, les mathématiques ou les connaissances générales séparément — ici, sept domaines sont entrelacés en une seule chaîne, et un échec sur n'importe quel maillon fait échouer toute la tâche. Ce format se rapproche davantage des scénarios de travail réels, où un agent doit à la fois chercher des données sur le web, faire des calculs et écrire du code dans le cadre d'une seule mission.

Ce que cela signifie

Relay-Bench met en évidence l'écart entre les compétences ponctuelles des modèles et le raisonnement de bout en bout : les LLM savent traiter chaque domaine pris isolément, mais pas encore les relier en une longue chaîne multidomaine. La marge de progression est immense : il reste un long chemin entre 43,3 % et le plafond, et ce sont précisément des tests « non saturés » de ce type qui fixeront la barre pour les prochaines générations de modèles et de systèmes agentiques.

Questions fréquentes

Qu'est-ce que Relay-Bench ?

Relay-Bench est un benchmark purement textuel, présenté sur arXiv en juillet 2026. Il évalue la manière dont les modèles de langage résolvent des tâches composites relevant de sept domaines (code, mathématiques, recherche web, analyse de données, entre autres), réunies en une seule chaîne au sein d'un même prompt.

Quel modèle a obtenu le meilleur résultat ?

Le meilleur résultat est celui de GPT-5.5 en mode xHigh : 43,3 %. Cela signifie que même le modèle le plus performant testé n'a résolu que moins de la moitié des tâches, et que le benchmark reste « non saturé » et loin de son plafond.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…