arXiv cs.CL→ оригинал

Relay-Bench: даже GPT-5.5 набрала лишь 43,3% на мультидоменном тесте рассуждений

Исследователи представили Relay-Bench — текстовый бенчмарк, где модели решают связанные задачи сразу из нескольких доменов: код, математика, анализ данных, веб-поиск, визуальное рассуждение. Лучший результат показала GPT-5.5 в режиме xHigh — всего 43,3%. Задания склеены из 2–13 подзадач с намеренным раздуванием контекста.

AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Relay-Bench: даже GPT-5.5 набрала лишь 43,3% на мультидоменном тесте рассуждений
Источник: arXiv cs.CL. Коллаж: Hamidun News.
◐ Слушать статью

Исследователи опубликовали в июле 2026 года на arXiv бенчмарк Relay-Bench, который проверяет способность языковых моделей решать связанные задачи из разных предметных областей в одном запросе. Лучшая из протестированных моделей, GPT-5.5 в режиме xHigh, набрала всего 43,3% — то есть даже сильнейшая система не справилась и с половиной заданий.

Что измеряет Relay-Bench

Relay-Bench оценивает, удерживает ли модель несколько доменов рассуждений внутри одного промпта. Тестовый набор целиком состоит из составных задач: несколько однодоменных подзадач склеиваются в одну цепочку, которую нельзя решить, рассуждая лишь в одной области. Каждое задание содержит от 2 до 13 подзадач и остаётся полностью текстовым — мультимодальный ввод или вывод не требуется, что упрощает воспроизведение теста на любой модели.

Авторы называют бенчмарк «ненасыщенным» (unsaturated): у нынешних моделей ещё огромный запас для роста, потолок далёк, и одним апдейтом его не закрыть. Это отличает Relay-Bench от многих старых тестов, где топовые модели давно упёрлись в 90–100% и перестали различаться между собой.

  • Лидер рейтинга — GPT-5.5 (xHigh) с результатом 43,3%
  • Каждая задача склеена из 2–13 связанных подзадач
  • Домены: визуальное рассуждение, код, математика, извлечение информации (веб-поиск), решение задач, общие знания, анализ данных
  • Формат только текстовый — без картинок на входе и выходе
  • Моделям разрешено выполнять код, искать в вебе и применять любые инструменты

Почему даже GPT-5.5 набрала лишь 43%

Задания намеренно усложнены, поэтому результаты низкие даже у сильнейших моделей. По данным описания на arXiv, к базовым цепочкам добавляют слои сложности через кодирование промпта (prompt encoding) и намеренное раздувание контекста (context bloat) — модель должна отфильтровать шум и не потерять нить между доменами. Ограничений вне model harness нет: авторы прямо поощряют использовать выполнение кода, веб-поиск и все доступные инструменты, но даже так планка в 43,3% остаётся непокорённой.

Ключевая проблема — переключение между областями. Модель может уверенно решить подзадачу по математике и подзадачу по коду по отдельности, но спотыкается, когда результат одной подзадачи нужно передать в следующую внутри единой цепочки рассуждений. Именно эта «эстафета» (relay) и дала название бенчмарку.

«Ненасыщенный, целостный, текстовый бенчмарк, измеряющий способность LLM выполнять набор задач из разных доменов в одном промпте», — из описания

Relay-Bench на arXiv.

Чем это отличается от обычных тестов

Relay-Bench проверяет не отдельные навыки, а их комбинацию в одной задаче. Классические бенчмарки меряют код, математику или общие знания по отдельности — здесь же семь доменов сплетены в единую цепочку, и провал на любом звене рушит всё задание. Такой формат ближе к реальным рабочим сценариям, где агенту приходится и искать данные в вебе, и считать, и писать код в рамках одного поручения.

Что это значит

Relay-Bench показывает разрыв между узкими навыками моделей и сквозным рассуждением: собрать по кусочку каждую область LLM умеют, а связать их в длинную многодоменную цепочку — пока нет. Пространство для роста огромное: от 43,3% до потолка ещё далеко, и именно такие «ненасыщенные» тесты будут задавать планку для следующих поколений моделей и агентных систем.

Частые вопросы

Что такое Relay-Bench?

Relay-Bench — текстовый бенчмарк, представленный на arXiv в июле 2026 года. Он проверяет, как языковые модели решают составные задачи из семи доменов (код, математика, веб-поиск, анализ данных и др.), собранные в одну цепочку внутри одного промпта.

Какая модель показала лучший результат?

Лучший результат — у GPT-5.5 в режиме xHigh: 43,3%. Это значит, что даже сильнейшая протестированная модель решила меньше половины заданий, а бенчмарк остаётся «ненасыщенным» и далёким от потолка.

ЖХ
Hamidun News
AI‑новости без шума. Ежедневный редакторский отбор из 50+ источников. Продукт Жемала Хамидуна, Head of AI в Alpina Digital.

Хотите не читать про ИИ, а внедрить его?

«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.

Что вы думаете?
Загружаем комментарии…