Relay-Bench: даже GPT-5.5 набрала лишь 43,3% на мультидоменном тесте рассуждений
Исследователи представили Relay-Bench — текстовый бенчмарк, где модели решают связанные задачи сразу из нескольких доменов: код, математика, анализ данных, веб-поиск, визуальное рассуждение. Лучший результат показала GPT-5.5 в режиме xHigh — всего 43,3%. Задания склеены из 2–13 подзадач с намеренным раздуванием контекста.
AI-обработка оригинала arXiv cs.CL; редакция Hamidun News
Исследователи опубликовали в июле 2026 года на arXiv бенчмарк Relay-Bench, который проверяет способность языковых моделей решать связанные задачи из разных предметных областей в одном запросе. Лучшая из протестированных моделей, GPT-5.5 в режиме xHigh, набрала всего 43,3% — то есть даже сильнейшая система не справилась и с половиной заданий.
Что измеряет Relay-Bench
Relay-Bench оценивает, удерживает ли модель несколько доменов рассуждений внутри одного промпта. Тестовый набор целиком состоит из составных задач: несколько однодоменных подзадач склеиваются в одну цепочку, которую нельзя решить, рассуждая лишь в одной области. Каждое задание содержит от 2 до 13 подзадач и остаётся полностью текстовым — мультимодальный ввод или вывод не требуется, что упрощает воспроизведение теста на любой модели.
Авторы называют бенчмарк «ненасыщенным» (unsaturated): у нынешних моделей ещё огромный запас для роста, потолок далёк, и одним апдейтом его не закрыть. Это отличает Relay-Bench от многих старых тестов, где топовые модели давно упёрлись в 90–100% и перестали различаться между собой.
- Лидер рейтинга — GPT-5.5 (xHigh) с результатом 43,3%
- Каждая задача склеена из 2–13 связанных подзадач
- Домены: визуальное рассуждение, код, математика, извлечение информации (веб-поиск), решение задач, общие знания, анализ данных
- Формат только текстовый — без картинок на входе и выходе
- Моделям разрешено выполнять код, искать в вебе и применять любые инструменты
Почему даже GPT-5.5 набрала лишь 43%
Задания намеренно усложнены, поэтому результаты низкие даже у сильнейших моделей. По данным описания на arXiv, к базовым цепочкам добавляют слои сложности через кодирование промпта (prompt encoding) и намеренное раздувание контекста (context bloat) — модель должна отфильтровать шум и не потерять нить между доменами. Ограничений вне model harness нет: авторы прямо поощряют использовать выполнение кода, веб-поиск и все доступные инструменты, но даже так планка в 43,3% остаётся непокорённой.
Ключевая проблема — переключение между областями. Модель может уверенно решить подзадачу по математике и подзадачу по коду по отдельности, но спотыкается, когда результат одной подзадачи нужно передать в следующую внутри единой цепочки рассуждений. Именно эта «эстафета» (relay) и дала название бенчмарку.
«Ненасыщенный, целостный, текстовый бенчмарк, измеряющий способность LLM выполнять набор задач из разных доменов в одном промпте», — из описания
Relay-Bench на arXiv.
Чем это отличается от обычных тестов
Relay-Bench проверяет не отдельные навыки, а их комбинацию в одной задаче. Классические бенчмарки меряют код, математику или общие знания по отдельности — здесь же семь доменов сплетены в единую цепочку, и провал на любом звене рушит всё задание. Такой формат ближе к реальным рабочим сценариям, где агенту приходится и искать данные в вебе, и считать, и писать код в рамках одного поручения.
Что это значит
Relay-Bench показывает разрыв между узкими навыками моделей и сквозным рассуждением: собрать по кусочку каждую область LLM умеют, а связать их в длинную многодоменную цепочку — пока нет. Пространство для роста огромное: от 43,3% до потолка ещё далеко, и именно такие «ненасыщенные» тесты будут задавать планку для следующих поколений моделей и агентных систем.
Частые вопросы
Что такое Relay-Bench?
Relay-Bench — текстовый бенчмарк, представленный на arXiv в июле 2026 года. Он проверяет, как языковые модели решают составные задачи из семи доменов (код, математика, веб-поиск, анализ данных и др.), собранные в одну цепочку внутри одного промпта.
Какая модель показала лучший результат?
Лучший результат — у GPT-5.5 в режиме xHigh: 43,3%. Это значит, что даже сильнейшая протестированная модель решила меньше половины заданий, а бенчмарк остаётся «ненасыщенным» и далёким от потолка.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.