Relay-Bench: даже GPT-5.5 набрала лишь 43,3% на мультидоменном тесте рассуждений
Исследователи представили Relay-Bench — текстовый бенчмарк, где модели решают связанные задачи сразу из нескольких доменов: код, математика, анализ данных, веб-поиск, визуальное рассуждение. Лучший результат показала GPT-5.5 в режиме xHigh — всего 43,3%. Задания склеены из 2–13 подзадач с намеренным раздуванием контекста.
Procesado por IA desde arXiv cs.CL; editado por Hamidun News
Los investigadores publicaron en julio de 2026 en arXiv el benchmark Relay-Bench, que evalúa la capacidad de los modelos de lenguaje para resolver tareas encadenadas de distintos dominios temáticos dentro de una sola consulta. El mejor modelo probado, GPT-5.5 en modo xHigh, obtuvo apenas un 43,3 %, es decir, ni siquiera el sistema más potente logró resolver la mitad de las tareas.
Qué mide Relay-Bench
Relay-Bench evalúa si un modelo es capaz de mantener varios dominios de razonamiento dentro de un mismo prompt. El conjunto de pruebas está compuesto íntegramente por tareas compuestas: varias subtareas de un solo dominio se encadenan en una secuencia que no puede resolverse razonando en un único ámbito. Cada tarea contiene entre 2 y 13 subtareas y es completamente textual: no se requiere entrada ni salida multimodal, lo que facilita reproducir la prueba en cualquier modelo.
Los autores denominan al benchmark "no saturado" (unsaturated): los modelos actuales todavía tienen un enorme margen de mejora, el techo está lejos y no se puede alcanzar con una sola actualización. Esto diferencia a Relay-Bench de muchas pruebas antiguas, en las que los modelos punteros llevan tiempo estancados en el 90-100 % y han dejado de diferenciarse entre sí.
- El líder del ranking es GPT-5.5 (xHigh) con un resultado del 43,3 %
- Cada tarea se compone de entre 2 y 13 subtareas relacionadas
- Dominios: razonamiento visual, código, matemáticas, extracción de información (búsqueda web), resolución de problemas, conocimientos generales, análisis de datos
- El formato es exclusivamente textual, sin imágenes de entrada ni de salida
- Los modelos pueden ejecutar código, buscar en la web y usar cualquier herramienta disponible
Por qué incluso GPT-5.5 obtuvo solo un 43 %
Las tareas están deliberadamente complicadas, por lo que los resultados son bajos incluso para los modelos más fuertes. Según la descripción publicada en arXiv, a las cadenas básicas se les añaden capas de complejidad mediante la codificación del prompt (prompt encoding) y el inflado deliberado del contexto (context bloat): el modelo debe filtrar el ruido sin perder el hilo entre dominios. No hay restricciones fuera del model harness: los autores fomentan explícitamente el uso de ejecución de código, búsqueda web y todas las herramientas disponibles, pero aun así el listón del 43,3 % sigue sin superarse.
El problema clave es el cambio entre dominios. Un modelo puede resolver con seguridad una subtarea de matemáticas y una subtarea de código por separado, pero tropieza cuando el resultado de una subtarea debe trasladarse a la siguiente dentro de una única cadena de razonamiento. Precisamente esta "posta" (relay) es la que da nombre al benchmark.
"Un benchmark no saturado, integral y de solo texto que mide la capacidad de un LLM para completar un conjunto de tareas de distintos dominios dentro de un mismo prompt", según la descripción de
Relay-Bench en arXiv.
En qué se diferencia de las pruebas habituales
Relay-Bench no evalúa habilidades aisladas, sino su combinación dentro de una misma tarea. Los benchmarks clásicos miden código, matemáticas o conocimientos generales por separado; aquí, en cambio, siete dominios se entrelazan en una única cadena, y un fallo en cualquier eslabón arruina toda la tarea. Este formato se acerca más a los escenarios de trabajo reales, en los que un agente debe buscar datos en la web, hacer cálculos y escribir código dentro de un mismo encargo.
Qué significa esto
Relay-Bench muestra la brecha entre las habilidades puntuales de los modelos y el razonamiento de extremo a extremo: los LLM saben resolver cada dominio por separado, pero enlazarlos en una cadena larga y multidominio, todavía no. El margen de mejora es enorme: del 43,3 % al techo todavía queda un largo trecho, y son precisamente pruebas "no saturadas" como esta las que marcarán el listón para las próximas generaciones de modelos y sistemas agénticos.
Preguntas frecuentes
¿Qué es Relay-Bench?
Relay-Bench es un benchmark de solo texto presentado en arXiv en julio de 2026. Evalúa cómo los modelos de lenguaje resuelven tareas compuestas de siete dominios (código, matemáticas, búsqueda web, análisis de datos, entre otros) combinadas en una sola cadena dentro de un mismo prompt.
¿Qué modelo obtuvo el mejor resultado?
El mejor resultado es el de GPT-5.5 en modo xHigh: 43,3 %. Esto significa que incluso el modelo más potente probado resolvió menos de la mitad de las tareas, y el benchmark sigue siendo "no saturado" y lejano de su techo.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.