arXiv cs.AI→ original

FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода

FindStatBench — новый бенчмарк из 2 329 задач по синтезу комбинаторного кода: модель пишет Python-функцию без подсказок и инструментов. Авторы прогнали 11 систем и нашли неожиданное — несколько классических задач модели решают идеально без примеров, но проваливают, получив пять примеров в промпте. Сильнейшие открытые и закрытые модели разошлись меньше чем на 1 п.п.

Procesado por IA desde arXiv cs.AI; editado por Hamidun News
FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода
Fuente: arXiv cs.AI. Collage: Hamidun News.
◐ Escuchar artículo

En julio de 2026, un grupo de investigadores presentó FindStatBench, un benchmark que evalúa a los grandes modelos de lenguaje en la síntesis de código combinatorio: 2329 tareas, 24 colecciones y 5,52 millones de objetos de prueba ocultos. En este conjunto, los modelos abiertos y cerrados más potentes difirieron en precisión por menos de un punto porcentual.

Qué evalúa FindStatBench

FindStatBench se basa en el proyecto matemático FindStat y exige que el modelo escriba una única función de Python, solve, a partir de una descripción matemática del problema y como máximo cinco ejemplos públicos de "entrada-salida". No hay búsqueda, ni llamadas a herramientas, ni retroalimentación de ejecución, ni votación ni reordenamiento: solo un intento. La respuesta se ejecuta en un sandbox sobre objetos combinatorios ocultos y se verifica mediante ejecución exacta.

Los autores probaron 11 sistemas: cuatro modelos de producción cerrados y siete modelos de pesos abiertos, servidos a través de un único proveedor de inferencia.

  • 2329 tareas en 24 colecciones, 5,52 millones de objetos de prueba ocultos
  • Dos tipos: statistic synthesis (objeto → número entero) y map synthesis (objeto → objeto)
  • La entrada es una descripción y como máximo 5 ejemplos de "entrada-salida"
  • La evaluación es la ejecución exacta de la función de Python en un sandbox
  • 11 sistemas probados: 4 cerrados + 7 abiertos

Por qué los ejemplos en el prompt perjudican

En parte de las tareas, los ejemplos en el prompt reducen la precisión en lugar de aumentarla. Según el trabajo, varias biyecciones clásicas son resueltas a la perfección por los modelos sin ningún ejemplo, pero esos mismos modelos fallan en las mismas tareas al recibir cinco ejemplos de "entrada-salida". Otra parte de los fallos se debe a la mecánica del presupuesto de salida: el razonamiento del modelo agota la respuesta visible antes de llegar siquiera al código. Los prompts largos provocan una caída brusca de la precisión, algo que los autores denominan accuracy cliff.

Dónde los modelos chocan con un techo

La statistic synthesis resulta notablemente más fácil para los modelos que la map synthesis: es más simple asociar un objeto a un número entero que un objeto a otro objeto. Los sistemas abiertos y cerrados más potentes convergen dentro de un margen de un punto porcentual en instance accuracy, y combinar todos los sistemas en un "oráculo", junto con un muestreo quíntuple de un modelo de fuerza media, solo aporta una mejora limitada. Algunas colecciones de tareas se mantienen en cero.

"La statistic synthesis nos resulta mucho más fácil que la map synthesis... y la inducción precisa de reglas simbólicas sigue siendo frágil", señala el resumen de

FindStatBench en arXiv.

Qué significa esto

Incluso los LLM más avanzados todavía son deficientes a la hora de derivar reglas simbólicas exactas a partir de descripciones matemáticas, y ni más ejemplos ni más cómputo logran romper ese muro. FindStatBench ofrece a la industria una prueba estricta y ejecutable centrada precisamente en este tipo de razonamiento, y no en repetir soluciones ya conocidas.

Preguntas frecuentes

¿Qué es FindStatBench?

Es un benchmark ejecutable basado en el proyecto FindStat: 2329 tareas de síntesis combinatoria de código en las que el modelo escribe una función de Python y la respuesta se verifica mediante ejecución exacta sobre 5,52 millones de objetos ocultos, sin permitir pistas, herramientas ni reintentos.

¿Por qué más ejemplos no siempre ayuda a los modelos?

Según el trabajo, varias biyecciones clásicas son resueltas a la perfección por los modelos sin un solo ejemplo, pero fallan bajo un prompt con cinco ejemplos: el contexto más largo provoca una caída brusca de la precisión, y el razonamiento a veces agota el presupuesto de la respuesta antes incluso de generar el código.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…