FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода
FindStatBench — новый бенчмарк из 2 329 задач по синтезу комбинаторного кода: модель пишет Python-функцию без подсказок и инструментов. Авторы прогнали 11 систем и нашли неожиданное — несколько классических задач модели решают идеально без примеров, но проваливают, получив пять примеров в промпте. Сильнейшие открытые и закрытые модели разошлись меньше чем на 1 п.п.
AI-обработка оригинала arXiv cs.AI; редакция Hamidun News
Исследователи в июле 2026 года представили FindStatBench — бенчмарк, который проверяет большие языковые модели на синтезе комбинаторного кода: 2 329 задач, 24 коллекции и 5,52 млн скрытых тестовых объектов. На этом наборе сильнейшие открытые и закрытые модели разошлись в точности меньше чем на один процентный пункт.
Что проверяет FindStatBench
FindStatBench построен на базе математического проекта FindStat и требует от модели написать одну Python-функцию solve по математическому описанию задачи и максимум пяти публичным примерам «вход-выход». Никакого поиска, вызова инструментов, обратной связи от исполнения, голосования или переранжирования — только один заход. Ответ запускается в песочнице на скрытых комбинаторных объектах и проверяется точным исполнением.
Авторы протестировали 11 систем: четыре закрытые продакшн-модели и семь моделей с открытыми весами, обслуживаемых через одного инференс-провайдера.
- 2 329 задач в 24 коллекциях, 5,52 млн скрытых тестовых объектов
- Два типа: statistic synthesis (объект → целое число) и map synthesis (объект → объект)
- На вход — описание и максимум 5 примеров «вход-выход»
- Оценка — точное исполнение Python-функции в песочнице
- Протестировано 11 систем: 4 закрытые + 7 открытых
Почему примеры в промпте вредят
Примеры в промпте у части задач снижают точность, а не повышают. По данным работы, несколько классических биекций модели решают идеально вообще без примеров, но проваливают те же задачи, получив пять примеров «вход-выход». Ещё часть провалов — это механика бюджета вывода: рассуждение модели исчерпывает видимый ответ раньше, чем доходит до самого кода. Длинные промпты дают резкий обвал точности — авторы называют это accuracy cliff.
Где модели упираются в потолок
Statistic synthesis даётся моделям заметно легче, чем map synthesis: сопоставить объект целому числу проще, чем объект — объекту. Сильнейшие открытые и закрытые системы сходятся в пределах одного процентного пункта по instance accuracy, а объединение всех систем в «оракул» и пятикратная выборка из средней по силе модели дают лишь ограниченный прирост. Некоторые коллекции задач при этом остаются у нуля.
«Statistic synthesis намного легче, чем map synthesis... а точное индуцирование символьных правил остаётся хрупким», — говорится в аннотации
FindStatBench на arXiv.
Что это значит
Даже топовые LLM пока плохо выводят точные символьные правила из математических описаний — и больше примеров или больше вычислений эту стену не пробивают. FindStatBench даёт индустрии жёсткий, исполняемый тест именно на этот тип рассуждения, а не на пересказ известных решений.
Частые вопросы
Что такое FindStatBench?
Это исполняемый бенчмарк на базе проекта FindStat: 2 329 задач по комбинаторному синтезу кода, где модель пишет Python-функцию, а ответ проверяется точным запуском на 5,52 млн скрытых объектов без права на подсказки, инструменты и повторные попытки.
Почему больше примеров не всегда помогает моделям?
По данным работы, несколько классических биекций модели решают идеально без единого примера, но ломаются под промптом с пятью примерами: длинный контекст ведёт к резкому падению точности, а рассуждение иногда исчерпывает бюджет ответа ещё до вывода кода.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.