arXiv cs.AI→ original

FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода

FindStatBench — новый бенчмарк из 2 329 задач по синтезу комбинаторного кода: модель пишет Python-функцию без подсказок и инструментов. Авторы прогнали 11 систем и нашли неожиданное — несколько классических задач модели решают идеально без примеров, но проваливают, получив пять примеров в промпте. Сильнейшие открытые и закрытые модели разошлись меньше чем на 1 п.п.

Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
FindStatBench: новый бенчмарк выявил, где топовые ИИ-модели проваливают синтез кода
Source : arXiv cs.AI. Collage: Hamidun News.
◐ Écouter l'article

En juillet 2026, des chercheurs ont présenté FindStatBench, un benchmark qui évalue les grands modèles de langage sur la synthèse de code combinatoire : 2329 tâches, 24 collections et 5,52 millions d'objets de test cachés. Sur cet ensemble, les modèles ouverts et fermés les plus performants ont affiché un écart de précision inférieur à un point de pourcentage.

Ce que teste FindStatBench

FindStatBench s'appuie sur le projet mathématique FindStat et exige du modèle qu'il écrive une seule fonction Python, solve, à partir d'une description mathématique du problème et d'au maximum cinq exemples publics « entrée-sortie ». Aucune recherche, aucun appel d'outil, aucun retour d'exécution, aucun vote ni reclassement — un seul essai. La réponse est exécutée dans un sandbox sur des objets combinatoires cachés et vérifiée par exécution exacte.

Les auteurs ont testé 11 systèmes : quatre modèles de production fermés et sept modèles à poids ouverts, servis via un seul fournisseur d'inférence.

  • 2329 tâches réparties en 24 collections, 5,52 millions d'objets de test cachés
  • Deux types : statistic synthesis (objet → nombre entier) et map synthesis (objet → objet)
  • En entrée : une description et au maximum 5 exemples « entrée-sortie »
  • Évaluation : exécution exacte de la fonction Python dans un sandbox
  • 11 systèmes testés : 4 fermés + 7 ouverts

Pourquoi les exemples dans le prompt nuisent

Sur une partie des tâches, les exemples dans le prompt réduisent la précision au lieu de l'améliorer. Selon l'étude, plusieurs bijections classiques sont résolues parfaitement par les modèles sans aucun exemple, mais ces mêmes modèles échouent sur ces mêmes tâches une fois qu'on leur fournit cinq exemples « entrée-sortie ». Une autre partie des échecs s'explique par la mécanique du budget de sortie : le raisonnement du modèle épuise la réponse visible avant même d'atteindre le code lui-même. Les prompts longs entraînent une chute brutale de la précision — un phénomène que les auteurs appellent l'accuracy cliff.

Où les modèles se heurtent à un plafond

La statistic synthesis est nettement plus facile pour les modèles que la map synthesis : associer un objet à un nombre entier est plus simple qu'associer un objet à un autre objet. Les systèmes ouverts et fermés les plus performants convergent à moins d'un point de pourcentage les uns des autres en instance accuracy, et combiner tous les systèmes en un « oracle », ainsi qu'un échantillonnage quintuple à partir d'un modèle de force moyenne, n'apportent qu'un gain limité. Certaines collections de tâches restent à zéro.

«

La statistic synthesis nous est bien plus facile que la map synthesis... et l'induction précise de règles symboliques reste fragile », indique le résumé de FindStatBench sur arXiv.

Ce que cela signifie

Même les meilleurs LLM restent aujourd'hui mauvais pour déduire des règles symboliques exactes à partir de descriptions mathématiques — et ni davantage d'exemples ni davantage de calcul ne permettent de franchir ce mur. FindStatBench offre à l'industrie un test strict et exécutable, ciblant précisément ce type de raisonnement plutôt que la restitution de solutions déjà connues.

Questions fréquentes

Qu'est-ce que FindStatBench ?

Il s'agit d'un benchmark exécutable fondé sur le projet FindStat : 2329 tâches de synthèse combinatoire de code où le modèle écrit une fonction Python, la réponse étant vérifiée par exécution exacte sur 5,52 millions d'objets cachés, sans indice, ni outil, ni nouvel essai autorisé.

Pourquoi davantage d'exemples n'aide-t-il pas toujours les modèles ?

Selon l'étude, plusieurs bijections classiques sont résolues parfaitement par les modèles sans le moindre exemple, mais échouent face à un prompt contenant cinq exemples : le contexte plus long entraîne une chute brutale de la précision, et le raisonnement épuise parfois le budget de réponse avant même de produire le code.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…