FormulaSPIN: нейросеть пишет формулы для таблиц по описанию и обгоняет проприетарные модели
FormulaSPIN — новый фреймворк self-play обучения, который учит модель писать формулы для электронных таблиц прямо по описанию на естественном языке. Главный приём: система проверяет формулы на исполнимость и сама отделяет смысловые ошибки от валидных вариантов записи, обучаясь без дополнительной разметки. На бенчмарке NL2FORMULA — 74,9% точных совпадений и 87,1% корректных по исполнению, выше и обычного SFT, и топовых проприетарных моделей.
Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
En juillet 2026, des chercheurs ont publié sur arXiv le framework FormulaSPIN, un système d'entraînement basé sur le principe du self-play qui génère des formules pour tableurs à partir de descriptions en langage naturel et atteint 74,9 % de correspondances exactes et 87,1 % de précision d'exécution sur le benchmark NL2FORMULA, devançant à la fois l'approche supervisée classique et les meilleurs modèles propriétaires.
Comment le modèle apprend seul, de lui-même
FormulaSPIN s'entraîne sans une seule nouvelle ligne de données annotées — le modèle joue contre lui-même. Selon le résumé publié sur arXiv, l'entraînement est conçu comme un jeu à deux joueurs : le joueur principal apprend à préférer les formules de référence (ground-truth) à celles produites par sa version précédente. Le retour issu de l'exécution des formules classe les réponses par « granularité », construisant un programme d'apprentissage adaptatif : le modèle maîtrise d'abord la justesse sémantique, puis le raffinement stylistique de l'écriture.
L'atout majeur de la tâche est l'exécutabilité binaire : une formule s'exécute et produit un résultat, ou elle ne s'exécute pas. Cela fournit un contrôle implicite qui distingue les erreurs de sens des variantes simplement rédigées différemment, mais tout aussi valides.
Pourquoi le SPIN classique échoue ici
Le SPIN classique ne fonctionne pas pour la génération de formules, car il pénalise de la même façon toute réponse qui ne correspond pas littéralement à la référence. Selon les auteurs, une même formule, équivalente à l'exécution, est sanctionnée comme « incorrecte » dans un exemple et sert de référence dans un autre — ce qui fait que les gradients d'entraînement se contredisent, et le modèle ne converge pas.
FormulaSPIN lève cette contradiction grâce à la vérification par exécution. Si deux expressions d'apparence différente produisent le même résultat, le système les compte comme valides plutôt que comme une erreur. Les auteurs ont en outre introduit ExecVote, un mécanisme de vote au niveau sémantique qui gère nativement les cas où une même tâche admet plusieurs formulations correctes.
Ce que les mesures ont montré
FormulaSPIN a établi un nouveau meilleur résultat sur plusieurs benchmarks. Sur NL2FORMULA : 74,9 % de correspondances exactes et 87,1 % de réussite à l'exécution, un niveau comparable à celui de modèles entraînés avec des annotations de préférence supplémentaires, et supérieur à la fois au SFT traditionnel et aux modèles propriétaires les plus avancés.
- 74,9 % d'exact match sur le benchmark NL2FORMULA
- 87,1 % de précision d'exécution (execution accuracy)
- Entraînement sans un seul exemple annoté supplémentaire
- ExecVote — vote au niveau sémantique pour plusieurs formules valides
- Surpasse à la fois le SFT classique et les modèles propriétaires de pointe
«
Ces résultats soulignent le potentiel du self-play pour les tâches où les données sont rares et ouvrent la voie à son extension au-delà des domaines exécutables », indique le résumé de l'article FormulaSPIN sur arXiv.
Ce que cela signifie
Écrire des formules reste un obstacle pour des centaines de millions d'utilisateurs de tableurs, et les données annotées pour entraîner ce type de modèles sont rares. FormulaSPIN montre qu'un modèle peut s'améliorer lui-même en utilisant l'exécution comme source de vérification gratuite, sans annotation manuelle coûteuse. L'approche s'applique à toute tâche dont le résultat peut être exécuté et vérifié : code, requêtes SQL, calculs.
Questions fréquentes
Qu'est-ce que FormulaSPIN ?
FormulaSPIN est un framework d'entraînement self-play pour générer des formules de tableurs à partir de texte en langage naturel. Le modèle s'améliore lui-même de façon itérative, sans données annotées supplémentaires, en utilisant la vérification de l'exécutabilité des formules comme source de retour.
En quoi
FormulaSPIN diffère-t-il d'un fine-tuning classique ?
Le supervised fine-tuning (SFT) classique atteint rapidement un plafond fixé par des données annotées limitées. FormulaSPIN s'entraîne selon le principe d'un jeu à deux joueurs et sépare les erreurs de sens des variantes d'écriture valides grâce à l'exécution, ce qui lui permet de surpasser le SFT sans nécessiter de nouvelles données.
Quels résultats FormulaSPIN a-t-il obtenus ?
Sur le benchmark NL2FORMULA, le framework a atteint 74,9 % de correspondances exactes et 87,1 % de précision d'exécution — un niveau comparable à celui de modèles entraînés avec des annotations de préférence supplémentaires, et supérieur à celui des meilleurs modèles propriétaires.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.