Les réseaux neuronaux sont de mauvaises calculatrices : pourquoi les LLM se trompent en arithmétique et comment y remédier
Un LLM peut se tromper avec assurance sur les chiffres du milieu d'une multiplication à six chiffres : les bords sont justes, le milieu est inventé. Ce n'est pas un bug : un transformer prédit des tokens à partir des statistiques des données d'entraînement, au lieu d'exécuter un algorithme. L'arithmétique courte est, en pratique, mémorisée dans les données — elles contiennent des millions d'exemples. Les nombres longs sont devinés. La solution de l'industrie n'est pas d'apprendre au modèle à calculer, mais de lui donner des outils — Python, code interpreter, calculatrice.
Traité par IA depuis Habr AI ; édité par Hamidun News
Un réseau de neurones échoue même en mathématiques simples, produisant avec confiance un résultat incorrect pour la multiplication de nombres à six chiffres—chiffres corrects aux bords, erreur au milieu. Ce n'est pas un bogue ou une défaillance d'un modèle particulier : un transformateur prédit les tokens en fonction des statistiques, n'exécutant pas un algorithme de multiplication comme le ferait une calculatrice.
Token versus algorithme : quelle est la différence
La multiplication en colonne est une procédure avec des chiffres, des retenues, des sommes intermédiaires et un ordre strict des opérations. Un processeur l'exécute. Un écolier l'exécute. Un transformateur en un seul passage—non : il génère du texte ressemblant à la bonne réponse, basé sur les statistiques des données d'entraînement.
L'arithmétique courte fonctionne exactement comme la mémoire, pas le calcul :
- Les tables de multiplication apparaissent dans les données d'entraînement des millions de fois
- "7 × 8 = 56" le modèle ne le calcule pas—il le mémorise
- Avec des nombres à deux ou trois chiffres, les motifs familiers sont encore suffisants
- Avec des nombres à six chiffres—il n'y a presque pas d'exemples familiers ; le modèle commence à "continuer de façon plausible"
- La confiance au moment de donner une réponse n'est pas liée à la précision du résultat
Pourquoi l'erreur se retrouve-t-elle au milieu du nombre?
Les chiffres extérieurs du résultat peuvent être déduits des premier et dernier chiffres des facteurs—c'est un motif que le modèle apprend. Les chiffres du milieu nécessitent une chaîne honnête de retenues, qu'un transformateur ne construit pas en un seul passage autoregressif.
Caligraphy caractéristique : le bord droit (unités, dizaines) et le bord gauche (chiffres d'ordre supérieur) sont souvent corrects, les chiffres du milieu—inventés. Pendant ce temps, le modèle n'a aucun signal interne "je ne suis pas sûr"—le prédicteur de tokens continue simplement la séquence de la manière la plus plausible possible.
Comment l'industrie résout-elle ce problème?
La solution n'est pas venue de l'intérieur de l'architecture, mais de l'extérieur : les outils. Code Interpreter dans ChatGPT, blocs Python dans Claude, appels de calculatrices via function calling—le modèle délègue le calcul à quelqu'un qui sait calculer.
"Le fait, et plutôt bien, simplement pas où ça paraît."
Le progrès ne consiste pas à enseigner au LLM à calculer indépendamment, mais à lui enseigner à appeler le bon outil.
Chain-of-thought (enregistrement explicite des étapes intermédiaires) aide partiellement : la précision sur les nombres multi-chiffres augmente. Mais chaque token dans la chaîne est lui-même une prédiction, donc cette technique ne fournit pas une fiabilité de 100%.
En parallèle, la recherche continue sur l'ajustement fin spécialisé pour les mathématiques—les modèles entraînés principalement sur des textes scientifiques comprennent mieux les tâches. Mais même ils ne remplacent pas une calculatrice : la valeur de tels modèles réside dans la formulation correcte de la tâche pour un outil, pas dans l'auto-calcul.
Ce que cela signifie
S'attendre à ce que LLM se comporte comme une calculatrice est une mauvaise compréhension architecturale. Le bon motif : le modèle comprend la tâche, construit la logique, délègue les chiffres à un outil, interprète la sortie. Faire confiance à l'économie unitaire directement dans un chat sans outils—cela revient à vérifier non pas le modèle, mais la chance.
Questions fréquemment posées
Pourquoi le modèle ne prévient-il pas qu'il ne peut pas calculer?
Un modèle de langage n'a pas de signal interne d'incertitude lors de la génération d'un nombre. Il génère le prochain token avec la probabilité maximale—et avec la même confiance produit les résultats corrects et incorrects. C'est une propriété fondamentale de la génération autoregressiva, pas une erreur de code.
Le chain-of-thought aide-t-il avec l'arithmétique complexe?
Oui, mais de manière limitée. L'enregistrement étape par étape des retenues augmente la précision parce que le modèle "voit" les résultats intermédiaires comme du contexte pour la prochaine prédiction. Cependant, chaque étape reste une prédiction, et les erreurs s'accumulent—pour les calculs critiques, un outil externe est nécessaire.
Pourquoi un réseau de neurones échoue-t-il aux mathématiques?
Un transformateur prédit les tokens en fonction des statistiques des données d'entraînement, n'exécutant pas un algorithme mathématique comme le ferait un processeur ou un humain.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.