Почему чистые Transformer не способны выучить структурную генерализацию: доказательство
Чистые Transformer математически не способны автономно выучить структурную генерализацию — доказано через теорию сложности. Задача относится к классу NC¹, а обучаемый потолок трансформеров — TC⁰; при стандартном предположении TC⁰ ≠ NC¹ разрыв непреодолим. Высокие баллы нейросимволических систем на бенчмарках объясняются тем, что им семантику встраивают вручную: «выученное» неотличимо от «данного».
Traité par IA depuis arXiv cs.CL ; édité par Hamidun News
Des chercheurs ont publié en juillet 2026 un article sur arXiv qui démontre mathématiquement : un Transformer pur est incapable d'apprendre de manière autonome la généralisation structurelle à partir de données finies. La raison est un écart entre la complexité computationnelle de la tâche elle-même (classe NC¹) et le plafond d'apprentissabilité démontré des transformers (classe TC⁰).
Ce qui a exactement été démontré
Les auteurs ont donné, pour la première fois, une définition formelle de la généralisation structurelle — la capacité d'un modèle à assembler du sens à partir de parties familières dans des combinaisons inconnues. Avant ce travail, la notion était mesurée par une dizaine de benchmarks, mais n'avait jamais été définie rigoureusement. La définition traduit deux prémisses intuitives — structure compositionnelle et généralisation illimitée — dans le langage des mathématiques.
L'idée clé est de montrer que la tâche exige la puissance computationnelle de la classe NC¹, alors qu'un Transformer pur, d'après la preuve de Krause et al. (2026), est limité à la classe TC⁰. Sous l'hypothèse standard en théorie de la complexité selon laquelle TC⁰≠NC¹, la conclusion est rigoureuse : la capacité requise se situe au-dessus du plafond de l'architecture.
- NC¹ — la borne inférieure computationnelle de la tâche de généralisation structurelle
- TC⁰ — le plafond d'apprentissabilité démontré des transformers purs (Krause et al., 2026)
- L'évaluation d'arbres (BFVP) est NC¹-complète — démontré par Buss dès 1987
- Sous l'hypothèse standard TC⁰≠NC¹, l'écart est infranchissable
- Les systèmes neuro-symboliques contournent la partie difficile en intégrant la sémantique (G_γ) à la main
Où exactement le Transformer bute
Chaque règle compositionnelle se décompose en deux projections : une syntaxique (F_γ) et une sémantique (G_γ) — c'est ainsi qu'est structuré le modèle montagovien du sens (d'après Richard Montague), sur lequel s'appuient les auteurs. Cette séparation permet d'indiquer précisément quelle moitié de la tâche est réellement difficile.
L'évaluation de l'arbre sémantique (le côté G_γ) est un cas particulier du problème BFVP, qui, selon Buss (1987), est NC¹-complet. Un Transformer pur est contraint d'apprendre les deux côtés à la fois, mais sa classe d'apprentissabilité ne dépasse pas TC⁰. L'écart entre TC⁰ et NC¹ est précisément le mur contre lequel se brise l'apprentissage autonome — quelle que soit la quantité de données vues par le modèle.
Pourquoi les benchmarks sont trompeurs
Les systèmes neuro-symboliques obtiennent de meilleurs scores sur les benchmarks de généralisation structurelle précisément parce que leur projection sémantique (G_γ) est intégrée à la main plutôt qu'apprise. Ils contournent la moitié réellement difficile de la tâche et obtiennent un score élevé en évitant le noyau NC¹-complet.
D'où la conclusion principale du travail : un score sur un benchmark ne permet pas de distinguer ce qui a été appris de ce qui était donné d'avance. Le test « le modèle sait-il généraliser » cesse d'être valide si une partie du mécanisme lui a simplement été inscrite à la main.
«
Les scores aux benchmarks ne permettent pas de distinguer "l'appris" du "donné" » — extrait du résumé de l'article sur arXiv.
Ce que cela signifie
Le travail trace une frontière stricte : sans composants symboliques ni architectures plus puissantes que TC⁰, les transformers purs n'apprendront pas une véritable généralisation compositionnelle, quelle que soit la quantité de données fournie. Pour les praticiens, c'est un argument en faveur des approches hybrides, neuro-symboliques ; pour les chercheurs, une raison de lire avec plus de prudence les scores élevés aux benchmarks.
Questions fréquentes
Qu'est-ce que la généralisation structurelle ?
C'est la capacité d'un modèle à traiter correctement de nouvelles combinaisons d'éléments familiers — par exemple, comprendre une phrase composée de mots connus dans une structure absente de l'entraînement. Les auteurs du travail ont été les premiers à lui donner une définition mathématique formelle.
Cela signifie-t-il que les transformers sont inutiles ?
Non. La démonstration concerne un transformer « pur » et une capacité précise — apprendre de manière autonome la généralisation structurelle à partir de données finies. En pratique, les modèles sont complétés par des composants symboliques qui couvrent la partie difficile de la tâche.
Pourquoi les systèmes neuro-symboliques surpassent-ils les
transformers sur ces benchmarks ?
Parce que leur projection sémantique (G_γ) est spécifiée à la main plutôt qu'apprise. Ils sautent la partie NC¹-complète de la tâche, donc un score élevé ne prouve pas que la capacité a réellement été apprise.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.