Могут ли трансформеры выбирать модель? Байесовский тест arXiv на 2,8M параметров
Трансформер на 2,8 млн параметров научился байесовскому выбору модели — определять, из какого класса гипотез пришли данные — с точностью до 0,01 бита от оптимума. Но как только для различения классов нужна арифметика (сложение или умножение по модулю), модель справляется только с числовыми токенами и полностью проваливается на абстрактных символах. Граница держится даже при росте сети до 316 млн параметров.
Traité par IA depuis arXiv cs.LG ; édité par Hamidun News
Un transformer de 2,8 millions de paramètres a appris la sélection bayésienne de modèles — déterminer de quelle classe d'hypothèses les données ont été générées — avec un écart de seulement 0,01 bit par rapport à l'optimum théorique. C'est ce que montre l'article « Bayesian Wind Tunnels for Model Selection », publié sur arXiv en juillet 2026.
Que sont les « souffleries bayésiennes »
Les « souffleries bayésiennes » sont des environnements contrôlés où la distribution postérieure exacte sur les classes d'hypothèses est connue sous forme close, de sorte que la réponse du modèle est comparée directement à l'optimum bayésien. Il avait déjà été montré que les transformers effectuent un filtrage bayésien exact au sein d'une seule classe d'hypothèses fixe. La nouvelle question posée par les auteurs est de savoir si le modèle peut choisir lui-même la classe, c'est-à-dire reconnaître quelle structure a généré les données.
Les tâches sont construites sur des involutions sans points fixes — des fonctions ayant la propriété f(f(x))=x, purement relationnelle. Le transformer atteint l'accord avec l'optimum même lorsque les symboles sont opaques et que leurs valeurs changent à chaque épisode. Travailler avec des symboles opaques est important : cela élimine les indices auxquels le modèle pourrait « s'accrocher » et ne laisse que la structure de la tâche.
- Modèle — un transformer de 2,8 millions de paramètres, testé sur 3 seeds
- Accord d'entropie avec l'optimum bayésien — 0,01 bit
- Comparaison non-nested (involutions contre cycles de 3) — erreur MAE du postérieur inférieure à 0,001
- La limite sur les tâches arithmétiques se maintient lors d'un changement d'échelle de 112 fois (2,8M → 316M paramètres)
- Écart de calibration par rapport aux LLM actuels — environ 55×
Où la sélection de modèle échoue
La sélection de modèle échoue complètement lorsque les classes ne se distinguent que par l'arithmétique — addition ou multiplication modulo n : dans ce cas, le transformer gère bien les tokens entiers, mais échoue sur les symboles opaques. Selon l'annotation de l'article, cette limite se maintient lorsque le modèle est mis à l'échelle 112 fois — de 2,8 à 316 millions de paramètres —, ce qui n'est donc pas une question de taille du réseau.
Le diagnostic des sous-tâches a localisé la défaillance : elle survient dans la composition de l'inversion d'en-tête avec l'arithmétique, et non dans l'analyse de l'en-tête elle-même.
Tout est question de sémantique stable
La cause de l'échec ne réside pas dans les nombres en tant que tels, mais dans la stabilité des valeurs. Une expérience de contrôle sur la stationnarité a montré que des tokens opaques avec un réétiquetage fixe produisent une erreur de seulement 0,009 bit, c'est-à-dire qu'ils fonctionnent aussi bien que des nombres entiers.
«
Une sémantique stable, et non une identité entière, est ce qui permet de compiler un schéma de calcul », indique l'annotation de l'article sur arXiv.
Le test des LLM de pointe actuels sur les mêmes tâches a révélé un comportement qualitativement bayésien, mais avec un écart de calibration bien plus important — environ 55× ; les auteurs soulignent que cette estimation a été obtenue via des sondes « avec perte » et indique donc une direction plutôt qu'une valeur précise.
Ce que cela signifie
Le travail trace une limite concrète des capacités des transformers : ils savent choisir un modèle, mais seulement lorsque le trait distinctif dispose d'un accès stable à la sémantique. C'est un repère pour l'interprétabilité mécanistique — il montre quels schémas de calcul le réseau est capable de « compiler », et lesquels restent hors de sa portée, indépendamment du nombre de paramètres.
Questions fréquentes
Qu'est-ce que la sélection bayésienne de modèles ?
C'est la capacité à déterminer de quelle classe d'hypothèses proviennent les données, plutôt que de simplement estimer des paramètres au sein d'une seule classe. Dans l'article, le transformer compare par exemple des involutions à des cycles de 3 et produit un postérieur avec une erreur inférieure à 0,001.
Pourquoi le modèle échoue-t-il sur l'arithmétique ?
Lorsque le trait permettant de distinguer les classes nécessite une addition ou une multiplication modulo n, le transformer ne gère bien que les tokens entiers et échoue complètement sur les symboles abstraits. Le contrôle a montré que ce qui compte, c'est la stabilité de la sémantique des tokens, et non leur nature numérique.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.