AIRI→ original

AIRI раскрыла слабость token cramming: 1568 токенов в векторе, но понимание теряется

Исследователи лаборатории FusionBrain AIRI на ICML 2026 доказали: token cramming — красивый, но обманчивый трюк. LLM умеет «упаковать» 1568 токенов в один вектор и восстановить текст слово в слово, но теряет способность понимать и анализировать его. Причина — в первых слоях трансформера: оптимизатор учится обходить семантику, а не сохранять её.

Traité par IA depuis AIRI ; édité par Hamidun News
AIRI раскрыла слабость token cramming: 1568 токенов в векторе, но понимание теряется
Source : AIRI. Collage: Hamidun News.
◐ Écouter l'article

Les chercheurs du laboratoire FusionBrain AIRI ont présenté à l'ICML 2026 le travail « Progressive Cramming: Reliable Token Compression and What It Reveals » et ont démontré que la reconstruction textuelle parfaite mot à mot à partir d'un embedding compressé ne signifie pas que le modèle de langage conserve la capacité de raisonner à partir de celui-ci.

L'origine du token cramming

En février 2025, le chercheur d'AIRI Yuri Kuratov et son équipe ont publié le travail « Cramming 1568 Tokens into a Single Vector and Back Again » et ont montré quelque chose de presque impossible : jusqu'à 1568 tokens — plusieurs paragraphes de texte — peuvent être « compressés » dans un seul embedding d'entrée d'une LLM gelée, puis récupérés mot pour mot. Un vecteur de plusieurs milliers de nombres remplaçait des milliers de tokens, ouvrant des perspectives fantastiques pour la compression de contexte.

Paramètres clés de la méthode originale :

  • 1568 tokens tiennent dans un seul vecteur d'entrée
  • Le modèle reconstruit le texte avec zéro perte de tokens
  • La LLM gelée n'est pas affinée — seul l'embedding d'entrée change
  • La méthode a été appelée token cramming

Pourquoi la reconstruction n'est pas la compréhension

L'équipe FusionBrain AIRI, en reproduisant le résultat, a découvert un problème caché. Le protocole standard de token cramming ne vérifie que la précision de la reconstruction du texte, et non la façon dont le modèle comprend et utilise le contenu.

Les auteurs de la nouvelle étude ont proposé un protocole alternatif — le progressive cramming : la compression commence avec un petit nombre de tokens et augmente progressivement, chaque étape vérifiant non seulement la précision de la reconstruction, mais aussi la capacité du modèle à accomplir des tâches de compréhension — des paires questions-réponses, des chaînes logiques.

« Le protocole standard de token cramming dissimule des échecs catastrophiques.

Reconstruire un texte est une chose, le comprendre en est une tout autre », — Dmitry Tarasov, chercheur à FusionBrain AIRI, dans la publication du laboratoire sur Habr.

Les résultats se sont révélés décourageants : à un degré de compression élevé, le modèle parvient à reproduire le texte mot pour mot, mais perd complètement la capacité de raisonner sur son contenu. La précision sur les tâches de compréhension tombe au niveau du hasard.

Où se cache la cause de l'échec

AIRI a découvert que l'échec ne se produit pas dans les couches profondes du transformer, mais dans les premières couches du réseau — ce sont précisément ces couches qui sont responsables du traitement primaire des tokens et de la formation des caractéristiques sémantiques.

Avec le token cramming, l'optimiseur apprend à contourner les premières couches : un vecteur est créé qui permet aux couches suivantes de « deviner » les tokens requis sans comprendre leur sens. En pratique, le modèle apprend à compresser en contournant la sémantique. Selon les auteurs de l'étude, l'analyse des trajectoires d'optimisation a montré que l'embedding pour 1568 tokens se situe dans une région de l'espace complètement différente de celle des vecteurs d'entrée normaux — ce qui explique l'incapacité du modèle à « penser » avec de telles données.

Ce que cela signifie

Le token cramming dans sa forme actuelle est un impressionnant tour de passe-passe de reconstruction, mais pas une méthode fonctionnelle de compression de contexte pour les tâches nécessitant de la compréhension. Le travail de FusionBrain AIRI modifie le standard d'évaluation des méthodes de compression : il ne suffit pas de vérifier la précision de la reconstruction — il faut vérifier que la capacité du modèle à raisonner est préservée.

Questions fréquentes

Qu'est-ce que le token cramming ?

Le token cramming est une méthode par laquelle des centaines ou des milliers de tokens de texte sont « compressés » dans un seul vecteur d'entrée d'un modèle de langage gelé. Le travail original de Yuri Kuratov (AIRI, février 2025) a démontré la possibilité de récupérer 1568 tokens à partir d'un seul vecteur sans affinage du modèle.

En quoi le progressive cramming diffère-t-il du protocole standard ?

Le progressive cramming est un protocole d'évaluation proposé par AIRI à l'ICML 2026, dans lequel le degré de compression augmente progressivement et à chaque étape, on vérifie non seulement la précision de la reconstruction, mais aussi la capacité du modèle à résoudre des tâches de compréhension. C'est précisément ce protocole qui a révélé que la reconstruction parfaite ne signifie pas que la capacité de raisonnement est préservée.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…