AIRI раскрыла слабость token cramming: 1568 токенов в векторе, но понимание теряется
Исследователи лаборатории FusionBrain AIRI на ICML 2026 доказали: token cramming — красивый, но обманчивый трюк. LLM умеет «упаковать» 1568 токенов в один вектор и восстановить текст слово в слово, но теряет способность понимать и анализировать его. Причина — в первых слоях трансформера: оптимизатор учится обходить семантику, а не сохранять её.
AI-обработка оригинала AIRI; редакция Hamidun News
Исследователи лаборатории FusionBrain AIRI представили на ICML 2026 работу «Progressive Cramming: Reliable Token Compression and What It Reveals» и доказали: идеальное пословное восстановление текста из сжатого эмбеддинга не означает, что языковая модель сохраняет способность рассуждать над ним.
Откуда взялся token cramming
В феврале 2025 года исследователь AIRI Юрий Куратов с командой опубликовал работу «Cramming 1568 Tokens into a Single Vector and Back Again» и показал нечто почти невозможное: в один-единственный входной эмбеддинг замороженной LLM можно «упаковать» до 1568 токенов — несколько абзацев текста — и потом восстановить их слово в слово. Вектор размерностью в несколько тысяч чисел заменял тысячи токенов, что открывало фантастические перспективы для сжатия контекста.
Ключевые параметры оригинального метода:
- 1568 токенов умещается в один входной вектор
- Модель восстанавливает текст с нулевой потерей токенов
- Замороженная LLM не дообучается — меняется только входной эмбеддинг
- Метод назвали token cramming («упаковка токенов»)
Почему реконструкция — это не понимание
Команда FusionBrain AIRI при воспроизведении результата обнаружила скрытую проблему. Стандартный протокол token cramming проверяет только точность восстановления текста, но не то, как модель понимает и использует содержимое.
Авторы нового исследования предложили альтернативный протокол — progressive cramming: сжатие начинается с небольшого числа токенов и постепенно увеличивается, при этом на каждом шаге проверяется не только точность реконструкции, но и способность модели выполнять задачи на понимание — вопросно-ответные пары, логические цепочки.
«Стандартный протокол token cramming скрывает катастрофические провалы.
Одно дело — восстановить текст, и совсем другое — понимать его», — Дмитрий Тарасов, исследователь FusionBrain AIRI, в публикации лаборатории на Хабре.
Результаты оказались обескураживающими: при высокой степени сжатия модель справляется с дословным воспроизведением текста, но полностью теряет возможность рассуждать о его содержимом. Точность на задачах понимания падает до случайного уровня.
Где прячется причина сбоя
AIRI выяснила, что провал происходит не в глубоких слоях трансформера, а в первых слоях сети — именно они отвечают за первичную обработку токенов и формирование смысловых признаков.
При token cramming оптимизатор обучается обходить первые слои: создаётся такой вектор, который позволяет последующим слоям «угадывать» нужные токены, не понимая их смысла. Фактически модель учится сжимать, минуя семантику. По данным авторов исследования, анализ траекторий оптимизации показал, что эмбеддинг для 1568 токенов лежит в совершенно другой области пространства, чем нормальные входные векторы — этим и объясняется неспособность модели «думать» с такими данными.
Что это значит
Token cramming в нынешнем виде — впечатляющий трюк реконструкции, но не рабочий метод сжатия контекста для задач, требующих понимания. Работа FusionBrain AIRI меняет стандарт оценки методов сжатия: недостаточно проверять точность восстановления — нужно проверять сохранность способности модели рассуждать.
Частые вопросы
Что такое token cramming?
Token cramming — метод, при котором сотни или тысячи токенов текста «упаковываются» в один входной вектор замороженной языковой модели. Исходная работа Юрия Куратова (AIRI, февраль 2025) показала возможность восстановления 1568 токенов из одного вектора без дообучения модели.
Чем progressive cramming отличается от стандартного протокола?
Progressive cramming — протокол оценки, предложенный AIRI на ICML 2026, при котором степень сжатия нарастает постепенно и на каждом шаге проверяется не только точность реконструкции, но и способность модели решать задачи на понимание. Именно этот протокол выявил, что идеальная реконструкция не означает сохранности рассуждений.
Хотите не читать про ИИ, а внедрить его?
«AI News» — это полезные новости из мира ИИ. Системно научиться работать с нейросетями и применять их в работе — в Hamidun Academy.
Главное из мира ИИ — раз в неделю
7 ключевых событий недели, отобранных вручную. Без шума, репостов и пресс-релизов.
Готово! Проверьте почту — мы отправили подтверждение.