AIRI→ original

AIRI раскрыла слабость token cramming: 1568 токенов в векторе, но понимание теряется

Исследователи лаборатории FusionBrain AIRI на ICML 2026 доказали: token cramming — красивый, но обманчивый трюк. LLM умеет «упаковать» 1568 токенов в один вектор и восстановить текст слово в слово, но теряет способность понимать и анализировать его. Причина — в первых слоях трансформера: оптимизатор учится обходить семантику, а не сохранять её.

Procesado por IA desde AIRI; editado por Hamidun News
AIRI раскрыла слабость token cramming: 1568 токенов в векторе, но понимание теряется
Fuente: AIRI. Collage: Hamidun News.
◐ Escuchar artículo

Los investigadores del laboratorio FusionBrain AIRI presentaron en el ICML 2026 el trabajo «Progressive Cramming: Reliable Token Compression and What It Reveals» y demostraron que la reconstrucción perfecta palabra por palabra de un texto a partir de un embedding comprimido no significa que el modelo de lenguaje conserve la capacidad de razonar sobre él.

De dónde surgió el token cramming

En febrero de 2025, el investigador de AIRI Yuri Kuratov y su equipo publicaron el trabajo «Cramming 1568 Tokens into a Single Vector and Back Again» y demostraron algo casi imposible: hasta 1568 tokens —varios párrafos de texto— pueden «empaquetarse» en un único embedding de entrada de una LLM congelada y luego recuperarse palabra por palabra. Un vector de varios miles de números reemplazaba miles de tokens, lo que abría perspectivas fantásticas para la compresión de contexto.

Parámetros clave del método original:

  • 1568 tokens caben en un único vector de entrada
  • El modelo recupera el texto con cero pérdida de tokens
  • La LLM congelada no se reajusta — solo cambia el embedding de entrada
  • El método se denominó token cramming

Por qué la reconstrucción no es comprensión

El equipo FusionBrain AIRI, al reproducir el resultado, descubrió un problema oculto. El protocolo estándar de token cramming solo verifica la precisión de la reconstrucción del texto, pero no cómo el modelo comprende y utiliza el contenido.

Los autores del nuevo estudio propusieron un protocolo alternativo — progressive cramming: la compresión comienza con un pequeño número de tokens y aumenta gradualmente, verificándose en cada paso no solo la precisión de la reconstrucción, sino también la capacidad del modelo para realizar tareas de comprensión — pares de preguntas y respuestas, cadenas lógicas.

«El protocolo estándar de token cramming oculta fallos catastróficos.

Una cosa es reconstruir el texto, y otra muy distinta es comprenderlo», — Dmitry Tarasov, investigador de FusionBrain AIRI, en la publicación del laboratorio en Habr.

Los resultados resultaron desalentadores: con un alto grado de compresión, el modelo logra reproducir el texto palabra por palabra, pero pierde por completo la capacidad de razonar sobre su contenido. La precisión en las tareas de comprensión cae al nivel del azar.

Dónde se esconde la causa del fallo

AIRI descubrió que el fallo no ocurre en las capas profundas del transformer, sino en las primeras capas de la red — son precisamente estas capas las que se encargan del procesamiento primario de los tokens y de la formación de características semánticas.

Con el token cramming, el optimizador aprende a eludir las primeras capas: se crea un vector que permite a las capas posteriores «adivinar» los tokens requeridos sin comprender su significado. En la práctica, el modelo aprende a comprimir evitando la semántica. Según los autores del estudio, el análisis de las trayectorias de optimización mostró que el embedding para 1568 tokens se encuentra en una región completamente diferente del espacio en comparación con los vectores de entrada normales — esto explica la incapacidad del modelo para «pensar» con dichos datos.

Qué significa esto

El token cramming en su forma actual es un impresionante truco de reconstrucción, pero no un método funcional de compresión de contexto para tareas que requieren comprensión. El trabajo de FusionBrain AIRI cambia el estándar de evaluación de los métodos de compresión: no basta con verificar la precisión de la reconstrucción — es necesario comprobar que se conserva la capacidad del modelo para razonar.

Preguntas frecuentes

¿Qué es el token cramming?

El token cramming es un método mediante el cual cientos o miles de tokens de texto se «empaquetan» en un único vector de entrada de un modelo de lenguaje congelado. El trabajo original de Yuri Kuratov (AIRI, febrero de 2025) demostró la posibilidad de recuperar 1568 tokens a partir de un único vector sin reajuste del modelo.

¿En qué se diferencia el progressive cramming del protocolo estándar?

El progressive cramming es un protocolo de evaluación propuesto por AIRI en el ICML 2026, en el que el grado de compresión aumenta gradualmente y en cada paso se verifica no solo la precisión de la reconstrucción, sino también la capacidad del modelo para resolver tareas de comprensión. Fue precisamente este protocolo el que reveló que la reconstrucción perfecta no implica que se preserve la capacidad de razonamiento.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…