LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения
Исследователи показали LISA — модуль замены механизма внимания для языковых моделей. Он объединяет линейное внимание и «молниеносный индексатор», который отбирает только важные токены и снижает сложность вычислений с O(n²) до O(nM). На моделях DeepSeek-distilled-Qwen метод дал 50% ускорения вывода при контексте 16K токенов и +5,6% к качеству рассуждений — без обучения с нуля.
Procesado por IA desde arXiv cs.AI; editado por Hamidun News
Los investigadores presentaron LISA (Linear-Indexed Sparse Attention), un módulo de reemplazo del mecanismo de atención que en julio de 2026 mostró una aceleración de la inferencia del 50% con un contexto de 16.000 tokens y un aumento de la calidad del razonamiento del 5,6%, sin requerir entrenar el modelo desde cero. El trabajo fue publicado en arXiv (2607.19358).
Cómo funciona LISA
LISA se integra en un modelo existente como un reemplazo plug-and-play de la self-attention estándar y combina dos ramas paralelas. La primera es Linear Attention, con complejidad O(n), encargada de la "memoria a largo plazo" y las dependencias lejanas. La segunda es el mecanismo Lightning Indexer, que selecciona los top-M tokens más importantes de todo el contexto y los pasa a Sparse Self-Attention. Las ramas se combinan mediante un mecanismo de gating.
- Nombre: LISA (Linear-Indexed Sparse Attention), preprint de arXiv 2607.19358
- La complejidad de la inferencia se reduce de O(n²) a O(nM), donde M es mucho menor que n
- Dos componentes: Linear Attention (memoria O(n)) + Lightning Indexer + Sparse Self-Attention
- No requiere preentrenamiento desde cero: el módulo se integra en un modelo ya existente
- Las pruebas se realizaron con modelos DeepSeek-distilled-Qwen
Por qué esto importa para la inferencia
La self-attention estándar tiene una complejidad cuadrática O(n²), por lo que el costo de la inferencia crece bruscamente en secuencias largas. Esto se ha convertido en un cuello de botella para los modelos con cadenas de razonamiento largas (long chain-of-thought) como DeepSeek-R1: el paradigma de test-time scaling los obliga a generar un contexto de razonamiento cada vez más largo, y con él crecen también los costos. Según los autores, esto es precisamente lo que limita el despliegue de los modelos long-CoT en producción.
LISA ataca el problema de forma arquitectónica, no mediante hardware más potente. Al reemplazar parte de la atención completa por atención dispersa y lineal, el método traslada la generación de n tokens del régimen O(n²) al régimen O(nM), dado que M (el número de tokens seleccionados) es notablemente menor que la longitud del contexto n.
Qué mostraron las pruebas
En los modelos de la familia DeepSeek-distilled-Qwen, LISA logró una aceleración de la inferencia del 50% con un contexto de 16K tokens y, al mismo tiempo, elevó el resultado promedio en los benchmarks de razonamiento en un 5,6%, incluyendo AIME y MATH-500. Es decir, el método no solo acelera, sino que tampoco pierde calidad.
El entrenamiento se estructura en dos etapas. En la primera, se integra en el modelo la atención lineal para las dependencias lejanas, complementada con un mecanismo de ventana deslizante (sliding-window); este se optimiza mediante destilación de conocimiento para aproximarse a la distribución de la self-attention completa de un modelo maestro "congelado". En la segunda etapa, la ventana deslizante estática se reemplaza por el Indexer, entrenado mediante una nueva función de pérdida: una divergencia KL por cabeza (per-head) que alinea su selección de tokens con los patrones de atención del maestro.
"LISA proporciona una aceleración de la inferencia del 50% con un
contexto de 16K tokens, al tiempo que mejora el resultado promedio en un 5,6% en los benchmarks de razonamiento, incluyendo AIME y MATH-500", se afirma en el resumen del estudio en arXiv.
Qué significa esto
El razonamiento largo resulta costoso precisamente por la atención cuadrática, y LISA muestra una vía para abaratarlo sin reentrenar el modelo desde cero: basta con integrar el módulo en una red ya existente. Para los equipos que despliegan modelos de razonamiento en producción, esta es una forma directa de recortar los costos de inferencia sin sacrificar la precisión.
Preguntas frecuentes
¿Qué es LISA?
LISA (Linear-Indexed Sparse Attention) es un módulo de reemplazo del mecanismo de atención para modelos de lenguaje. Combina atención lineal y atención dispersa con selección de tokens importantes, reduciendo la complejidad de la inferencia de O(n²) a O(nM).
¿Es necesario reentrenar el modelo para usar LISA?
No, no se requiere entrenamiento desde cero. LISA es un reemplazo plug-and-play de la self-attention; se integra en un modelo ya existente y se ajusta en dos etapas mediante destilación de conocimiento a partir de un modelo maestro.
¿Cuánto acelera LISA la inferencia?
Según el resumen, en los modelos DeepSeek-distilled-Qwen el método logra una aceleración de la inferencia del 50% con un contexto de 16K tokens, a la vez que mejora la calidad promedio del razonamiento en un 5,6% en los benchmarks AIME y MATH-500.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.