arXiv cs.AI→ original

LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения

Исследователи показали LISA — модуль замены механизма внимания для языковых моделей. Он объединяет линейное внимание и «молниеносный индексатор», который отбирает только важные токены и снижает сложность вычислений с O(n²) до O(nM). На моделях DeepSeek-distilled-Qwen метод дал 50% ускорения вывода при контексте 16K токенов и +5,6% к качеству рассуждений — без обучения с нуля.

Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
LISA: sparse attention ускоряет длинные рассуждения LLM на 50% без переобучения
Source : arXiv cs.AI. Collage: Hamidun News.
◐ Écouter l'article

Des chercheurs ont présenté LISA (Linear-Indexed Sparse Attention) — un module de remplacement du mécanisme d'attention qui, en juillet 2026, a montré une accélération de l'inférence de 50% pour un contexte de 16 000 tokens et une amélioration de 5,6% de la qualité du raisonnement, sans nécessiter de réentraîner le modèle depuis zéro. Les travaux ont été publiés sur arXiv (2607.19358).

Comment fonctionne LISA

LISA s'intègre dans un modèle existant comme un remplacement plug-and-play de l'auto-attention standard et combine deux branches parallèles. La première est la Linear Attention, de complexité O(n), qui assure la « mémoire à long terme » et les dépendances lointaines. La seconde est le mécanisme Lightning Indexer, qui sélectionne les top-M tokens les plus importants de tout le contexte et les transmet à la Sparse Self-Attention. Les branches sont fusionnées via un mécanisme de gating.

  • Nom : LISA (Linear-Indexed Sparse Attention), préprint arXiv 2607.19358
  • La complexité de l'inférence passe de O(n²) à O(nM), où M est bien plus petit que n
  • Deux composants : Linear Attention (mémoire O(n)) + Lightning Indexer + Sparse Self-Attention
  • Ne nécessite pas de préentraînement depuis zéro — le module s'intègre dans un modèle déjà entraîné
  • Les tests ont été menés sur des modèles DeepSeek-distilled-Qwen

Pourquoi c'est important pour l'inférence

L'auto-attention standard a une complexité quadratique O(n²), ce qui fait grimper fortement le coût de l'inférence sur les séquences longues. Cela est devenu un goulot d'étranglement pour les modèles à longues chaînes de raisonnement (long chain-of-thought) comme DeepSeek-R1 : le paradigme du test-time scaling les oblige à générer un contexte de raisonnement toujours plus long, et les coûts augmentent avec lui. Selon les auteurs, c'est précisément ce qui limite le déploiement des modèles long-CoT en production.

LISA s'attaque au problème de manière architecturale, et non via du matériel plus puissant. En remplaçant une partie de l'attention complète par de l'attention parcimonieuse (sparse) et linéaire, la méthode fait passer la génération de n tokens du régime O(n²) au régime O(nM) — sachant que M (le nombre de tokens sélectionnés) est nettement plus petit que la longueur du contexte n.

Ce que les tests ont montré

Sur les modèles de la famille DeepSeek-distilled-Qwen, LISA a permis une accélération de 50% de l'inférence pour un contexte de 16K tokens, tout en augmentant le score moyen sur les benchmarks de raisonnement de 5,6% — y compris AIME et MATH-500. Autrement dit, la méthode ne se contente pas d'accélérer, elle ne dégrade pas non plus la qualité.

L'entraînement se déroule en deux étapes. Dans la première, une attention linéaire pour les dépendances lointaines est intégrée au modèle, complétée par un mécanisme de fenêtre glissante (sliding-window) ; elle est optimisée par distillation de connaissances afin de se rapprocher de la distribution de l'auto-attention complète d'un modèle enseignant « gelé ». Dans la seconde étape, la fenêtre glissante statique est remplacée par l'Indexer, entraîné via une nouvelle fonction de perte — une divergence KL par tête (per-head), qui aligne sa sélection de tokens sur les schémas d'attention de l'enseignant.

« LISA offre une accélération de 50% de l'inférence pour un contexte

de 16K tokens, tout en améliorant le score moyen de 5,6% sur les benchmarks de raisonnement, y compris AIME et MATH-500 », indique le résumé de l'étude sur arXiv.

Ce que cela signifie

Le raisonnement long coûte cher précisément à cause de l'attention quadratique, et LISA montre une voie pour en réduire le coût sans réentraîner le modèle depuis zéro — il suffit d'intégrer le module dans un réseau déjà entraîné. Pour les équipes qui déploient des modèles de raisonnement en production, c'est un moyen direct de réduire les coûts d'inférence sans sacrifier la précision.

Questions fréquentes

Qu'est-ce que LISA ?

LISA (Linear-Indexed Sparse Attention) est un module de remplacement du mécanisme d'attention pour les modèles de langage. Il combine attention linéaire et attention parcimonieuse avec sélection des tokens importants, réduisant la complexité de l'inférence de O(n²) à O(nM).

Faut-il réentraîner le modèle pour utiliser LISA ?

Non, aucun entraînement depuis zéro n'est nécessaire. LISA est un remplacement plug-and-play de l'auto-attention ; il s'intègre dans un modèle déjà entraîné et se règle en deux étapes via une distillation de connaissances à partir d'un modèle enseignant.

De combien LISA accélère-t-il l'inférence ?

Selon le résumé, sur les modèles DeepSeek-distilled-Qwen, la méthode offre une accélération de l'inférence de 50% pour un contexte de 16K tokens, tout en améliorant la qualité moyenne du raisonnement de 5,6% sur les benchmarks AIME et MATH-500.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?

AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.

Qu'en pensez-vous ?
Chargement des commentaires…