Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса
Исследователи представили Spectral-LSH — метод сжатия длинных промптов для языковых моделей без дообучения. Он группирует похожие токены через SimHash в спектральном пространстве внимания и сокращает вход в 8–16 раз. При сжатии 16× Qwen2.5-14B снижает коэффициент перплексии с 9,533 до 3,427 — качество сохраняется там, где простое разбиение текста на блоки его теряет.
Traité par IA depuis arXiv cs.AI ; édité par Hamidun News
Des chercheurs ont présenté Spectral-LSH, une méthode de compression des prompts longs pour les grands modèles de langage qui fonctionne sans fine-tuning et réduit le texte d'entrée de 8 à 16×, tout en préservant la qualité là où les méthodes simples la perdent. Le preprint a été publié sur arXiv (numéro 2607.19368) en juillet 2026.
Pourquoi compresser les prompts
Les prompts longs sont coûteux à traiter car le coût de l'attention (attention) lors de l'étape de prefill croît de manière quadratique — comme O(N²) par rapport à la longueur de la séquence. Spectral-LSH résout ce problème avant même que le prompt n'atteigne le modèle : il repère les tokens proches par le sens et les fusionne en « macro-tokens », réduisant la longueur d'entrée avant même le début des calculs.
Faits clés tirés du preprint :
- La méthode est training-free — elle ne nécessite pas de fine-tuning du modèle
- Elle fonctionne comme un préprocesseur, avant l'entrée dans le LLM
- Elle a été testée sur Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct et Qwen2.5-14B-Instruct
- Le jeu de données d'évaluation est C4
- Les taux de compression ρ ont été testés dans une plage allant de 4× à 16×
Comment fonctionne la méthode
Spectral-LSH approxime les composantes principales de l'opérateur implicite du noyau d'attention via la méthode du sous-espace de Krylov (Krylov), associée à des random features. Cela permet de se passer de la construction explicite de la matrice d'attention de taille O(N²) — la partie la plus coûteuse avec un contexte long. Ensuite, dans l'espace « spectral » d'attention ainsi obtenu, on applique SimHash : les tokens similaires sont hashés dans les mêmes buckets et agrégés en macro-tokens en préservant l'ordre causal des positions, afin que le modèle ne perde pas la structure de la séquence.
Où se produit la transition de phase
Le résultat principal est une transition de phase par rapport au taux de compression, décrite par les auteurs. En dessous de ρ=4×, la redondance locale des tokens est faible, et un chunking léger (simple découpage en blocs) offre le meilleur équilibre entre vitesse et qualité. Au-dessus de ρ=8×, la voie spectrale commence à préserver la qualité que le chunking perd.
À ρ=16×, l'écart est particulièrement marqué : selon les données du preprint, Qwen2.5-7B en mode adaptatif réduit le coefficient de perplexité (PPL) de 353,409 à 196,963, et Qwen2.5-14B, de 9,533 à 3,427. Plus la perplexité est basse, moins la prédiction du modèle est déformée après compression.
«
Nos expériences révèlent une transition de phase par rapport au taux de compression », indique le résumé de l'étude sur arXiv.
Ce qu'a montré le test de résistance
Lors d'un petit test de résistance avec un contexte long composé de données structurées — fragments de style JSON, code et tableaux —, le LSH local a amélioré chaque métrique par rapport au chunking à une compression de 8×. Le backend adaptatif combine les deux modes : chunking en cas de faible compression et clustering spectral en cas de forte compression. Cela dit, c'est bien le chunking qui reste le plus rapide en termes de latence finale — la qualité aux taux élevés se paie en temps.
Ce que cela signifie
Spectral-LSH montre qu'une compression agressive des prompts (8× et plus) peut se faire sans perte de qualité et sans fine-tuning du modèle — à condition de regrouper les tokens selon le spectre d'attention plutôt que de découper le texte en blocs. Pour l'inférence sur de longs contextes, c'est une voie directe vers des coûts de calcul réduits.
Questions fréquentes
Qu'est-ce que Spectral-LSH ?
C'est une méthode training-free de compression des prompts d'entrée pour les modèles de langage : elle regroupe les tokens similaires via le hashage SimHash dans l'espace spectral d'attention et les fusionne en macro-tokens, réduisant la longueur d'entrée de 4 à 16×. Aucun fine-tuning du modèle n'est nécessaire.
Sur quels modèles la méthode a-t-elle été testée ?
Les auteurs ont évalué Spectral-LSH sur Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct et Qwen2.5-14B-Instruct sur le jeu de données C4, ainsi que lors d'un test de résistance avec des données structurées de style JSON, code et tableaux.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.