Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса
Исследователи представили Spectral-LSH — метод сжатия длинных промптов для языковых моделей без дообучения. Он группирует похожие токены через SimHash в спектральном пространстве внимания и сокращает вход в 8–16 раз. При сжатии 16× Qwen2.5-14B снижает коэффициент перплексии с 9,533 до 3,427 — качество сохраняется там, где простое разбиение текста на блоки его теряет.
Processado por IA de arXiv cs.AI; editado por Hamidun News
Pesquisadores apresentaram o Spectral-LSH — um método de compressão de prompts longos para grandes modelos de linguagem que funciona sem fine-tuning e reduz o texto de entrada em 8–16×, preservando a qualidade onde métodos simples a perdem. O preprint foi publicado no arXiv (número 2607.19368) em julho de 2026.
Por que comprimir prompts
Prompts longos são caros de processar porque o custo de atenção (attention) na etapa de prefill cresce de forma quadrática — como O(N²) em relação ao comprimento da sequência. O Spectral-LSH resolve isso antes mesmo de o prompt chegar ao modelo: ele encontra tokens semanticamente próximos e os funde em "macro-tokens", reduzindo o comprimento da entrada já antes dos cálculos começarem.
Principais fatos do preprint:
- O método é training-free — não exige fine-tuning do modelo
- Funciona como um pré-processador, antes da entrada no LLM
- Foi testado no Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct e Qwen2.5-14B-Instruct
- O dataset de avaliação é o C4
- Os coeficientes de compressão ρ foram testados na faixa de 4× a 16×
Como o método funciona
O Spectral-LSH aproxima os componentes principais do operador implícito do kernel de atenção por meio do método do subespaço de Krylov (Krylov), junto com random features. Isso permite dispensar a construção explícita da matriz de atenção de tamanho O(N²) — a parte mais cara em contextos longos. Em seguida, no espaço "espectral" de atenção resultante, aplica-se o SimHash: tokens semelhantes são mapeados para os mesmos buckets via hashing e agregados em macro-tokens preservando a ordem causal das posições, para que o modelo não perca a estrutura da sequência.
Onde ocorre a transição de fase
O principal resultado é uma transição de fase em relação ao coeficiente de compressão, descrita pelos autores. Abaixo de ρ=4× a redundância local dos tokens é baixa, e um chunking leve (simples divisão em blocos) oferece o melhor equilíbrio entre velocidade e qualidade. Acima de ρ=8× o caminho espectral passa a preservar a qualidade que o chunking perde.
Em ρ=16× a diferença é especialmente notável: segundo os dados do preprint, o Qwen2.5-7B em modo adaptativo reduz o coeficiente de perplexidade (PPL) de 353,409 para 196,963, e o Qwen2.5-14B, de 9,533 para 3,427. Quanto menor a perplexidade, menos a predição do modelo é distorcida após a compressão.
«Nossos experimentos revelam uma transição de fase em relação ao
coeficiente de compressão», afirma o resumo do estudo no arXiv.
O que mostrou o teste de estresse
Em um pequeno teste de estresse com contexto longo composto por dados estruturados — fragmentos no estilo JSON, código e tabelas —, o LSH local melhorou todas as métricas em comparação com o chunking em uma compressão de 8×. O backend adaptativo combina os dois modos: chunking em baixa compressão e clustering espectral em alta compressão. Ainda assim, o chunking continua sendo o mais rápido em termos de latência final — a qualidade em coeficientes altos tem um custo em tempo.
O que isso significa
O Spectral-LSH mostra que a compressão agressiva de prompts (8× ou mais) pode ser feita sem perda de qualidade e sem fine-tuning do modelo — desde que os tokens sejam agrupados pelo espectro de atenção, em vez de o texto ser cortado em blocos. Para a inferência com contextos longos, isso é um caminho direto para custos computacionais menores.
Perguntas frequentes
O que é o Spectral-LSH?
É um método training-free de compressão de prompts de entrada para modelos de linguagem: ele agrupa tokens semelhantes por meio do hashing SimHash no espaço espectral de atenção e os funde em macro-tokens, reduzindo o comprimento da entrada em 4–16×. Não é necessário fine-tuning do modelo.
Em quais modelos o método foi testado?
Os autores avaliaram o Spectral-LSH no Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct e Qwen2.5-14B-Instruct no dataset C4, além de em um teste de estresse com dados estruturados no estilo JSON, código e tabelas.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.