arXiv cs.AI→ original

Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса

Исследователи представили Spectral-LSH — метод сжатия длинных промптов для языковых моделей без дообучения. Он группирует похожие токены через SimHash в спектральном пространстве внимания и сокращает вход в 8–16 раз. При сжатии 16× Qwen2.5-14B снижает коэффициент перплексии с 9,533 до 3,427 — качество сохраняется там, где простое разбиение текста на блоки его теряет.

Processado por IA de arXiv cs.AI; editado por Hamidun News
Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса
Fonte: arXiv cs.AI. Colagem: Hamidun News.
◐ Ouvir artigo

Pesquisadores apresentaram o Spectral-LSH — um método de compressão de prompts longos para grandes modelos de linguagem que funciona sem fine-tuning e reduz o texto de entrada em 8–16×, preservando a qualidade onde métodos simples a perdem. O preprint foi publicado no arXiv (número 2607.19368) em julho de 2026.

Por que comprimir prompts

Prompts longos são caros de processar porque o custo de atenção (attention) na etapa de prefill cresce de forma quadrática — como O(N²) em relação ao comprimento da sequência. O Spectral-LSH resolve isso antes mesmo de o prompt chegar ao modelo: ele encontra tokens semanticamente próximos e os funde em "macro-tokens", reduzindo o comprimento da entrada já antes dos cálculos começarem.

Principais fatos do preprint:

  • O método é training-free — não exige fine-tuning do modelo
  • Funciona como um pré-processador, antes da entrada no LLM
  • Foi testado no Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct e Qwen2.5-14B-Instruct
  • O dataset de avaliação é o C4
  • Os coeficientes de compressão ρ foram testados na faixa de 4× a 16×

Como o método funciona

O Spectral-LSH aproxima os componentes principais do operador implícito do kernel de atenção por meio do método do subespaço de Krylov (Krylov), junto com random features. Isso permite dispensar a construção explícita da matriz de atenção de tamanho O(N²) — a parte mais cara em contextos longos. Em seguida, no espaço "espectral" de atenção resultante, aplica-se o SimHash: tokens semelhantes são mapeados para os mesmos buckets via hashing e agregados em macro-tokens preservando a ordem causal das posições, para que o modelo não perca a estrutura da sequência.

Onde ocorre a transição de fase

O principal resultado é uma transição de fase em relação ao coeficiente de compressão, descrita pelos autores. Abaixo de ρ=4× a redundância local dos tokens é baixa, e um chunking leve (simples divisão em blocos) oferece o melhor equilíbrio entre velocidade e qualidade. Acima de ρ=8× o caminho espectral passa a preservar a qualidade que o chunking perde.

Em ρ=16× a diferença é especialmente notável: segundo os dados do preprint, o Qwen2.5-7B em modo adaptativo reduz o coeficiente de perplexidade (PPL) de 353,409 para 196,963, e o Qwen2.5-14B, de 9,533 para 3,427. Quanto menor a perplexidade, menos a predição do modelo é distorcida após a compressão.

«Nossos experimentos revelam uma transição de fase em relação ao

coeficiente de compressão», afirma o resumo do estudo no arXiv.

O que mostrou o teste de estresse

Em um pequeno teste de estresse com contexto longo composto por dados estruturados — fragmentos no estilo JSON, código e tabelas —, o LSH local melhorou todas as métricas em comparação com o chunking em uma compressão de 8×. O backend adaptativo combina os dois modos: chunking em baixa compressão e clustering espectral em alta compressão. Ainda assim, o chunking continua sendo o mais rápido em termos de latência final — a qualidade em coeficientes altos tem um custo em tempo.

O que isso significa

O Spectral-LSH mostra que a compressão agressiva de prompts (8× ou mais) pode ser feita sem perda de qualidade e sem fine-tuning do modelo — desde que os tokens sejam agrupados pelo espectro de atenção, em vez de o texto ser cortado em blocos. Para a inferência com contextos longos, isso é um caminho direto para custos computacionais menores.

Perguntas frequentes

O que é o Spectral-LSH?

É um método training-free de compressão de prompts de entrada para modelos de linguagem: ele agrupa tokens semelhantes por meio do hashing SimHash no espaço espectral de atenção e os funde em macro-tokens, reduzindo o comprimento da entrada em 4–16×. Não é necessário fine-tuning do modelo.

Em quais modelos o método foi testado?

Os autores avaliaram o Spectral-LSH no Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct e Qwen2.5-14B-Instruct no dataset C4, além de em um teste de estresse com dados estruturados no estilo JSON, código e tabelas.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…