arXiv cs.AI→ original

Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса

Исследователи представили Spectral-LSH — метод сжатия длинных промптов для языковых моделей без дообучения. Он группирует похожие токены через SimHash в спектральном пространстве внимания и сокращает вход в 8–16 раз. При сжатии 16× Qwen2.5-14B снижает коэффициент перплексии с 9,533 до 3,427 — качество сохраняется там, где простое разбиение текста на блоки его теряет.

Procesado por IA desde arXiv cs.AI; editado por Hamidun News
Spectral-LSH: сжатие промптов до 16× без дообучения для ускорения LLM-инференса
Fuente: arXiv cs.AI. Collage: Hamidun News.
◐ Escuchar artículo

Los investigadores presentaron Spectral-LSH, un método de compresión de prompts largos para modelos de lenguaje de gran tamaño que funciona sin reentrenamiento y reduce el texto de entrada entre 8 y 16×, conservando la calidad allí donde los métodos simples la pierden. El preprint se publicó en arXiv (número 2607.19368) en julio de 2026.

Por qué comprimir los prompts

Los prompts largos son costosos de procesar porque el costo de atención (attention) en la etapa de prefill crece de forma cuadrática, como O(N²) respecto a la longitud de la secuencia. Spectral-LSH resuelve esto antes de que el prompt llegue al modelo: encuentra tokens cercanos en significado y los fusiona en "macro-tokens", reduciendo la longitud de entrada incluso antes de que empiecen los cálculos.

Datos clave del preprint:

  • El método es training-free: no requiere reentrenar el modelo
  • Funciona como un preprocesador, antes de la entrada al LLM
  • Se probó en Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct y Qwen2.5-14B-Instruct
  • El dataset de evaluación es C4
  • Los coeficientes de compresión ρ se probaron en un rango de 4× a 16×

Cómo funciona el método

Spectral-LSH aproxima los componentes principales del operador implícito del núcleo de atención mediante el método del subespacio de Krylov (Krylov) junto con random features. Esto permite prescindir de la construcción explícita de la matriz de atención de tamaño O(N²), la parte más costosa con contexto largo. Luego, en el espacio "espectral" de atención resultante, se aplica SimHash: los tokens similares se hashean en los mismos buckets y se agregan en macro-tokens conservando el orden causal de las posiciones, para que el modelo no pierda la estructura de la secuencia.

Dónde se produce la transición de fase

El resultado principal es una transición de fase respecto al coeficiente de compresión, que describen los autores. Por debajo de ρ=4× la redundancia local de los tokens es baja, y un chunking ligero (simple división en bloques) ofrece el mejor equilibrio entre velocidad y calidad. Por encima de ρ=8× la vía espectral comienza a preservar la calidad que el chunking pierde.

Con ρ=16× la diferencia es especialmente notable: según los datos del preprint, Qwen2.5-7B en modo adaptativo reduce el coeficiente de perplejidad (PPL) de 353,409 a 196,963, y Qwen2.5-14B, de 9,533 a 3,427. Cuanto menor es la perplejidad, menos se distorsiona la predicción del modelo tras la compresión.

«Nuestros experimentos revelan una transición de fase respecto al

coeficiente de compresión», se afirma en el resumen del estudio en arXiv.

Qué mostró la prueba de estrés

En una pequeña prueba de estrés con contexto largo compuesto por datos estructurados —fragmentos estilo JSON, código y tablas—, el LSH local mejoró todas las métricas en comparación con el chunking con una compresión de 8×. El backend adaptativo combina ambos modos: chunking con compresión baja y clustering espectral con compresión alta. Aun así, el chunking sigue siendo el más rápido en cuanto a latencia final: la calidad en coeficientes altos se paga con tiempo.

Qué significa esto

Spectral-LSH demuestra que la compresión agresiva de prompts (8× o más) puede hacerse sin pérdida de calidad y sin reentrenar el modelo, siempre que los tokens se agrupen por el espectro de atención en lugar de cortar el texto en bloques. Para la inferencia con contextos largos, esto es un camino directo hacia menores costos de cómputo.

Preguntas frecuentes

¿Qué es Spectral-LSH?

Es un método training-free de compresión de prompts de entrada para modelos de lenguaje: agrupa tokens similares mediante el hasheo SimHash en el espacio espectral de atención y los fusiona en macro-tokens, reduciendo la longitud de entrada entre 4 y 16×. No se requiere reentrenar el modelo.

¿En qué modelos se probó el método?

Los autores evaluaron Spectral-LSH en Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct y Qwen2.5-14B-Instruct sobre el dataset C4, además de en una prueba de estrés con datos estructurados estilo JSON, código y tablas.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…