Parallax: atención lineal local mejorada con corrección de covarianza
Parallax es una nueva arquitectura de mecanismo de atención que reemplaza el resolvedor Local Linear Attention (LLA) con un proyector entrenado, duplicando la intensidad aritmética. En escalas de 0,6B y 1,7B de parámetros, el modelo muestra mejor perplejidad y velocidad de decodificación en comparación con la versión anterior e incluso modelos basados en transformadores del mismo tamaño.
Procesado por IA desde MarkTechPost; editado por Hamidun News
Los investigadores presentaron Parallax — una variante parametrizada de Local Linear Attention (LLA), que mantiene el mecanismo softmax familiar y añade una rama de corrección de covarianza aprendible. El 31 de mayo de 2026, la publicación MarkTechPost informó sobre esto: según la publicación, el nuevo método reemplaza el solucionador por consulta utilizado en LLA con un proyector aprendible, que duplica la intensidad aritmética de los cálculos y mejora la perplejidad de los modelos en escalas de 0.6 y 1.7 mil millones de parámetros.
Cuál es la limitación de la atención lineal
El mecanismo de atención clásico (auto-atención) en los transformadores es una de las principales fuentes de costos computacionales en el entrenamiento e inferencia de modelos de lenguaje: su complejidad crece cuadráticamente con la longitud de la secuencia de entrada. La atención lineal fue propuesta como una forma de superar esta limitación, acercando los cálculos a la complejidad lineal, pero generalmente con el costo de alguna pérdida de calidad en comparación con la atención softmax completa. Local Linear Attention (LLA) es uno de los enfoques en esta dirección, que para cada consulta resuelve una tarea de aproximación local, pero esto crea sus propios cuellos de botella de eficiencia computacional.
Hechos clave sobre Parallax:
- El método se construye sobre la base de atención lineal local (LLA).
- El solucionador por consulta se reemplaza con un proyector aprendible.
- Se retiene el mecanismo de atención softmax, se añade una rama de corrección de covarianza.
- La intensidad aritmética de los cálculos se duplica en comparación con el enfoque de línea base.
- La mejora de perplejidad se registra en modelos con 0.6 y 1.7 mil millones de parámetros.
Lo que cambia el proyector aprendible
La diferencia arquitectónica clave de Parallax es el reemplazo del solucionador, que en la variante LLA original se recalculaba por separado para cada consulta, con un único proyector aprendible. Este reemplazo reduce la carga computacional específica de cada consulta individual y transfiere parte de la "inteligencia" del mecanismo de atención a parámetros que se aprenden de antemano junto con el resto del modelo. La rama de corrección de covarianza añadida, a juzgar por el nombre del método, está diseñada para compensar las inexactitudes en la aproximación lineal, acercando la calidad del mecanismo a la atención softmax completa mientras se mantiene la ventaja de velocidad característica de los métodos de atención lineal.
Lo que mostraron los experimentos
Los autores señalan dos resultados prácticos. Primero, la duplicación de intensidad aritmética — una métrica que muestra cuán eficientemente se utiliza el hardware de computación para cada byte de datos transmitido: cuanto mayor es la intensidad aritmética, menos los cálculos se cuellan en el ancho de banda de memoria en lugar del rendimiento de los propios núcleos de computación. Segundo, el método mostró mejora de perplejidad — la métrica de calidad estándar para modelos de lenguaje que refleja qué tan bien el modelo predice el siguiente token — en modelos de escala relativamente pequeña: 0.
6 y 1.7 mil millones de parámetros. Para la comunidad de investigación que trabaja en arquitecturas de transformadores eficientes, tales resultados son interesantes principalmente como prueba de que los mecanismos de atención lineal pueden acercarse a la calidad de la atención completa sin sacrificar las ganancias en eficiencia computacional.
Por qué esta dirección de investigación es importante
La búsqueda de alternativas a la atención cuadrática clásica es una de las áreas más activas de investigación actual en modelos de lenguaje: en los últimos años, además de la atención lineal, se han propuesto otros enfoques arquitectónicos para reducir los costos computacionales para procesar secuencias largas — arquitecturas recurrentes y de espacio de estados, varias variantes de atención dispersa y esquemas híbridos que combinan múltiples mecanismos en un solo modelo. La motivación común para todos estos enfoques es la misma: la longitud del contexto que los modelos necesitan procesar — desde consultas cortas hasta libros completos, repositorios de código y diálogos de varias horas — crece más rápido de lo que se abaratan los cálculos, lo que significa que la eficiencia de cada mecanismo de atención determina directamente cuán largo un contexto se puede permitir procesar con un presupuesto de infraestructura dado. Contra este trasfondo, las pruebas de Parallax se limitan hasta ahora a modelos comparativamente pequeños — 0.
6 y 1.7 mil millones de parámetros — y si se preservarán las ventajas afirmadas al escalar al tamaño de LLMs industriales modernos sigue siendo una pregunta para investigaciones futuras.
El valor práctico de tales mejoras arquitectónicas rara vez se manifiesta instantáneamente: el camino desde una publicación de investigación hasta aplicar el método en modelos de escala industrial generalmente toma meses o años y requiere verificación independiente en arquitecturas más grandes y conjuntos de datos diversos. No obstante, la mera idea de retener el mecanismo softmax, en lugar de abandonarlo completamente por complejidad lineal, distingue a Parallax de alternativas de atención más radicales — es más bien un refinamiento evolutivo de un enfoque existente que un intento de inventar una arquitectura fundamentalmente nueva desde cero.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.