arXiv cs.LG→ original

HyenaND: субквадратичный оператор вместо attention для многомерных данных

Исследователи представили HyenaND — субквадратичный оператор, заменяющий attention на многомерных данных. Он обрабатывает изображения, объёмы и уравнения в частных производных в родной геометрии, без разворачивания в 1D, со сложностью O(L log L). В тестах на геномике, зрении, медицине и PDE гибрид HyenaND с attention обошёл и чистый attention, и рекуррентные гибриды.

Procesado por IA desde arXiv cs.LG; editado por Hamidun News
HyenaND: субквадратичный оператор вместо attention для многомерных данных
Fuente: arXiv cs.LG. Collage: Hamidun News.
◐ Escuchar artículo

HyenaND: un operador subcuadrático en lugar de attention para datos

multidimensionales

Un grupo de investigadores presentó HyenaND, un operador subcuadrático para redes neuronales que reemplaza el mecanismo de attention al trabajar con datos multidimensionales y procesa imágenes, volúmenes y ecuaciones en derivadas parciales (PDE) en su geometría nativa, sin necesidad de desplegarlos en una secuencia unidimensional. El preprint se publicó en arXiv en julio de 2026, y su promesa clave es una complejidad O(L log L) en lugar de la O(L²) cuadrática del attention.

Cuál es la debilidad del attention

El mecanismo de attention escala de forma cuadrática: para una entrada de longitud L, su costo crece como O(L²), por lo que un contexto largo resulta costoso. Según los autores, todas las alternativas subcuadráticas existentes se ven obligadas a hacer concesiones en datos multidimensionales.

Las convoluciones habituales carecen de un campo receptivo global y de dependencia de la entrada, mientras que los modelos recurrentes requieren desplegar una imagen o un volumen tridimensional en un orden de recorrido unidimensional artificial, y ese orden destruye la estructura espacial original de los datos.

Cómo funciona HyenaND

HyenaND es un operador global, dependiente de la entrada (input-dependent), que actúa directamente sobre la geometría nativa de los datos multidimensionales mediante convoluciones con núcleos multidimensionales parametrizados de forma implícita. A diferencia de una convolución habitual, aquí el núcleo es global y se adapta a la entrada concreta.

La velocidad práctica la proporciona la implementación en CUDA llamada nSubQ: fusiona la ruta de convolución mediante la transformada rápida de Fourier (FFT) en un único núcleo, convirtiendo la complejidad teórica O(L log L) en una aceleración real de tiempo de ejecución.

  • HyenaND — un operador subcuadrático, global, input-dependent
  • Funciona con imágenes, volúmenes 3D y PDE sin desplegarlos en 1D
  • El núcleo CUDA nSubQ fusiona la ruta de convolución FFT en una sola operación
  • Complejidad O(L log L) frente a O(L²) del attention
  • Validado en 4 dominios: genómica, visión, imagenología médica, PDE

Qué mostraron los experimentos

Las pilas puras de HyenaND igualaron en precisión a fuertes baselines de attention en cuatro tipos de tareas a la vez: genómica de contexto largo, visión por computadora, imagenología médica y modelado de ecuaciones en derivadas parciales. Es decir, abandonar el attention cuadrático no costó calidad.

Las configuraciones híbridas resultaron aún más fuertes: alternar capas de HyenaND y attention superó tanto al attention puro como a los híbridos fuertes basados en modelos recurrentes.

«Las configuraciones híbridas que alternan capas de

HyenaND y attention superan tanto al attention puro como a los fuertes híbridos basados en recurrencia», se afirma en el resumen del preprint en arXiv.

Qué significa esto

La carrera por reemplazar el attention se está desplazando del texto unidimensional hacia los datos multidimensionales. HyenaND demuestra que es posible mantener la precisión de los transformers y eliminar el costo cuadrático allí donde los datos son inherentemente bi- o tridimensionales: en medicina, biología y modelado físico.

Preguntas frecuentes

¿Qué es HyenaND?

HyenaND es un operador subcuadrático para redes neuronales, una alternativa al attention. Procesa datos multidimensionales (imágenes, volúmenes, PDE) en su geometría nativa mediante convoluciones globales dependientes de la entrada y escala como O(L log L).

¿En qué se diferencia HyenaND del attention?

El attention escala de forma cuadrática: O(L²) según la longitud de la entrada. HyenaND ofrece el mismo campo receptivo global y la misma dependencia de la entrada, pero con complejidad O(L log L), y no requiere desplegar los datos multidimensionales en una secuencia unidimensional.

¿Dónde se aplica HyenaND?

Según los datos del preprint, HyenaND se probó en genómica de contexto largo, visión por computadora, imagenología médica y modelado de ecuaciones en derivadas parciales.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Quieres dejar de leer sobre IA y empezar a usarla?

AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.

¿Qué te parece?
Cargando comentarios…