HyenaND: субквадратичный оператор вместо attention для многомерных данных
Исследователи представили HyenaND — субквадратичный оператор, заменяющий attention на многомерных данных. Он обрабатывает изображения, объёмы и уравнения в частных производных в родной геометрии, без разворачивания в 1D, со сложностью O(L log L). В тестах на геномике, зрении, медицине и PDE гибрид HyenaND с attention обошёл и чистый attention, и рекуррентные гибриды.
Traité par IA depuis arXiv cs.LG ; édité par Hamidun News
HyenaND : un opérateur sous-quadratique à la place de l'attention pour
les données multidimensionnelles
Des chercheurs ont présenté HyenaND, un opérateur sous-quadratique pour les réseaux de neurones qui remplace le mécanisme d'attention pour le traitement de données multidimensionnelles et traite les images, les volumes et les équations aux dérivées partielles (EDP) dans leur géométrie native, sans avoir à les dérouler en une séquence unidimensionnelle. Le preprint est paru sur arXiv en juillet 2026, avec pour promesse clé une complexité en O(L log L) au lieu de la complexité quadratique O(L²) de l'attention.
Quel est le point faible de l'attention
Le mécanisme d'attention passe à l'échelle de façon quadratique : pour une entrée de longueur L, son coût croît en O(L²), ce qui rend un contexte long coûteux. Selon la formulation des auteurs, toutes les alternatives sous-quadratiques existantes sont contraintes à des compromis sur les données multidimensionnelles.
Les convolutions classiques sont dépourvues de champ récepteur global et de dépendance à l'entrée, tandis que les modèles récurrents nécessitent de dérouler une image ou un volume tridimensionnel selon un ordre de parcours artificiel unidimensionnel — un ordre qui détruit la structure spatiale d'origine des données.
Comment fonctionne HyenaND
HyenaND est un opérateur global, dépendant de l'entrée (input-dependent), qui agit directement sur la géométrie native des données multidimensionnelles via des convolutions à noyaux multidimensionnels paramétrés implicitement. Contrairement à une convolution classique, le noyau y est global et s'adapte à l'entrée spécifique.
La vitesse pratique est assurée par l'implémentation CUDA nSubQ : elle fusionne le chemin de convolution via la transformée de Fourier rapide (FFT) en un seul noyau, transformant la complexité théorique O(L log L) en accélération réelle en temps d'exécution.
- HyenaND — un opérateur sous-quadratique, global, input-dependent
- Fonctionne avec des images, des volumes 3D et des EDP sans déroulement en 1D
- Le noyau CUDA nSubQ fusionne le chemin de convolution FFT en une seule opération
- Complexité O(L log L) contre O(L²) pour l'attention
- Validé sur 4 domaines : génomique, vision, imagerie médicale, EDP
Ce qu'ont montré les expériences
Les piles HyenaND pures ont égalé en précision de solides baselines à base d'attention sur quatre types de tâches à la fois : génomique à contexte long, vision par ordinateur, imagerie médicale et modélisation d'équations aux dérivées partielles. Autrement dit, abandonner l'attention quadratique n'a coûté aucune qualité.
Les configurations hybrides se sont révélées encore plus solides : l'alternance de couches HyenaND et d'attention a surpassé à la fois l'attention pure et les hybrides forts fondés sur des modèles récurrents.
«
Les configurations hybrides alternant des couches HyenaND et attention surpassent à la fois l'attention pure et les solides hybrides fondés sur la récurrence », indique le résumé du preprint sur arXiv.
Ce que cela signifie
La course au remplacement de l'attention se déplace du texte unidimensionnel vers les données multidimensionnelles. HyenaND montre qu'il est possible de préserver la précision des transformers tout en supprimant le coût quadratique là où les données sont intrinsèquement bi- ou tridimensionnelles — en médecine, en biologie et en modélisation physique.
Questions fréquentes
Qu'est-ce que HyenaND ?
HyenaND est un opérateur sous-quadratique pour les réseaux de neurones, une alternative à l'attention. Il traite les données multidimensionnelles (images, volumes, EDP) dans leur géométrie native via des convolutions globales dépendantes de l'entrée et passe à l'échelle en O(L log L).
En quoi HyenaND diffère-t-il de l'attention ?
L'attention passe à l'échelle de façon quadratique — O(L²) selon la longueur de l'entrée. HyenaND offre le même champ récepteur global et la même dépendance à l'entrée, mais avec une complexité en O(L log L), et ne nécessite pas de dérouler les données multidimensionnelles en une séquence unidimensionnelle.
Où HyenaND est-il utilisé ?
D'après le preprint, HyenaND a été testé en génomique à contexte long, en vision par ordinateur, en imagerie médicale et en modélisation d'équations aux dérivées partielles.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.