Mamba-3 : une alternative aux transformers avec complexité linéaire
Mamba-3 est un nouveau modèle basé sur le State Space Model (SSM), développé par des chercheurs de Carnegie Mellon et Together AI. L'architecture est orientée vers les performances d'inférence plutôt que d'entraînement : elle surpasse Mamba-2 et même Llama-3.2-1B en vitesse de génération de texte. Les chercheurs ont publié des noyaux GPU optimisés, réalisant une complexité linéaire tout en maintenant une haute qualité.
Traité par IA depuis Together AI Blog ; édité par Hamidun News
Le 17 mars 2026, un groupe de recherche de Carnegie Mellon University, Princeton University, Cartesia AI et Together AI a publié un article sur une nouvelle architecture Mamba-3 — un modèle d'espace d'état (SSM), conçu principalement pour l'efficacité de l'inférence, et non de l'entraînement, contrairement à son prédécesseur Mamba-2. Le résultat principal : la variante Mamba-3 SISO surpasse Mamba-2, l'architecture Gated DeltaNet et même le transformateur Llama-3.2-1B en latence totale aux stades prefill et decode sur toutes les longueurs de séquence à l'échelle d'un modèle de 1.5 milliards de paramètres.
Faits clés sur la sortie
- Date de publication — 17 mars 2026
- Auteurs — Aakash Lahoti et Kevin Y. Li (Carnegie Mellon University), Berlin Chen et Caitlin Wang (Princeton University), Aviv Bick et J. Zico Kolter (Carnegie Mellon University), Tri Dao (Princeton University, Together AI), Albert Gu (Carnegie Mellon University, Cartesia AI)
- Échelle des tests — modèles au niveau de 1.5 milliards de paramètres
- Innovations architecturales clés — formule de récurrence plus expressive, suivi d'état à valeur complexe et variante MIMO (entrée multiple, sortie multiple)
- Code ouvert — noyaux computationnels en Triton, TileLang et CuTe DSL publiés en accès ouvert
Pourquoi Mamba-2 ne répond plus aux besoins de l'industrie?
Since le lancement de Mamba-2 à la mi-2024, la plupart des architectures basées sur SSM se sont tournées vers elle à partir de Mamba-1 : les développeurs ont parié que le principal goulot d'étranglement restait la vitesse d'entraînement, et ont simplifié le mécanisme SSM de base pour une accélération de l'entraînement de 2–8x par rapport à son prédécesseur — ce pari a payé et a assuré une adoption généralisée de Mamba-2 dans l'industrie. Mais depuis, le paysage des grands modèles de langage a notablement changé : bien que l'entraînement préalable reste important, beaucoup plus d'attention a été accordée à l'entraînement post-training et au déploiement — deux processus extrêmement exigeants en inférence. La mise à l'échelle des méthodes d'entraînement post-training, en particulier l'apprentissage par renforcement sur récompenses vérifiables (RLVR) pour les tâches de codage et de mathématiques, nécessite de générer des nombres énormes de rollouts, et les workflows d'agents — comme Codex, Claude Code ou OpenClaw — ont considérablement augmenté la demande d'inférence.
Malgré cela, de nombreuses architectures linéaires, y compris Mamba-2, ont été initialement développées avec une priorité sur l'entraînement : pour accélérer l'entraînement préalable, le mécanisme SSM de base a été progressivement simplifié — par exemple, la transition d'état a été réduite à un scalaire multiplié par une matrice d'identité, réduisant l'expressivité du modèle pour la vitesse d'entraînement.
Qu'est-ce que
Mamba-3 change et pourquoi une architecture optimisée pour l'inférence est-elle importante?
Mamba-3 inverse cette logique : l'équipe a restauré au modèle une formule de récurrence plus expressive et un suivi d'état à valeur complexe — des mécanismes que Mamba-2 a simplifiés pour la vitesse d'entraînement — et a également ajouté une variante MIMO qui augmente la précision sans ralentir le décodage. Le résultat — une architecture avec une latence d'inférence inférieure à celle de Mamba-2, Gated DeltaNet et même du transformateur classique Llama-3.2-1B, l'avantage se maintenant sur toutes les longueurs de séquence testées à l'échelle de 1.
5 milliards de paramètres. Parce que les architectures SSM traitent les séquences avec une complexité computationnelle linéaire plutôt que quadratique comme dans les transformateurs, l'avantage de Mamba-3 est particulièrement notable sur les contextes longs et sous charge élevée au stade de la génération — exactement là où la principale demande de l'industrie pour une inférence rapide et bon marché est concentrée.
Qu'est-ce que cela signifie pour l'industrie
La publication ouverte des noyaux computationnels en Triton, TileLang et CuTe DSL abaisse la barrière à l'entrée pour les équipes souhaitant implémenter Mamba-3 dans leur propre infrastructure d'inférence, et la collaboration entre les laboratoires universitaires (Carnegie Mellon University, Princeton University) et les acteurs industriels (Together AI, Cartesia AI) reflète une tendance plus large : la recherche architecturale de pointe est de plus en plus accompagnée immédiatement d'une infrastructure prête pour le déploiement pratique, plutôt que de rester seulement un résultat théorique sur papier. Pour le marché, cela signale que les alternatives aux transformateurs avec complexité computationnelle linéaire font la transition de la catégorie des expériences de laboratoire à la catégorie des candidats réels pour le rôle d'architecture de base pour les produits orientés vers l'inférence de la prochaine génération — des assistants agents aux services d'entraînement post-training à grande échelle.
Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?
Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.