MiniMax M3: Nouveau Modèle avec 1M Tokens, Multimodalité et Computer Use
MiniMax a dévoilé le modèle M3 avec l'architecture MiniMax Sparse Attention, prenant en charge une fenêtre de contexte d'un million de jetons, multimodalité intégrée (images, vidéo) et capacité de contrôle d'ordinateur (computer use) pour l'automatisation.
Traité par IA depuis MarkTechPost ; édité par Hamidun News
Le 1er juin 2026, MiniMax a lancé un nouveau modèle, MiniMax M3, construit sur l'architecture MiniMax Sparse Attention (MSA) — avec une fenêtre de contexte de 1 million de tokens et support natif des images, vidéo et mode computer use.
Comment fonctionne l'architecture MSA ?
Sparse Attention est une approche où un modèle ne recalcule pas l'attention entre toutes les paires de tokens dans une séquence, comme dans l'attention dense classique, mais se concentre sur un sous-ensemble clairsemé des connexions les plus pertinentes. Cela permet de traiter des séquences significativement plus longues au sein du même budget de calcul. C'est sur ce principe que MiniMax Sparse Attention est construit — une architecture qui est devenue une solution d'ingénierie clé permettant à MiniMax M3 de maintenir une fenêtre de contexte de 1 million de tokens sans croissance exponentielle des coûts d'inférence.
Dans un transformateur dense classique, la complexité informatique du mécanisme d'attention croît quadratiquement avec la longueur de la séquence : doubler le contexte signifie une augmentation de quatre fois des calculs requis. Cette croissance quadratique a historiquement été la principale barrière technique aux modèles avec des fenêtres de contexte de millions de tokens — sans schémas d'attention clairsemés ou d'autres schémas optimisés, l'inférence à de telles longueurs devient économiquement impraticable. Les solutions architecturales comme MSA permettent aux laboratoires de contourner cette limitation en réduisant la part des calculs consacrés aux connexions rarement utilisées entre les tokens distants.
- Modèle : MiniMax M3
- Architecture : MiniMax Sparse Attention (MSA)
- Fenêtre de contexte : 1 million de tokens
- Modalités : images natives, vidéo, computer use
- Supplémentaire : support pour agentic coding
- Date de sortie : 1er juin 2026 (selon MarkTechPost)
Multimodalité et computer use « prêt à l'emploi »
MiniMax M3 est annoncé comme un modèle avec support natif, non superposé, des images et vidéos — ces modalités sont traitées directement par le modèle, pas à travers des adaptateurs séparés ou une conversion en descriptions textuelles. De plus, le modèle supporte le mode computer use — la capacité de percevoir l'état d'un écran d'ordinateur et d'effectuer des actions (clics, saisie de texte, navigation d'interface) pour l'exécution autonome de tâches dans les applications graphiques. Combiné avec un contexte long, cela ouvre des scénarios où le modèle peut conserver de grands volumes de contexte visuel et textuel lors de l'exécution de tâches d'agents multi-étapes.
Pourquoi un modèle a-t-il besoin d'un million de tokens de contexte ?
Une fenêtre de contexte d'un million de tokens est comparable à la taille d'une grande base de code, d'une documentation étendue ou d'enregistrements vidéo de plusieurs heures en description textuelle. Pour les tâches de agentic coding — la deuxième capacité annoncée dans la version — le contexte long est critique : un agent travaillant sur un projet réel a souvent besoin de maintenir simultanément en mémoire de nombreux fichiers, l'historique des modifications et les résultats de l'exécution des commandes sans perdre le fil de la tâche.
MiniMax est une entreprise chinoise développant des grands modèles de langage et concourant sur le marché avec d'autres grands développeurs de la Chine et des États-Unis, pour lesquels le contexte long et la multimodalité ces dernières années sont devenus l'un des principaux domaines de compétition aux côtés de la qualité pure des réponses. Le support du agentic coding annoncé dans la version indique que MiniMax M3 est positionné non pas simplement comme un modèle de dialogue mais comme un outil à intégrer dans les pipelines de développement d'agents — c'est-à-dire dans la même classe de tâches où les modèles qui sous-tendent des produits comme les assistants de codage autonomes concourent actuellement.
La sortie de MiniMax M3 s'inscrit dans la course générale des grands laboratoires pour le contexte long et la multimodalité universelle — une direction dans laquelle, en plus de MiniMax, d'autres développeurs de modèles concourent activement avec des fenêtres de contexte de centaines de milliers à plus d'un million de tokens. Le pari sur l'attention clairsemée comme moyen de réduire les coûts du traitement de longues séquences est l'une des réponses architecturales que différents laboratoires résolvent à leur manière.
Pour les utilisateurs finaux et les développeurs, la signification pratique de telles versions se mesure non pas tant par les détails architecturaux annoncés que par les scénarios qui deviennent réellement disponibles : traiter un dépôt de code entier en une seule passage, analyser une longue vidéo sans la diviser en fragments, ou un agent qui peut conserver en contexte l'historique complet d'une session de travail de plusieurs heures sur une tâche. C'est précisément la combinaison d'un contexte long avec la multimodalité native et le computer use dans un seul modèle, plutôt que dans un ensemble d'outils disparates, qui distingue les versions comme MiniMax M3 des générations antérieures de modèles où chacune de ces capacités devait être assemblée à partir de composants séparés.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.