Together AI lance MiniMax M3 avec un contexte de 1 million de tokens et une prise en charge multimodale
Together AI est devenu le partenaire cloud officiel de MiniMax pour le lancement de M3, avec jusqu'à 1 million de tokens de contexte et une multimodalité native. L'équipe de Together a écrit des noyaux spécialisés d'attention clairsemée et une passerelle de prétraitement en Rust : le débit a augmenté de 81 à 125 % selon la charge. Après la publication des poids ouverts, le modèle sera disponible comme API pour les développeurs directement sur la plateforme Together AI.
Traité par IA depuis Together AI Blog ; édité par Hamidun News
Together AI a Lancé MiniMax M3 avec un Contexte de 1 Million de Tokens et Multimodalité
Together AI a annoncé un partenariat avec MiniMax et a lancé le modèle M3 en production — avec un contexte jusqu'à un million de tokens, une multimodalité native et une accélération de l'inférence jusqu'à 125%.
Qu'est-ce que MiniMax M3
MiniMax M3 est le modèle phare de l'entreprise, créé pour des tâches d'agents du monde réel : documents longs, bases de code, images, invocations d'outils — tout dans un seul contexte. Les modèles précédents avaient des difficultés avec les contextes longs en raison de la complexité quadratique de l'auto-attention. M3 résout ce problème d'une manière fondamentalement différente.
Au cœur de l'architecture se trouve MiniMax Sparse Attention (MSA), un mécanisme d'attention partiellement dense par blocs. Chaque token de requête ne s'attaque qu'à un nombre limité de blocs KV-cache pertinents plutôt qu'à la séquence complète. De ce fait, la complexité computationnelle ne croît plus quadratiquement avec la longueur du contexte.
Comparé à M2.7 : l'accélération du pré-remplissage est 9x, l'accélération du décodage est 15x. Caractéristiques clés du M3 :
- Fenêtre de contexte — jusqu'à 1 million de tokens
- Multimodalité native : texte, code, images
- Support des scénarios d'agents et des invocations d'outils
- Résultats compétitifs sur les tâches de programmation
Comment Together AI a Préparé l'Infrastructure
Lancer un tel modèle en production sans perdre d'efficacité est non trivial. MSA suppose deux étapes lors du calcul de l'attention : d'abord, calculer la pertinence pour sélectionner les blocs KV, puis l'attention dense entre les tokens de requête et les blocs sélectionnés. Les implémentations standard ne gèrent pas cela bien.
L'équipe d'ingénierie de Together AI a écrit quatre optimisations clés :
- Noyau d'attention parcimonieuse KV-Block-Major — un noyau CUDA pour l'attention parcimonieuse sur les blocs de KV-cache avec réorganisation de la mémoire spécifique à MSA
- Décodage MSA paginé — intégration de l'attention paginée pour le décodage avec un contexte d'un million de tokens sans fragmentation mémoire
- Noyau de calcul d'index optimisé — calcul de pertinence accéléré pour la sélection des blocs KV à chaque étape de décodage
- Passerelle multimodale basée sur Rust — une passerelle de pré-traitement pour les images et les entrées mixtes avec une latence minimale
Au total, ces optimisations ont fourni des gains de débit de 81% à 125% à différents niveaux de charge — les mesures ont été prises sur NVIDIA B200.
Que Se Passe-t-il Ensuite
MiniMax M3 est déjà disponible via Together AI en tant que service cloud. Dans les prochains jours, les poids ouverts seront publiés — après quoi le modèle peut être déployé de manière indépendante ou utilisé directement comme un endpoint API sur la plateforme Together.
«
Le lancement de M3 en production confirme Together AI comme la plateforme privilégiée pour les modèles qui imposent de véritables exigences au niveau du système,» — du blog officiel de l'entreprise.
Ce Que Cela Signifie
La capacité de Together AI à déployer un modèle avec un contexte de 1M-tokens 81–125% plus efficacement qu'une approche standard est un signal compétitif au marché. Pour les développeurs, cela signifie un accès rapide à un puissant agent multimodal via une API simple sans avoir besoin de naviguer vous-même dans les nuances architecturales de MSA.
Vous voulez cesser de lire sur l'IA et commencer à l'utiliser?
AI News est un fil d'actualité IA. Hamidun Academy vous apprend à utiliser l'IA dans votre travail.
L'essentiel de l'IA — une fois par semaine
Sept actus qui ont vraiment compté, choisies à la main. Sans bruit ni communiqués.
C'est fait ! Vérifiez votre boîte mail pour la confirmation.