Together AI lanza MiniMax M3 con contexto de 1 millón de tokens y soporte multimodal
Together AI se convirtió en el socio oficial en la nube de MiniMax para el lanzamiento de M3, con contexto de hasta 1 millón de tokens y multimodalidad nativa. El equipo de Together escribió kernels específicos de atención dispersa y una pasarela de preprocesamiento en Rust: el rendimiento aumentó entre un 81% y un 125%, según la carga. Tras la publicación de los pesos abiertos, el modelo estará disponible como API para desarrolladores directamente en la plataforma de Together AI.
Procesado por IA desde Together AI Blog; editado por Hamidun News
Together AI Lanzó MiniMax M3 con Contexto de 1 Millón de Tokens y Multimodalidad
Together AI anunció una asociación con MiniMax y lanzó el modelo M3 en producción — con contexto hasta un millón de tokens, multimodalidad nativa y aceleración de inferencia hasta 125%.
¿Qué es MiniMax M3?
MiniMax M3 es el modelo insignia de la empresa, creado para tareas de agentes reales: documentos largos, bases de código, imágenes, invocaciones de herramientas — todo en un contexto. Los modelos anteriores tenían dificultades con contextos largos debido a la complejidad cuadrática de la autoatención. M3 resuelve este problema de manera fundamentalmente diferente.
En el centro de la arquitectura se encuentra MiniMax Sparse Attention (MSA), un mecanismo de atención disperso por bloques. Cada token de consulta atiende solo a un número limitado de bloques KV-cache relevantes en lugar de la secuencia completa. Por esto, la complejidad computacional ya no crece cuadráticamente con la longitud del contexto.
Comparado con M2.7: la aceleración de prefill es 9x, la aceleración de decodificación es 15x. Características clave de M3:
- Ventana de contexto — hasta 1 millón de tokens
- Multimodalidad nativa: texto, código, imágenes
- Soporte para escenarios de agentes e invocaciones de herramientas
- Resultados competitivos en tareas de programación
Cómo Together AI Preparó la Infraestructura
Lanzar tal modelo en producción sin perder eficiencia es no trivial. MSA asume dos etapas al calcular la atención: primero, calcular la relevancia para seleccionar bloques KV, luego atención densa entre tokens de consulta y bloques seleccionados. Las implementaciones estándar no manejan esto bien.
El equipo de ingeniería de Together AI escribió cuatro optimizaciones clave:
- Kernel de atención dispersa KV-Block-Major — un kernel CUDA para atención dispersa sobre bloques de KV-cache con reorganización de memoria específica para MSA
- Decodificación MSA paginada — integración de atención paginada para decodificación con contexto de millón de tokens sin fragmentación de memoria
- Kernel de puntuación de índice optimizado — cálculo de relevancia acelerado para selección de bloques KV en cada paso de decodificación
- Gateway multimodal basado en Rust — una puerta de enlace de preprocesamiento para imágenes y entradas mixtas con latencia mínima
En total, estas optimizaciones proporcionaron ganancias de rendimiento del 81% al 125% en varios niveles de carga — las mediciones se realizaron en NVIDIA B200.
¿Qué Sigue?
MiniMax M3 ya está disponible a través de Together AI como servicio en la nube. En los próximos días, se lanzarán pesos abiertos — después de lo cual el modelo se puede implementar de forma independiente o usar como un endpoint de API en la plataforma Together directamente.
"Lanzar M3 en producción confirma
Together AI como la plataforma preferida para modelos que imponen demandas de nivel de sistema real," — del blog oficial de la empresa.
Qué Significa Esto
La capacidad de Together AI para implementar un modelo con contexto de 1M-tokens 81–125% más eficiente que un enfoque estándar es una señal competitiva al mercado. Para los desarrolladores, significa acceso rápido a un poderoso agente multimodal a través de una API simple sin necesidad de trabajar a través de los matices arquitectónicos de MSA usted mismo.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.