MiniMax M3: Nuevo Modelo con 1M Tokens, Multimodalidad y Computer Use
MiniMax reveló el modelo M3 con arquitectura MiniMax Sparse Attention, soporte para ventana de contexto de 1 millón de tokens, multimodalidad integrada (imágenes, video) y capacidad de control de computadora (computer use) para automatización.
Procesado por IA desde MarkTechPost; editado por Hamidun News
El 1 de junio de 2026, MiniMax lanzó un nuevo modelo, MiniMax M3, construido en la arquitectura MiniMax Sparse Attention (MSA) — con una ventana de contexto de 1 millón de tokens y soporte nativo para imágenes, video y modo computer use.
¿Cómo funciona la arquitectura MSA?
Sparse Attention es un enfoque donde un modelo no recalcula la atención entre todos los pares de tokens en una secuencia, como en la atención densa clásica, sino que se concentra en un subconjunto disperso de las conexiones más relevantes. Esto hace posible procesar secuencias significativamente más largas dentro del mismo presupuesto computacional. Es sobre este principio que se construye MiniMax Sparse Attention — una arquitectura que se convirtió en una solución de ingeniería clave que permitió a MiniMax M3 mantener una ventana de contexto de 1 millón de tokens sin crecimiento exponencial en costes de inferencia.
En un transformador denso clásico, la complejidad computacional del mecanismo de atención crece cuadráticamente con la longitud de la secuencia: duplicar el contexto significa un aumento de cuatro veces en los cálculos requeridos. Este crecimiento cuadrático ha sido históricamente la principal barrera técnica para los modelos con ventanas de contexto de millones de tokens — sin esquemas de atención dispersa u otros esquemas optimizados, la inferencia a tales longitudes se vuelve económicamente impráctica. Las soluciones arquitectónicas como MSA permiten a los laboratorios evitar esta limitación reduciendo la parte de cálculos dedicada a conexiones raramente utilizadas entre tokens distantes.
- Modelo: MiniMax M3
- Arquitectura: MiniMax Sparse Attention (MSA)
- Ventana de contexto: 1 millón de tokens
- Modalidades: imágenes nativas, video, computer use
- Adicional: soporte para agentic coding
- Fecha de lanzamiento: 1 de junio de 2026 (según MarkTechPost)
Multimodalidad y computer use "de serie"
MiniMax M3 se anuncia como un modelo con soporte nativo, no superpuesto, para imágenes y video — estas modalidades se procesan directamente por el modelo, no a través de adaptadores separados o conversión a descripciones de texto. Además, el modelo es compatible con el modo computer use — la capacidad de percibir el estado de una pantalla de computadora y realizar acciones (clics, entrada de texto, navegación de interfaces) para ejecución de tareas autónomas en aplicaciones gráficas. Combinado con un contexto largo, esto abre escenarios donde el modelo puede mantener grandes volúmenes de contexto visual y textual mientras ejecuta tareas de agentes de múltiples pasos.
¿Por qué un modelo necesita un millón de tokens de contexto?
Una ventana de contexto de 1 millón de tokens es comparable al tamaño de una base de código grande, documentación extensa o muchas horas de grabación de video en descripción de texto. Para tareas de agentic coding — la segunda capacidad anunciada en el lanzamiento — el contexto largo es crítico: un agente que trabaja en un proyecto real a menudo necesita mantener simultáneamente en la memoria muchos archivos, historial de cambios y resultados de ejecución de comandos sin perder el hilo de la tarea.
MiniMax es una empresa china que desarrolla modelos de lenguaje grandes y compite en el mercado con otros grandes desarrolladores de China y Estados Unidos, para quienes el contexto largo y la multimodalidad en los últimos años se han convertido en uno de los principales campos de competencia junto con la calidad pura de las respuestas. El soporte para agentic coding anunciado en el lanzamiento indica que MiniMax M3 se posiciona no simplemente como un modelo de diálogo sino como una herramienta para ser incrustada en conductos de desarrollo de agentes — es decir, en la misma clase de tareas donde los modelos que subyacen a productos como asistentes de codificación autónomos compiten actualmente.
El lanzamiento de MiniMax M3 se ajusta a la carrera general de los principales laboratorios por contexto largo y multimodalidad universal — una dirección en la que, además de MiniMax, otros desarrolladores de modelos compiten activamente con ventanas de contexto de cientos de miles a más de un millón de tokens. La apuesta por atención dispersa como forma de abaratar el procesamiento de secuencias largas es una de las respuestas arquitectónicas que diferentes laboratorios resuelven a su manera.
Para usuarios finales y desarrolladores, el significado práctico de tales lanzamientos se mide no tanto por los detalles arquitectónicos anunciados sino por qué escenarios se vuelven realmente disponibles: procesar un repositorio de código completo en una sola pasada, analizar video largo sin dividirlo en fragmentos, o un agente que puede mantener en contexto el historial completo de una sesión de trabajo de múltiples horas en una tarea. Es precisamente la combinación de contexto largo con multimodalidad nativa y computer use en un único modelo, en lugar de en un conjunto de herramientas dispares, lo que distingue lanzamientos como MiniMax M3 de generaciones anteriores de modelos donde cada una de estas capacidades tenía que ensamblarse a partir de componentes separados.
¿Quieres dejar de leer sobre IA y empezar a usarla?
AI News es un feed curado de noticias de IA. Hamidun Academy te enseña a usar la IA en tu trabajo.
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.