Mamba-3: alternativa a transformers con complejidad lineal
Mamba-3 es un nuevo modelo basado en State Space Model (SSM), desarrollado por investigadores de Carnegie Mellon y Together AI. La arquitectura está orientada al desempeño de inferencia en lugar de entrenamiento: supera a Mamba-2 e incluso a Llama-3.2-1B en velocidad de generación de texto. Los investigadores publicaron kernels GPU optimizados, logrando complejidad lineal manteniendo alta calidad.
Procesado por IA desde Together AI Blog; editado por Hamidun News
El 17 de marzo de 2026, un grupo de investigación de Carnegie Mellon University, Princeton University, Cartesia AI y Together AI publicó un artículo sobre una nueva arquitectura Mamba-3 — un modelo de espacio de estados (SSM), diseñado principalmente para la eficiencia de la inferencia, no del entrenamiento, a diferencia de su predecesor Mamba-2. El resultado principal: la variante Mamba-3 SISO supera a Mamba-2, la arquitectura Gated DeltaNet e incluso el transformador Llama-3.2-1B en la latencia total en los estadios prefill y decode en todas las longitudes de secuencia en una escala de modelo de 1.5 mil millones de parámetros.
Hechos clave sobre el lanzamiento
- Fecha de publicación — 17 de marzo de 2026
- Autores — Aakash Lahoti y Kevin Y. Li (Carnegie Mellon University), Berlin Chen y Caitlin Wang (Princeton University), Aviv Bick y J. Zico Kolter (Carnegie Mellon University), Tri Dao (Princeton University, Together AI), Albert Gu (Carnegie Mellon University, Cartesia AI)
- Escala de pruebas — modelos a nivel de 1.5 mil millones de parámetros
- Innovaciones arquitectónicas clave — fórmula de recurrencia más expresiva, seguimiento de estado de valor complejo y variante MIMO (multi-entrada, multi-salida)
- Código abierto — kernels computacionales en Triton, TileLang y CuTe DSL publicados en acceso abierto
¿Por qué
Mamba-2 ya no cumple con las necesidades de la industria?
Desde el lanzamiento de Mamba-2 a mediados de 2024, la mayoría de arquitecturas basadas en SSM han cambiado a ella desde Mamba-1: los desarrolladores apostaron a que el principal cuello de botella seguía siendo la velocidad de entrenamiento, y simplificaron el mecanismo SSM básico para 2–8 veces la aceleración del entrenamiento en comparación con su predecesor — esta apuesta valió la pena y aseguró una amplia adopción de Mamba-2 en la industria. Pero desde entonces, el panorama de los grandes modelos de lenguaje ha cambiado notablemente: aunque el preentrenamiento sigue siendo importante, mucha más atención se ha prestado al post-entrenamiento y al despliegue — ambos procesos que son extremadamente exigentes en inferencia. El escalado de métodos de post-entrenamiento, especialmente el aprendizaje por refuerzo en recompensas verificables (RLVR) para tareas de codificación y matemáticas, requiere generar enormes cantidades de rollouts, y los flujos de trabajo de agentes — como Codex, Claude Code u OpenClaw — han aumentado drásticamente la demanda de inferencia.
A pesar de esto, muchas arquitecturas lineales, incluyendo Mamba-2, fueron originalmente desarrolladas con prioridad en el entrenamiento: para acelerar el preentrenamiento, el mecanismo SSM básico fue progresivamente simplificado — por ejemplo, la transición de estado fue reducida a un escalar multiplicado por una matriz de identidad, reduciendo la expresividad del modelo por velocidad de entrenamiento.
¿Qué cambia
Mamba-3 y por qué importa una arquitectura optimizada para inferencia?
Mamba-3 invierte esta lógica: el equipo restauró al modelo una fórmula de recurrencia más expresiva y seguimiento de estado de valor complejo — mecanismos que Mamba-2 simplificó por velocidad de entrenamiento — y también agregó una variante MIMO que aumenta la precisión sin ralentizar la decodificación. El resultado — una arquitectura con latencia de inferencia menor que Mamba-2, Gated DeltaNet e incluso el transformador clásico Llama-3.2-1B, con la ventaja manteniéndose en todas las longitudes de secuencia probadas en una escala de 1.
5 mil millones de parámetros. Porque las arquitecturas SSM procesan secuencias con complejidad computacional lineal en lugar de cuadrática como en transformadores, la ventaja de Mamba-3 es particularmente notable en contextos largos y bajo alta carga en el estadio de generación — exactamente donde hoy la principal demanda de la industria de inferencia rápida y barata está concentrada.
Qué significa esto para la industria
La publicación abierta de kernels computacionales en Triton, TileLang y CuTe DSL baja la barrera de entrada para equipos que quieren implementar Mamba-3 en su propia infraestructura de inferencia, y la colaboración entre laboratorios académicos (Carnegie Mellon University, Princeton University) y jugadores industriales (Together AI, Cartesia AI) refleja una tendencia más amplia: la investigación arquitectónica de vanguardia es cada vez más acompañada de inmediato por infraestructura lista para el despliegue práctico, en lugar de seguir siendo solo un resultado teórico en papel. Para el mercado, esto señala que las alternativas a transformadores con complejidad computacional lineal están haciendo la transición de la categoría de experimentos de laboratorio a la categoría de candidatos reales para el rol de arquitectura base para productos orientados a la inferencia de la próxima generación — desde asistentes de agentes hasta servicios de post-entrenamiento a gran escala.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.