Microsoft выпустила MAI-Cyber-1-Flash: 5B активных параметров и 95,95% на CyberGym
Microsoft AI выпустила MAI-Cyber-1-Flash — первую модель, заточенную под киберзащиту: 137 млрд параметров всего, 5 млрд активных, контекст 256к токенов. В связке со сканером MDASH она подняла результат на бенчмарке CyberGym до 95,95% против 88,45% в мае. Модель берёт на себя до 90% задач, а сложные 10% уходят на GPT-5.4 — заявленная экономия около 50%.
Procesado por IA desde MarkTechPost; editado por Hamidun News
Microsoft AI lanzó el 28 de julio de 2026 MAI-Cyber-1-Flash, su primer modelo creado específicamente para la ciberdefensa. Combinado con el harness de escaneo MDASH, elevó el resultado en el benchmark CyberGym al 95,95%, superando el récord anterior de la industria.
Qué tipo de modelo es MAI-Cyber-1-Flash
MAI-Cyber-1-Flash es un transformer disperso Mixture-of-Experts de Microsoft AI con 137 mil millones de parámetros en total, de los cuales 5 mil millones están activos, con una ventana de contexto de 256 mil tokens y entrada y salida únicamente de texto. Es un ajuste fino (fine-tune) especializado del modelo MAI-Code-1-Flash — un modelo agéntico ligero para código ya integrado en GitHub Copilot y VS Code, de la línea MAI-Thinking-1. El modelo no se ofrece como endpoint de API independiente: funciona únicamente dentro de MDASH.
- 137 mil millones de parámetros en total, 5 mil millones activos, arquitectura sparse MoE
- Contexto de 256 mil tokens, entrada y salida — solo texto
- Ajuste fino especializado de MAI-Code-1-Flash de la línea MAI-Thinking-1
- 95,95% en CyberGym level 1 — frente al 88,45% de MDASH en mayo de 2026
- El modelo asume hasta el 90% de las tareas de MDASH, el 10% más difícil pasa a GPT-5.4
Por qué el récord lo marca el enrutamiento, no el modelo
El resultado principal no lo aporta el modelo en sí, sino el sistema que lo rodea. MDASH gestiona más de 100 agentes especializados a través de cinco etapas: Prepare, Scan, Validate, Dedupe y Prove. El benchmark CyberGym es un conjunto público de 1507 tareas reales de reproducción de vulnerabilidades, recopiladas de 188 proyectos OSS-Fuzz; en la configuración level 1 se le da al sistema el código fuente vulnerable y una descripción general.
MAI-Cyber-1-Flash procesa hasta el 90% de todas las tareas de MDASH, y escala el 10% más complejo a GPT-5.4 — esto genera el ahorro declarado del 50% frente a la combinación anterior de GPT-5.4, 5.4 mini y 5.3 codex. El máximo anterior de MDASH en mayo de 2026 — 88,45% — se sostenía solo con modelos de acceso público y ya era el mejor resultado público, superando al competidor más cercano, con 83,1%, por unos cinco puntos.
«Sustituir el 80% de los modelos dentro de MDASH movió el harness del 88,4% al 95,95%», señala la descripción del lanzamiento del equipo de investigación de
Microsoft.
Por qué el modelo no sabe escribir exploits
Los ceros de MAI-Cyber-1-Flash en el benchmark ExploitGym (0/0/0 en las categorías Kernel, Userspace y Browser) no son un defecto, sino una decisión de Microsoft. Según afirma el equipo, el modelo fue entrenado para realizar tareas defensivas como el parcheo de errores, pero no ofensivas como el despliegue de código malicioso.
En el trabajo real, la combinación se mostró convincente. En mayo de 2026, un trabajo con la participación de MDASH produjo 16 CVE en la pila de red y autenticación de Windows, incluidas cuatro vulnerabilidades críticas de ejecución remota de código. De forma retrospectiva, el harness recuperó el 96% de 28 casos de MSRC en el controlador clfs.sys y el 100% de 7 casos en tcpip.sys en una ventana de cinco años. El propio MDASH fue creado por el equipo Autonomous Code Security, que incluye integrantes de Team Atlanta, ganador del DARPA AI Cyber Challenge.
Qué significa esto
Microsoft demuestra que los récords en la búsqueda de vulnerabilidades no los marca un único modelo grande, sino una orquestación inteligente de agentes especializados baratos: un modelo con 5 mil millones de parámetros activos carga con el 90% del trabajo y reduce el costo a la mitad, mientras que el modelo de frontera solo interviene en los casos más complejos.
Preguntas frecuentes
¿Qué es MDASH?
MDASH es el harness agéntico multimodelo de Microsoft para la búsqueda de vulnerabilidades. Gestiona más de 100 agentes a través de cinco etapas (Prepare, Scan, Validate, Dedupe, Prove) y en el benchmark CyberGym alcanza el 95,95%.
¿Por qué MAI-Cyber-1-Flash obtiene ceros en ExploitGym?
Es algo intencionado. Según Microsoft, el modelo se entrenó únicamente en tareas defensivas —por ejemplo, el parcheo de errores— y no se entrenó para escribir exploits ni código malicioso.
¿Cuánto más barata es la nueva combinación?
Microsoft declara un ahorro de alrededor del 50% frente a la configuración anterior de GPT-5.4, 5.4 mini y 5.3 codex, gracias a que MAI-Cyber-1-Flash asume hasta el 90% de las tareas, dejando solo el 10% difícil a GPT-5.4.
¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?
Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).
Lo esencial de la IA — una vez por semana
Siete historias que de verdad importaron, elegidas a mano. Sin ruido ni notas de prensa.
¡Listo! Revisa tu correo para la confirmación.