MarkTechPost→ original

Microsoft выпустила MAI-Cyber-1-Flash: 5B активных параметров и 95,95% на CyberGym

Microsoft AI выпустила MAI-Cyber-1-Flash — первую модель, заточенную под киберзащиту: 137 млрд параметров всего, 5 млрд активных, контекст 256к токенов. В связке со сканером MDASH она подняла результат на бенчмарке CyberGym до 95,95% против 88,45% в мае. Модель берёт на себя до 90% задач, а сложные 10% уходят на GPT-5.4 — заявленная экономия около 50%.

Traité par IA depuis MarkTechPost ; édité par Hamidun News
Microsoft выпустила MAI-Cyber-1-Flash: 5B активных параметров и 95,95% на CyberGym
Source : MarkTechPost. Collage: Hamidun News.
◐ Écouter l'article

Microsoft AI a lancé le 28 juillet 2026 MAI-Cyber-1-Flash, son premier modèle conçu spécifiquement pour la cyberdéfense. Associé au harness de scan MDASH, il a fait grimper le score sur le benchmark CyberGym à 95,95%, battant le précédent record du secteur.

Quel genre de modèle est MAI-Cyber-1-Flash

MAI-Cyber-1-Flash est un transformer épars Mixture-of-Experts de Microsoft AI comptant 137 milliards de paramètres au total, dont 5 milliards actifs, avec une fenêtre de contexte de 256 000 tokens et une entrée/sortie uniquement textuelle. C'est un fine-tuning spécialisé du modèle MAI-Code-1-Flash — un modèle agentique léger pour le code déjà intégré à GitHub Copilot et VS Code, de la gamme MAI-Thinking-1. Le modèle n'est pas proposé comme point de terminaison API distinct : il ne fonctionne qu'au sein de MDASH.

  • 137 milliards de paramètres au total, 5 milliards actifs, architecture sparse MoE
  • Contexte de 256 000 tokens, entrée et sortie — texte uniquement
  • Fine-tuning spécialisé de MAI-Code-1-Flash de la gamme MAI-Thinking-1
  • 95,95% sur CyberGym level 1 — contre 88,45% pour MDASH en mai 2026
  • Le modèle prend en charge jusqu'à 90% des tâches de MDASH, les 10% les plus difficiles reviennent à GPT-5.4

Pourquoi le record vient du routage, et non du modèle

Le résultat principal ne vient pas du modèle lui-même, mais du système qui l'entoure. MDASH orchestre plus de 100 agents spécialisés à travers cinq étapes : Prepare, Scan, Validate, Dedupe et Prove. Le benchmark CyberGym est un ensemble public de 1507 tâches réelles de reproduction de vulnérabilités, rassemblées à partir de 188 projets OSS-Fuzz ; dans la configuration level 1, le système reçoit le code source vulnérable et une description générale.

MAI-Cyber-1-Flash traite jusqu'à 90% de toutes les tâches de MDASH, en faisant remonter les 10% les plus complexes vers GPT-5.4 — ce qui procure l'économie annoncée de 50% par rapport à la combinaison précédente de GPT-5.4, 5.4 mini et 5.3 codex. Le précédent maximum de MDASH en mai 2026 — 88,45% — reposait uniquement sur des modèles accessibles au public et constituait déjà le meilleur résultat public, devançant d'environ cinq points son plus proche concurrent, à 83,1%.

«

Remplacer 80% des modèles au sein de MDASH a fait passer le harness de 88,4% à 95,95% », indique la description de la version publiée par l'équipe de recherche de Microsoft.

Pourquoi le modèle ne sait pas écrire d'exploits

Les zéros de MAI-Cyber-1-Flash sur le benchmark ExploitGym (0/0/0 pour les catégories Kernel, Userspace et Browser) ne sont pas un défaut, mais une décision de Microsoft. Selon l'équipe, le modèle a été entraîné à effectuer des tâches défensives comme le patching de bugs, mais pas des tâches offensives comme le déploiement de code malveillant.

Sur le terrain, l'association s'est montrée convaincante. En mai 2026, des travaux impliquant MDASH ont permis de découvrir 16 CVE dans la pile réseau et d'authentification de Windows, dont quatre vulnérabilités critiques d'exécution de code à distance. Rétrospectivement, le harness a retrouvé 96% des 28 cas MSRC dans le pilote clfs.sys et 100% des 7 cas dans tcpip.sys sur une fenêtre de cinq ans. MDASH lui-même a été créé par l'équipe Autonomous Code Security, qui compte des membres de Team Atlanta, vainqueur du DARPA AI Cyber Challenge.

Ce que cela signifie

Microsoft montre que les records en matière de recherche de vulnérabilités ne sont pas établis par un seul grand modèle, mais par une orchestration intelligente d'agents spécialisés peu coûteux : un modèle à 5 milliards de paramètres actifs assure 90% du travail et réduit la facture de moitié, tandis que le modèle de pointe n'intervient que sur les cas les plus complexes.

Questions fréquentes

Qu'est-ce que MDASH ?

MDASH est le harness agentique multimodèle de Microsoft pour la recherche de vulnérabilités. Il orchestre plus de 100 agents à travers cinq étapes (Prepare, Scan, Validate, Dedupe, Prove) et atteint 95,95% sur le benchmark CyberGym.

Pourquoi MAI-Cyber-1-Flash obtient-il des zéros sur

ExploitGym ?

C'est délibéré. Selon Microsoft, le modèle n'a été entraîné qu'à des tâches défensives — comme le patching de bugs — et non à écrire des exploits ou du code malveillant.

Dans quelle mesure la nouvelle combinaison est-elle moins coûteuse ?

Microsoft annonce une économie d'environ 50% par rapport à la configuration précédente de GPT-5.4, 5.4 mini et 5.3 codex — grâce au fait que MAI-Cyber-1-Flash prend en charge jusqu'à 90% des tâches, ne laissant que les 10% difficiles à GPT-5.4.

ZK
Hamidun News
Actualités IA sans bruit. Sélection éditoriale quotidienne de plus de 50 sources. Produit de Zhemal Khamidun, Head of AI chez Alpina Digital.

Besoin d'une IA qui travaille dans votre entreprise — pas seulement dans votre fil d'actualité?

Je construis de l'IA en production pour les entreprises — CRM sur mesure, outils internes, agents autonomes, automatisation des processus. Vous en êtes propriétaire, adaptée à votre processus, sans coût par utilisateur. Réalisé par Zhemal Khamidun, CPO d'AlpinaGPT (plateforme IA, 6 000+ utilisateurs).

Qu'en pensez-vous ?
Chargement des commentaires…