Microsoft выпустила MAI-Cyber-1-Flash: 5B активных параметров и 95,95% на CyberGym
Microsoft AI выпустила MAI-Cyber-1-Flash — первую модель, заточенную под киберзащиту: 137 млрд параметров всего, 5 млрд активных, контекст 256к токенов. В связке со сканером MDASH она подняла результат на бенчмарке CyberGym до 95,95% против 88,45% в мае. Модель берёт на себя до 90% задач, а сложные 10% уходят на GPT-5.4 — заявленная экономия около 50%.
Processado por IA de MarkTechPost; editado por Hamidun News
A Microsoft AI lançou em 28 de julho de 2026 o MAI-Cyber-1-Flash — seu primeiro modelo criado especificamente para a ciberdefesa. Combinado com o harness de varredura MDASH, ele elevou o resultado no benchmark CyberGym para 95,95%, superando o recorde anterior do setor.
Que tipo de modelo é o MAI-Cyber-1-Flash
O MAI-Cyber-1-Flash é um transformer esparso Mixture-of-Experts da Microsoft AI com 137 bilhões de parâmetros no total, dos quais 5 bilhões estão ativos, com janela de contexto de 256 mil tokens e entrada e saída somente em texto. É um fine-tune especializado do modelo MAI-Code-1-Flash — um modelo agente leve para código já integrado ao GitHub Copilot e ao VS Code, da linha MAI-Thinking-1. O modelo não é oferecido como endpoint de API separado: ele funciona apenas dentro do MDASH.
- 137 bilhões de parâmetros no total, 5 bilhões ativos, arquitetura sparse MoE
- Contexto de 256 mil tokens, entrada e saída — somente texto
- Fine-tune especializado do MAI-Code-1-Flash da linha MAI-Thinking-1
- 95,95% no CyberGym level 1 — contra 88,45% do MDASH em maio de 2026
- O modelo assume até 90% das tarefas do MDASH, os 10% mais difíceis vão para o GPT-5.4
Por que o recorde é definido pelo roteamento, não pelo modelo
O principal resultado não vem do modelo em si, mas do sistema ao seu redor. O MDASH orquestra mais de 100 agentes especializados em cinco estágios: Prepare, Scan, Validate, Dedupe e Prove. O benchmark CyberGym é um conjunto público de 1507 tarefas reais de reprodução de vulnerabilidades, coletadas de 188 projetos OSS-Fuzz; na configuração level 1, o sistema recebe o código-fonte vulnerável e uma descrição geral.
O MAI-Cyber-1-Flash processa até 90% de todas as tarefas do MDASH, escalando os 10% mais complexos para o GPT-5.4 — isso gera a economia declarada de 50% em relação à combinação anterior de GPT-5.4, 5.4 mini e 5.3 codex. O máximo anterior do MDASH em maio de 2026 — 88,45% — foi alcançado usando apenas modelos de acesso público e já era o melhor resultado público, superando o concorrente mais próximo, com 83,1%, em cerca de cinco pontos.
"Substituir 80% dos modelos dentro do MDASH moveu o harness de 88,4% para 95,95%", afirma a descrição do lançamento da equipe de pesquisa da
Microsoft.
Por que o modelo não sabe escrever exploits
Os zeros do MAI-Cyber-1-Flash no benchmark ExploitGym (0/0/0 nas categorias Kernel, Userspace e Browser) não são um defeito, mas uma decisão da Microsoft. Segundo a equipe, o modelo foi treinado para executar tarefas defensivas, como o patching de bugs, mas não ofensivas, como a implantação de código malicioso.
No trabalho real, a combinação se mostrou convincente. Em maio de 2026, um trabalho envolvendo o MDASH gerou 16 CVEs na pilha de rede e autenticação do Windows, incluindo quatro vulnerabilidades críticas de execução remota de código. Retrospectivamente, o harness recuperou 96% de 28 casos do MSRC no driver clfs.sys e 100% de 7 casos no tcpip.sys em uma janela de cinco anos. O próprio MDASH foi criado pela equipe Autonomous Code Security, que inclui integrantes do Team Atlanta — vencedor do DARPA AI Cyber Challenge.
O que isso significa
A Microsoft mostra que os recordes na busca de vulnerabilidades não são definidos por um único modelo grande, mas por uma orquestração inteligente de agentes especializados baratos: um modelo com 5 bilhões de parâmetros ativos carrega 90% do trabalho e corta o custo pela metade, enquanto o modelo de fronteira entra em ação apenas nos casos mais complexos.
Perguntas frequentes
O que é o MDASH?
O MDASH é o harness agente multimodelo da Microsoft para busca de vulnerabilidades. Ele orquestra mais de 100 agentes em cinco estágios (Prepare, Scan, Validate, Dedupe, Prove) e alcança 95,95% no benchmark CyberGym.
Por que o MAI-Cyber-1-Flash tem zeros no ExploitGym?
Isso é proposital. Segundo a Microsoft, o modelo foi treinado apenas em tarefas defensivas — como o patching de bugs — e não foi treinado para escrever exploits ou código malicioso.
Quanto mais barata é a nova combinação?
A Microsoft declara uma economia de cerca de 50% em relação à configuração anterior de GPT-5.4, 5.4 mini e 5.3 codex — porque o MAI-Cyber-1-Flash assume até 90% das tarefas, deixando apenas os 10% difíceis para o GPT-5.4.
Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?
Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.