MarkTechPost→ original

Microsoft выпустила MAI-Cyber-1-Flash: 5B активных параметров и 95,95% на CyberGym

Microsoft AI выпустила MAI-Cyber-1-Flash — первую модель, заточенную под киберзащиту: 137 млрд параметров всего, 5 млрд активных, контекст 256к токенов. В связке со сканером MDASH она подняла результат на бенчмарке CyberGym до 95,95% против 88,45% в мае. Модель берёт на себя до 90% задач, а сложные 10% уходят на GPT-5.4 — заявленная экономия около 50%.

Processado por IA de MarkTechPost; editado por Hamidun News
Microsoft выпустила MAI-Cyber-1-Flash: 5B активных параметров и 95,95% на CyberGym
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

A Microsoft AI lançou em 28 de julho de 2026 o MAI-Cyber-1-Flash — seu primeiro modelo criado especificamente para a ciberdefesa. Combinado com o harness de varredura MDASH, ele elevou o resultado no benchmark CyberGym para 95,95%, superando o recorde anterior do setor.

Que tipo de modelo é o MAI-Cyber-1-Flash

O MAI-Cyber-1-Flash é um transformer esparso Mixture-of-Experts da Microsoft AI com 137 bilhões de parâmetros no total, dos quais 5 bilhões estão ativos, com janela de contexto de 256 mil tokens e entrada e saída somente em texto. É um fine-tune especializado do modelo MAI-Code-1-Flash — um modelo agente leve para código já integrado ao GitHub Copilot e ao VS Code, da linha MAI-Thinking-1. O modelo não é oferecido como endpoint de API separado: ele funciona apenas dentro do MDASH.

  • 137 bilhões de parâmetros no total, 5 bilhões ativos, arquitetura sparse MoE
  • Contexto de 256 mil tokens, entrada e saída — somente texto
  • Fine-tune especializado do MAI-Code-1-Flash da linha MAI-Thinking-1
  • 95,95% no CyberGym level 1 — contra 88,45% do MDASH em maio de 2026
  • O modelo assume até 90% das tarefas do MDASH, os 10% mais difíceis vão para o GPT-5.4

Por que o recorde é definido pelo roteamento, não pelo modelo

O principal resultado não vem do modelo em si, mas do sistema ao seu redor. O MDASH orquestra mais de 100 agentes especializados em cinco estágios: Prepare, Scan, Validate, Dedupe e Prove. O benchmark CyberGym é um conjunto público de 1507 tarefas reais de reprodução de vulnerabilidades, coletadas de 188 projetos OSS-Fuzz; na configuração level 1, o sistema recebe o código-fonte vulnerável e uma descrição geral.

O MAI-Cyber-1-Flash processa até 90% de todas as tarefas do MDASH, escalando os 10% mais complexos para o GPT-5.4 — isso gera a economia declarada de 50% em relação à combinação anterior de GPT-5.4, 5.4 mini e 5.3 codex. O máximo anterior do MDASH em maio de 2026 — 88,45% — foi alcançado usando apenas modelos de acesso público e já era o melhor resultado público, superando o concorrente mais próximo, com 83,1%, em cerca de cinco pontos.

"Substituir 80% dos modelos dentro do MDASH moveu o harness de 88,4% para 95,95%", afirma a descrição do lançamento da equipe de pesquisa da

Microsoft.

Por que o modelo não sabe escrever exploits

Os zeros do MAI-Cyber-1-Flash no benchmark ExploitGym (0/0/0 nas categorias Kernel, Userspace e Browser) não são um defeito, mas uma decisão da Microsoft. Segundo a equipe, o modelo foi treinado para executar tarefas defensivas, como o patching de bugs, mas não ofensivas, como a implantação de código malicioso.

No trabalho real, a combinação se mostrou convincente. Em maio de 2026, um trabalho envolvendo o MDASH gerou 16 CVEs na pilha de rede e autenticação do Windows, incluindo quatro vulnerabilidades críticas de execução remota de código. Retrospectivamente, o harness recuperou 96% de 28 casos do MSRC no driver clfs.sys e 100% de 7 casos no tcpip.sys em uma janela de cinco anos. O próprio MDASH foi criado pela equipe Autonomous Code Security, que inclui integrantes do Team Atlanta — vencedor do DARPA AI Cyber Challenge.

O que isso significa

A Microsoft mostra que os recordes na busca de vulnerabilidades não são definidos por um único modelo grande, mas por uma orquestração inteligente de agentes especializados baratos: um modelo com 5 bilhões de parâmetros ativos carrega 90% do trabalho e corta o custo pela metade, enquanto o modelo de fronteira entra em ação apenas nos casos mais complexos.

Perguntas frequentes

O que é o MDASH?

O MDASH é o harness agente multimodelo da Microsoft para busca de vulnerabilidades. Ele orquestra mais de 100 agentes em cinco estágios (Prepare, Scan, Validate, Dedupe, Prove) e alcança 95,95% no benchmark CyberGym.

Por que o MAI-Cyber-1-Flash tem zeros no ExploitGym?

Isso é proposital. Segundo a Microsoft, o modelo foi treinado apenas em tarefas defensivas — como o patching de bugs — e não foi treinado para escrever exploits ou código malicioso.

Quanto mais barata é a nova combinação?

A Microsoft declara uma economia de cerca de 50% em relação à configuração anterior de GPT-5.4, 5.4 mini e 5.3 codex — porque o MAI-Cyber-1-Flash assume até 90% das tarefas, deixando apenas os 10% difíceis para o GPT-5.4.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…