Открытые против закрытых: GLM-5.2 и DeepSeek V4-Pro отстают уже на 4–7 месяцев
Институт безопасности ИИ Великобритании (AISI) впервые публично измерил, насколько открытые модели отстают от закрытых. Ответ: 4–7 месяцев против 6–10 годом ранее. GLM-5.2 догнала Claude Opus 4.6, а DeepSeek V4-Pro вышла на уровень Opus 4.5 — при этом один прогон кибертеста на ней стоит $1,19 против $85 у Opus.
Processado por IA de Import AI (Jack Clark); editado por Hamidun News
Em 20 de julho de 2026, o Instituto Britânico de Segurança de IA (AI Security Institute, AISI) publicou a primeira medição pública da defasagem entre modelos abertos e fechados: em tarefas de cibersegurança, ela caiu para 4–7 meses, ante 6–10 meses ao longo de quase todo 2025.
Quanto os modelos abertos estão atrás
Os modelos abertos GLM-5.2 e DeepSeek V4-Pro obtiveram, nos testes cibernéticos da AISI, um resultado equivalente ao de modelos fechados lançados 4–7 meses antes. Esta é a primeira tentativa do regulador de medir essa distância não "a olho", mas com base em um conjunto fixo de tarefas.
- GLM-5.2 (Zhipu, junho de 2026) igualou-se ao Claude Opus 4.6 da Anthropic (fevereiro de 2026) — uma defasagem de cerca de 4 meses
- DeepSeek V4-Pro atingiu o nível do Claude Opus 4.5 (novembro de 2025)
- A medição foi realizada em um conjunto fixo de tarefas de cibersegurança da AISI
- Um ano antes, durante quase todo 2025, a defasagem se manteve em 6–10 meses
- Em tarefas longas e de múltiplas etapas, o atraso é mais perceptível do que em testes cibernéticos restritos
"Os modelos abertos recentes GLM-5.2 e
DeepSeek V4-Pro atuam no mesmo nível de modelos fechados de fronteira lançados 4–7 meses antes", — do relatório analítico do AI Security Institute.
Por que isso importa para a defesa
A principal mudança não é tanto a velocidade quanto o preço. Segundo a AISI, uma única execução do teste CyberRange com uma cota de 100 milhões de tokens custa cerca de $85 no Claude Opus 4.5 ou 4.6, cerca de $46 no GLM-5.2 e apenas $1,19 no DeepSeek V4-Pro.
Uma diferença de dezenas de vezes significa que capacidades cibernéticas comparáveis se tornam disponíveis por uma fração do custo — e acabam em modelos abertos, que geralmente têm menos salvaguardas (safeguards) do que os fechados.
"Capacidades avançadas estão chegando a modelos abertos menos protegidos mais rápido do que antes", — afirma o comunicado do AI
Security Institute.
Kimi K3 e o plano de Hassabis
Jack Clark reforça a mesma tendência na newsletter Import AI com mais dois sinais. O primeiro é o anúncio do Kimi K3 da Moonshot AI: um modelo de 2,8 trilhões de parâmetros, cujos pesos e artigo científico a empresa promete divulgar nas próximas semanas. Segundo a descrição da Import AI, em uma única execução autônoma de 48 horas, o K3 projetou, otimizou e verificou um chip, além de construir o compilador MiniTriton.
O segundo sinal é uma proposta regulatória de Demis Hassabis, cofundador da DeepMind. Ele propõe criar um Standards Body setorial nos moldes do regulador financeiro americano FINRA: as empresas enviariam voluntariamente um novo modelo para revisão 30 dias antes do lançamento e, com o tempo, o regime voluntário seria transformado em lei.
"O
Standards Body será responsável por desenvolver protocolos de avaliação e pela interação com as agências federais competentes", — Demis Hassabis, cofundador da DeepMind, em uma publicação no X.
O que isso significa
Os modelos abertos deixam de ser "os que correm atrás um ano depois". Uma defasagem de 4–7 meses, combinada com um custo de inferência dezenas de vezes menor, desloca o equilíbrio: as capacidades de ponta chegam mais rápido a modelos com menos proteção, e é exatamente por isso que propostas como o regulador setorial de Hassabis entram em pauta.
Perguntas frequentes
O que é a defasagem entre modelos abertos e fechados?
É o tempo que os melhores modelos abertos levam para alcançar os fechados em tarefas específicas. Segundo a medição da AISI de 20 de julho de 2026, em cibersegurança ela é de 4–7 meses, ante 6–10 meses um ano antes.
Quanto os modelos abertos são mais baratos?
No teste CyberRange da AISI, uma execução no DeepSeek V4-Pro custou $1,19, no GLM-5.2 cerca de $46, e nos modelos fechados Claude Opus 4.5 e 4.6 cerca de $85, para a mesma cota de 100 milhões de tokens.
O que Demis Hassabis propõe?
Criar um Standards Body nos moldes da FINRA: envio voluntário de modelos para revisão 30 dias antes do lançamento, com a posterior transformação dessas regras em lei.
Quer parar de ler sobre IA e começar a usar?
AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.
O essencial da IA — uma vez por semana
Sete histórias que realmente importaram, escolhidas a dedo. Sem ruído nem releases.
Pronto! Verifique seu e-mail para a confirmação.