MarkTechPost→ original

JetBrains lançou a Mellum2 — um modelo MoE aberto de 12B para tarefas rápidas em pipelines de AI

A JetBrains lançou a Mellum2, um modelo de AI especializado para desenvolvedores, sob a licença Apache 2.0. A Mellum2 é baseada em uma arquitetura Mixture of Experts com 12 bilhões de parâmetros e foi treinada em 10,6 trilhões de tokens. O modelo não foi criado como um assistente de uso geral, mas como um componente rápido para integração em pipelines de desenvolvimento de AI com múltiplos modelos.

Processado por IA de MarkTechPost; editado por Hamidun News
JetBrains lançou a Mellum2 — um modelo MoE aberto de 12B para tarefas rápidas em pipelines de AI
Fonte: MarkTechPost. Colagem: Hamidun News.
◐ Ouvir artigo

JetBrains — a companhia que criou as ferramentas IDE IntelliJ IDEA e PyCharm usadas por dezenas de milhões de desenvolvedores — lançou Mellum2, uma versão atualizada de seu modelo de linguagem especializado. Mellum2 é lançado sob a licença Apache 2.0 e é projetado para processamento rápido de tarefas especializadas como parte de pipelines de IA multimodelo.

Mellum é a linha proprietária de JetBrains de modelos de linguagem para tarefas de programação. Mellum2 é uma atualização significativa: nova arquitetura MoE, volume de dados de treinamento escalado e posicionamento claro como componente especializado para sistemas multimodelo.

Arquitetura MoE e escala de treinamento

Mellum2 é construído em arquitetura Mixture of Experts (MoE) com 12 bilhões de parâmetros. Ao contrário de modelos densos clássicos onde todos os pesos de rede são ativados com cada solicitação, MoE divide o modelo em blocos de "especialistas" especializados e ativa apenas uma porção deles dependendo do tipo de token. Isto permite que o modelo funcione mais rápido e de forma mais econômica com a mesma capacidade.

Para pré-treinamento, JetBrains usou um corpus de 10,6 trilhões de tokens — uma escala comparável a modelos abertos emblemáticos como LLaMA 3 do Meta. Para um modelo de codificação, o volume de dados é criticamente importante: quanto mais ampla a cobertura de linguagens de programação, frameworks e documentação técnica, mais precisamente o modelo lida com tarefas em bases de código reais.

Papel em pipelines multimodelo

Mellum2 não aspira competir com assistentes universais como Claude ou GPT. Foi projetado como componente especializado rápido para passos específicos em fluxos de trabalho do desenvolvedor:

  • autocompletar de código em tempo real diretamente no IDE
  • refatoração rápida de funções pequenas e blocos de código
  • classificação de consultas e roteamento dentro de agentes de IA
  • geração de comentários e documentação inline
  • execução de passos intermediários "baratos" antes de passar uma tarefa para um modelo maior

O último cenário é chave. Sistemas de IA em produção para desenvolvimento são cada vez mais construídos como "orquestras de modelos": um modelo rápido leve processa solicitações rotineiras com latência mínima, um modelo emblemático pesado é acionado apenas para tarefas complexas que requerem raciocínio profundo. Mellum2 foi criado precisamente para o papel de especialista rápido em tais pipelines.

Licença Apache 2.0 de código aberto

Apache 2.0 é uma das licenças de código aberto mais liberais. Mellum2 pode ser incorporado em produtos corporativos fechados, ajustado em dados proprietários e usado em serviços comerciais sem pagamento de royalties para JetBrains. A companhia publica pesos de modelos em acesso aberto.

Entre modelos de codificação com pesos abertos existe competição significativa: Code Llama do Meta, DeepSeek-Coder, StarCoder, Qwen2.5-Coder. Mellum2 entra neste espaço com posicionamento específico — integração profunda no ecossistema IDE de JetBrains e o papel de componente especializado em pipelines multietapa, não uma tentativa de superar emblemáticos em benchmarks gerais de geração de código.

O que significa

Mellum2 é evidência de uma tendência importante: companhias que criam ferramentas para desenvolvedores estão se afastando de comprar IA de provedores externos e começam a treinar seus próprios modelos especializados para cenários específicos de usuários. JetBrains está apostando que integração profunda de IDE e especialização de domínio importam mais que superioridade abstrata em benchmarks universais. Para o desenvolvedor isto significa sugestões de IA mais rápidas diretamente no editor familiar — sem atrasos de API em nuvem e sem a necessidade de enviar código próprio para servidores de terceiros.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Precisa de IA funcionando dentro da sua empresa — não só no feed de notícias?

Eu construo IA em produção para empresas — CRM sob medida, ferramentas internas, agentes autônomos, automação de processos. Pertence a você, moldada ao seu processo, sem taxa por usuário. Feito por Zhemal Khamidun, CPO da AlpinaGPT (plataforma de IA, 6.000+ usuários).

O que você acha?
Carregando comentários…