MarkTechPost→ original

JetBrains lanzó Mellum2 — un modelo MoE abierto de 12B para tareas rápidas en pipelines de AI

JetBrains lanzó Mellum2, un modelo de AI especializado para desarrolladores, bajo la licencia Apache 2.0. Mellum2 está basado en una arquitectura Mixture of Experts con 12.000 millones de parámetros y fue entrenado con 10,6 billones de tokens. El modelo no fue creado como un asistente de propósito general, sino como un componente rápido para integrarse en pipelines de desarrollo de AI con múltiples modelos.

Procesado por IA desde MarkTechPost; editado por Hamidun News
JetBrains lanzó Mellum2 — un modelo MoE abierto de 12B para tareas rápidas en pipelines de AI
Fuente: MarkTechPost. Collage: Hamidun News.
◐ Escuchar artículo

JetBrains — la compañía que creó las herramientas IDE IntelliJ IDEA y PyCharm utilizadas por decenas de millones de desarrolladores — ha lanzado Mellum2, una versión actualizada de su modelo de lenguaje especializado. Mellum2 se lanza bajo la licencia Apache 2.0 y está diseñado para el procesamiento rápido de tareas especializadas como parte de canalizaciones de IA multimodelo.

Mellum es la línea propietaria de JetBrains de modelos de lenguaje para tareas de programación. Mellum2 es una actualización significativa: nueva arquitectura MoE, volumen de datos de entrenamiento escalado y posicionamiento claro como componente especializado para sistemas multimodelo.

Arquitectura MoE y escala de entrenamiento

Mellum2 se construye sobre la arquitectura Mixture of Experts (MoE) con 12 mil millones de parámetros. A diferencia de los modelos densos clásicos donde todos los pesos de la red se activan con cada solicitud, MoE divide el modelo en bloques de "expertos" especializados y activa solo una porción de ellos según el tipo de token. Esto permite que el modelo funcione más rápido y de manera más económica con la misma capacidad.

Para el preentrenamiento, JetBrains utilizó un corpus de 10,6 billones de tokens — una escala comparable a modelos abiertos insignia como LLaMA 3 de Meta. Para un modelo de codificación, el volumen de datos es críticamente importante: cuanto más amplia sea la cobertura de lenguajes de programación, frameworks y documentación técnica, más precisamente el modelo maneja tareas en bases de código reales.

Rol en tuberías multimodelo

Mellum2 no aspira a competir con asistentes universales como Claude o GPT. Fue diseñado como componente especializado rápido para pasos específicos en flujos de trabajo de desarrolladores:

  • autocompletado de código en tiempo real directamente en el IDE
  • refactorización rápida de funciones pequeñas y bloques de código
  • clasificación de consultas y enrutamiento dentro de agentes de IA
  • generación de comentarios y documentación inline
  • ejecución de pasos intermedios "baratos" antes de pasar una tarea a un modelo más grande

El último escenario es clave. Los sistemas de IA de producción para desarrollo se construyen cada vez más como "orquestas de modelos": un modelo rápido ligero procesa solicitudes rutinarias con latencia mínima, un modelo insignia pesado se activa solo para tareas complejas que requieren razonamiento profundo. Mellum2 fue creado precisamente para el rol de especialista rápido en tales tuberías.

Licencia Apache 2.0 de código abierto

Apache 2.0 es una de las licencias de código abierto más liberales. Mellum2 puede integrarse en productos corporativos cerrados, ajustarse en datos propios y utilizarse en servicios comerciales sin pagos de regalías a JetBrains. La compañía publica pesos de modelos en acceso abierto.

Entre modelos de codificación con pesos abiertos existe competencia significativa: Code Llama de Meta, DeepSeek-Coder, StarCoder, Qwen2.5-Coder. Mellum2 entra en este espacio con posicionamiento específico — integración profunda en el ecosistema IDE de JetBrains y el papel de componente especializado en tuberías multietapa, no un intento de superar a los insignia en puntos de referencia generales de generación de código.

Qué significa

Mellum2 es evidencia de una tendencia importante: las compañías que crean herramientas para desarrolladores se están alejando de comprar IA a proveedores externos y comenzando a entrenar sus propios modelos especializados para escenarios de usuario específicos. JetBrains está apostando que la integración profunda de IDE y la especialización de dominio importan más que la superioridad abstracta en puntos de referencia universales. Para el desarrollador esto significa sugerencias de IA más rápidas directamente en el editor familiar — sin retrasos de API en la nube y sin la necesidad de enviar código propio a servidores de terceros.

ZK
Hamidun News
Noticias de AI sin ruido. Selección editorial diaria de más de 50 fuentes. Producto de Zhemal Khamidun, Head of AI en Alpina Digital.

¿Necesitas IA funcionando dentro de tu empresa — no solo en tu feed de noticias?

Construyo IA en producción para empresas — CRM a medida, herramientas internas, agentes autónomos, automatización de procesos. Tuya, adaptada a tu proceso, sin coste por usuario. Creado por Zhemal Khamidun, CPO de AlpinaGPT (plataforma de IA, 6.000+ usuarios).

¿Qué te parece?
Cargando comentarios…