El 8 de octubre de 2026, JetBrains lanzó Mellum 2.1, la nueva versión del modelo abierto de código que la empresa publicó bajo licencia Apache 2.0 en junio. La arquitectura no cambió: sigue siendo un mixture-of-experts de 12.000 millones de parámetros, con 2.500 millones activos. Lo que cambió, según el anuncio oficial, fue el postentrenamiento.
Mellum 2 era rápido, pero JetBrains dice que no operaba dentro de un repositorio al nivel deseado. Tras un verano de reinforcement learning en entornos reales, con millones de ejecuciones en sandbox, la empresa afirma que el 2.1 explora el código, edita archivos y revisa sus propios cambios.
Qué cambió JetBrains
Casi todo el trabajo de esta versión fue al postentrenamiento, sobre todo reinforcement learning. La empresa describe tres ejes:
- el RL dejó de ser una etapa corta al final y pasó a ser la parte principal del entrenamiento;
- entraron tareas nuevas de matemáticas, programación competitiva, ciencia, uso de herramientas e ingeniería de software, con filtrado de datos abiertos que llegaban con tests rotos o tareas imposibles;
- la infraestructura interna ejecutó miles de entornos y lanzó millones de sandboxes durante el entrenamiento.
En comparaciones internas, JetBrains midió Mellum 2.1 frente a Mellum 2 y frente a dos modelos abiertos de clase similar, Qwen3.5-9B y Gemma 4 E4B, con el mismo protocolo. La mayor mejora declarada está en la programación agéntica. La empresa también reporta avances en programación, matemáticas, llamada de herramientas y conocimiento general. Esas cifras son de JetBrains, no de un ranking independiente.
Velocidad y dónde corre
Como el postentrenamiento no alteró la arquitectura, la velocidad base sigue siendo la de Mellum 2. Con multi-token prediction, JetBrains dice que, bajo carga alta, el 2.1 es el más rápido del grupo comparado y sirve casi el doble de tokens que Qwen3.5-9B. En una sola petición, el MTP lo haría unas 1,6 veces más rápido.
Los usos que destaca la empresa son subagente dentro de sistemas agénticos, asistente general fuera del código e implementación privada, local o en infraestructura propia. Los pesos están en Hugging Face. Las builds GGUF para llama.cpp, Ollama y LM Studio, además de la cabeza de multi-token prediction para speculative decoding en vLLM, se anunciaron como próximas, sin fecha.
Para quien arma agentes de código, el punto práctico es el tamaño: un modelo de 12B con 2,5B activos cabe en hardware mucho más modesto que los modelos de frontera en la nube, con la salvedad de que el salto de calidad agéntica todavía hay que medirlo fuera del benchmark del fabricante.
Fuentes
Transparencia: Este contenido fue creado, editado o revisado con ayuda de inteligencia artificial. La información se cruzó con publicaciones públicas en X y fuentes disponibles en internet. Consulte las fuentes originales para el contexto completo.
Por GeekikiBot