Le 8 octobre 2026, JetBrains a publié Mellum 2.1, la nouvelle version du modèle de code ouvert placé sous licence Apache 2.0 en juin. L'architecture n'a pas changé : c'est toujours un mixture-of-experts de 12 milliards de paramètres, dont 2,5 milliards actifs. Ce qui a changé, selon l'annonce officielle, c'est le post-entraînement.
Mellum 2 était rapide, mais JetBrains dit qu'il ne travaillait pas dans un dépôt au niveau souhaité. Après un été de reinforcement learning dans des environnements réels, avec des millions d'exécutions en sandbox, l'entreprise affirme que le 2.1 explore la base de code, édite des fichiers et vérifie ses propres modifications.
Ce que JetBrains a changé
Presque tout le travail de cette version est allé au post-entraînement, surtout au reinforcement learning. L'entreprise décrit trois axes :
- le RL n'est plus une courte étape finale, il est devenu la partie principale de l'entraînement ;
- de nouvelles tâches en mathématiques, programmation compétitive, sciences, usage d'outils et génie logiciel ont été ajoutées, avec filtrage de données ouvertes qui arrivaient avec des tests cassés ou des tâches impossibles ;
- l'infrastructure interne a fait tourner des milliers d'environnements et lancé des millions de sandboxes pendant l'entraînement.
Dans des comparaisons internes, JetBrains a mesuré Mellum 2.1 face à Mellum 2 et à deux modèles ouverts de classe proche, Qwen3.5-9B et Gemma 4 E4B, avec le même protocole. Le plus grand gain annoncé concerne le coding agentique. L'entreprise signale aussi des progrès en programmation, mathématiques, appel d'outils et connaissances générales. Ces chiffres viennent de JetBrains, pas d'un classement indépendant.
Vitesse et où il tourne
Comme le post-entraînement n'a pas touché l'architecture, la vitesse de base reste celle de Mellum 2. Avec le multi-token prediction, JetBrains dit que, sous forte charge, le 2.1 est le plus rapide du groupe comparé et sert presque deux fois plus de tokens que Qwen3.5-9B. Sur une requête isolée, le MTP le rendrait environ 1,6 fois plus rapide.
Les usages mis en avant sont un worker dans des systèmes agentiques, un assistant général hors code et un déploiement privé, en local ou sur une infrastructure propre. Les poids sont sur Hugging Face. Les builds GGUF pour llama.cpp, Ollama et LM Studio, ainsi que la tête de multi-token prediction pour le speculative decoding dans vLLM, ont été annoncés comme à venir, sans date.
Pour qui construit des agents de code, le point pratique est la taille : un modèle de 12B avec 2,5B actifs tient sur un matériel bien plus modeste que les modèles de frontière dans le cloud, avec la réserve que le saut de qualité agentique reste à mesurer hors du benchmark du fabricant.
Sources
Transparence : Ce contenu a été créé, édité ou relu avec l'aide de l'intelligence artificielle. Les informations ont été croisées avec des publications publiques sur X et des sources disponibles sur internet. Consultez les sources originales pour le contexte complet.
Par GeekikiBot