JetBrains lance Mellum2.1 : modèle open 12B pour agents de code saute à 47% sur SWE-bench

JetBrains a publié cette semaine Mellum2.1, la mise à jour de son modèle open de 12 milliards de paramètres optimisé pour les agents de code. L'architecture reste la même que la version 2 — mixture-of-experts avec 2,5 milliards de paramètres actifs par token — mais le post-entraînement avec apprentissage par renforcement dans des dépôts réels a produit un saut significatif sur les tâches agentiques.

Ce qui a changé

Selon l'annonce officielle sur le blog JetBrains, Mellum2.1 a été entraîné avec reinforcement learning dans des environnements sandboxed qui simulent des dépôts réels. Le modèle peut désormais explorer des codebases, éditer des fichiers et vérifier ses propres modifications — des capacités que la version précédente n'atteignait pas de manière cohérente.

Sur SWE-bench Verified (corrections de bugs réels GitHub), le score est passé de 2,0% sur Mellum2 à 47,0%. Sur SWE-bench Pro, de 0% à 28%. Sur Terminal-Bench 2.1, de 0,6% à 17,4%. Sur LiveCodeBench v6, il a atteint 82,0, devant Qwen3.5-9B (75,4).

Comparé à Qwen3.5-9B dans les tests propres de JetBrains, Mellum2.1 mène sur les tâches courtes et le tool-calling, tandis que le modèle chinois reste meilleur sur les dépôts longs et plus complexes. Les chiffres proviennent de l'évaluation interne de l'entreprise ; des évaluations indépendantes à grande échelle n'ont pas encore été publiées.

Pourquoi cela compte

Pour les développeurs et studios de jeux qui veulent des agents de code s'exécutant sur leur propre matériel (sans dépendre d'APIs cloud), Mellum2.1 offre une option efficace sous licence Apache 2.0. JetBrains met en avant le débit : sous charge lourde sur une H200, le modèle sert presque le double de tokens de Qwen3.5-9B. Une tête de multi-token prediction, encore en préparation, promet d'accélérer encore les requêtes individuelles.

Le modèle est disponible sur Hugging Face sous JetBrains/Mellum2.1-12B-A2.5B-Thinking, avec un contexte de 131 072 tokens. Support vLLM déjà disponible ; Ollama et LM Studio ont été annoncés. Pas d'API hébergée officielle — le focus est le self-hosting.

Sources

Transparence : Ce contenu a été créé, édité ou révisé avec l'aide de l'intelligence artificielle. Les informations ont été croisées avec des publications publiques sur X et des sources disponibles sur internet. Consultez les sources originales pour vérifier le contexte complet.

Par GeekikiBot