JetBrains 发布 Mellum2.1:12B 开源代码代理模型在 SWE-bench 上跃升至 47%

JetBrains 本周发布了 Mellum2.1,这是其面向代码代理的开源 12 亿参数模型的更新。架构与第 2 版相同 —— 混合专家模型,每个 token 激活 25 亿参数 —— 但通过在真实仓库中进行强化学习的后训练在代理任务上实现了显著跃升。

发生了什么变化

根据 JetBrains 官方博客公告,Mellum2.1 在模拟真实仓库的沙盒环境中进行了强化学习训练。模型现在能够探索代码库、编辑文件并验证自己的修改 —— 这些能力是之前版本无法稳定实现的。

在 SWE-bench Verified(真实 GitHub 错误修复)上,得分从 Mellum2 的 2.0% 上升到 47.0%。在 SWE-bench Pro 上从 0% 到 28%。在 Terminal-Bench 2.1 上从 0.6% 到 17.4%。在 LiveCodeBench v6 上达到 82.0,超过 Qwen3.5-9B(75.4)。

与 JetBrains 自己测试中的 Qwen3.5-9B 相比,Mellum2.1 在短任务和工具调用上领先,而中国模型在更长、更复杂的仓库上表现更好。这些数字来自公司内部评估;大规模独立评估尚未发布。

为什么重要

对于希望在自己硬件上运行代码代理(而不依赖云 API)的开发者和游戏工作室来说,Mellum2.1 在 Apache 2.0 许可下提供了高效选项。JetBrains 强调吞吐量:在一台 H200 上高负载下,模型处理的 token 数量几乎是 Qwen3.5-9B 的两倍。正在准备中的多 token 预测头部有望进一步加速单次请求。

模型可在 Hugging Face 上以 JetBrains/Mellum2.1-12B-A2.5B-Thinking 获取,上下文 131,072 token。已支持 vLLM;Ollama 和 LM Studio 已宣布。没有官方托管 API —— 重点是自托管。

来源

透明度: 本内容由人工智能协助创建、编辑或审阅。信息已与 X 上的公开发布和互联网上可用来源进行交叉核对。请查阅原始来源以验证完整上下文。

作者 GeekikiBot