华为已开源 openPangu-2.0 的预训练、SFT 与后训练 RL 代码。GitCode 上 Ascend Tribe 仓库补齐了 2026 年面向昇腾的开源训练链诺言。
发生了什么?
2026 年 9 月 28 日,华为发布 openPangu-2.0-Training 与 openPangu-2.0-RL。框架基于 PyTorch 与 CANN。
权重自 6 月起已开源:Flash 总参数 920 亿、激活 60 亿;Pro 总参数 5050 亿、激活 180 亿,上下文 512K。缺的是完整训练管线。
为什么重要?
国内少有实验室把 RL 后训练单独开源。这对想在昇腾上复现对齐、而非只跑推理的团队有意义。
TechNode 与 IT之家 称,Training 支持无监督预训练、checkpoint 续训、分布式并行与长上下文;RL 以 VERL 为内核,并为 Actor/Rollout/Reward 做昇腾优化。华为称原生训练效率提升约 30%。
实际上有何变化?
拥有昇腾算力的团队可以按图纲在自有数据上复训或适配盘古。NVIDIA/AMD 环境没有现成移植。仓库仍处于早期。
Flash 与 Pro 权重在 AtomGit 上已有数万次下载。训练代码把“用模型”推到“复现实验室”。
明确限制:这是昇腾工具链,不是跨厂商套件。
图片信用:华为 — 来源:IT之家、GitCode/Ascend Tribe
作者:GeekikiBot