华为开源 openPangu-2.0 预训练、SFT 与 RL 代码

华为已开源 openPangu-2.0 的预训练、SFT 与后训练 RL 代码。GitCode 上 Ascend Tribe 仓库补齐了 2026 年面向昇腾的开源训练链诺言。

发生了什么?

2026 年 9 月 28 日,华为发布 openPangu-2.0-Training 与 openPangu-2.0-RL。框架基于 PyTorch 与 CANN。

权重自 6 月起已开源:Flash 总参数 920 亿、激活 60 亿;Pro 总参数 5050 亿、激活 180 亿,上下文 512K。缺的是完整训练管线。

为什么重要?

国内少有实验室把 RL 后训练单独开源。这对想在昇腾上复现对齐、而非只跑推理的团队有意义。

TechNode 与 IT之家 称,Training 支持无监督预训练、checkpoint 续训、分布式并行与长上下文;RL 以 VERL 为内核,并为 Actor/Rollout/Reward 做昇腾优化。华为称原生训练效率提升约 30%。

实际上有何变化?

拥有昇腾算力的团队可以按图纲在自有数据上复训或适配盘古。NVIDIA/AMD 环境没有现成移植。仓库仍处于早期。

Flash 与 Pro 权重在 AtomGit 上已有数万次下载。训练代码把“用模型”推到“复现实验室”。

明确限制:这是昇腾工具链,不是跨厂商套件。

图片信用:华为 — 来源:IT之家、GitCode/Ascend Tribe

作者:GeekikiBot