华为开源盘古openPangu-2.0全套训练代码:从预训练到Agentic RL,昇腾底座全链路开放

AI资讯53秒前发布 EdgeClaw
0 00

9月28日,华为官宣将开源盘古openPangu-2.0的预训练、SFT(监督微调)代码和后训练RL(强化学习)代码。这意味着,从零训练一个基于昇腾的大模型所需的全部关键环节,都有了官方参考实现。

一次放出三条关键链路

openPangu是华为的开源AI模型品牌,核心理念是用”昇腾原生”的训练与推理技术,给业界提供一个用好昇腾的样板。此番放出的openPangu-2.0-Training,是一套面向大规模基础模型训练的统一框架:它把预训练、监督微调和模型持续优化整合成一条流水线,同时支持多维分布式并行、高效数据流水线、混合精度训练、自定义算子优化与高可用训练等能力,瞄准的是百亿到万亿参数级别的基础模型训练场景。

蓝紫渐变光效中AI服务器集群数据流向昇腾芯片,象征华为openPangu-2.0开源昇腾算力底座

如果说Training解决的是”怎么把模型训出来”,那么openPangu-2.0-RL解决的则是”怎么让模型更会干活”。这套强化学习加速框架基于VERL生态构建,专门针对昇腾做了原生适配,支持高精度、高效的Agentic RL后训练,核心目标是提升大模型在复杂任务中的自主规划与执行能力。在AI Agent越来越普遍的当下,这一步直接把开源生态的关注点推向了后训练环节。

为Agent时代的智能底座铺路

在HUAWEI HDC 2026上,华为曾预告开源盘古大模型2.0的路线,此次代码正式上线是这一规划的具体落地。华为强调,openPangu-2.0旨在为”Agent时代的强大智能底座”提供支撑,加快人工智能商业创新与生态繁荣。

对开发者和企业来说,这套开源的价值在于”确定性”:过去在昇腾上做大模型训练,往往要自己摸索算子、并行策略和RL链路,试错成本不低;现在官方把经过验证的完整训练与后训练流程摊开,社区可以在此基础上快速起步,再针对自己的场景做定制。对昇腾生态而言,这相当于补上了”从模型训练到智能体落地”的关键一环。

暗黑科技风格下神经网络节点与强化学习奖励曲线攀升,呼应Agentic RL后训练能力

竞争重心正在后移

值得注意的是,华为把RL后训练单独拎出来开源,传递的信号相当明确:大模型竞争的重心,正在从”谁会发布更强的基座模型”转向”谁能把模型调教成可靠的智能体”。而开源预训练、SFT、RL全套代码,也有助于吸引更多开发者把昇腾当作默认训练底座。

可以预见,随着openPangu-2.0相关组件陆续上线开源平台,围绕昇腾的开发者生态将进一步活跃。对于关注国产算力与大模型开源的团队,这套代码值得第一时间下载研究。

© 版权声明

相关文章