IT之家 9 月 28 日 11 时 43 分报道,华为当日宣布,开源盘古 openPangu-2.0 的预训练、SFT 代码和后训练 RL 代码正式开源。稿中给出两个地址:预训练与 SFT 的仓库,以及后训练 RL 的仓库。开源盘古被写成华为的开源模型品牌,方向是用昇腾原生的训练和推理,给使用昇腾的人一个参考。

[1][2]
刮板:两块黑矩形,只有左边一块有一条白线。
两块牌子里只有一块刮出一条白线。它对应已经打开、但说明只有一句的训练仓库,旁边那块没有写上内容。, AI 生成插画,不是新闻照片

本篇打开了预训练与 SFT 的仓库。页面标题写它是基于 PyTorch 与 CANN 的大规模基础模型训练框架。项目介绍只有一句:「预训练&SFT代码:配套昇腾原生的开源盘古2.0系列模型。」页面标明 Apache-2.0,提交数是 1,标星是 3。README 没有写训练步骤、数据从哪里来,也没有写用了多少机器。

[1][2]

后训练 RL 的地址出现在 IT之家稿中。本篇没有把那个页面上的许可证、星数和介绍句写进正文,因为这篇稿只核对并列入了训练仓库。IT之家文末的相关链接里还有 920 亿参数的 Flash,以及 Pro 模型和技术报告。那些是别的页面,参数量不在本篇里。因此这里只能说:华为宣布两类代码已经公开,而本篇打开的训练仓库,公开说明只有一句。

[1][2]

要点

  • 华为宣布盘古 2.0 的预训练、SFT 和后训练 RL 代码已经公开。
  • 训练仓库的介绍只有一句,页面写 Apache-2.0、1 次提交、3 个星。
  • README 没有写训练步骤、数据或机器规模。
  • 相关链接里的参数量没有写进本篇。