华为开源5050亿参数模型openPangu-2.0-Pro
- 开源5050亿参数模型—华为7月31日开源openPangu-2.0-Pro,总参数5050亿,激活约180亿,支持512K上下文,并开放权重、推理代码与技术报告。
- MoE架构与超长上下文—基于昇腾NPU训练的MoE模型,训练数据约34T tokens;512K超长上下文可一次处理大型文档与复杂代码库,稀疏激活控制计算成本。
- 多项后训练优化—采用快慢合一监督微调、多专项强化学习与在线蒸馏OPD,增强指令跟随、复杂推理和泛化能力。
- 持续扩充开源生态—继6月30日开源92B参数Flash版后,Pro版加入;openPangu2.0计划将陆续开源预训练代码、后训练代码等7大组件,推进昇腾AI生态。
华为开源5050亿参数模型openPangu-2.0-Pro
核心发布信息
7月31日,华为正式开源盘古AI模型品牌openPangu旗下的最新大模型——openPangu-2.0-Pro。此次开源同步开放了模型权重、基础推理代码及技术报告,为开发者和企业提供基于昇腾原生训练与推理技术的最佳实践,进一步推进昇腾AI生态建设。
华为表示,openPangu-2.0-Pro是openPangu2.0开源计划的重要里程碑,旨在推动国产大模型技术普惠。
模型参数与架构
openPangu-2.0-Pro是一款基于昇腾NPU训练的大规模混合专家(MoE)语言模型,其核心特性如下:
- 总参数规模:约505B(5050亿)
- 每Token激活参数:约18B
- 上下文长度:512K Tokens
- 训练数据规模:约34T Tokens
MoE架构通过稀疏激活机制,在保持模型容量的同时有效控制计算成本。512K的超长上下文能力使其能够一次性处理大型文档、复杂代码库等任务,为专业场景提供了更强支持。
后训练技术亮点
在后训练阶段,openPangu-2.0-Pro采用了多项先进技术:
- 快慢合一监督微调(SFT):结合快速响应与深度思考的微调策略,增强指令对齐能力。
- 多专项强化学习(RL):针对多类任务进行专项优化,提升模型在特定领域的表现。
- 在线蒸馏(OPD):通过在线蒸馏方式融合多模型能力,进一步强化综合性能。
这些技术的组合,使openPangu-2.0-Pro在指令跟随、复杂推理和泛化能力上表现更为出色。
开源计划与生态布局
此次开源是华为openPangu2.0开源计划的重要组成部分。今年6月举行的HDC2026开发者大会上,华为常务董事、产品投资评审委员会主任、终端BG董事长余承东宣布,openPangu2.0将自6月30日起陆续开源7大组件,包括预训练代码、后训练代码和训练算子等核心能力。
此前,92B参数的openPangu-2.0-Flash模型已于6月30日率先开源。如今,规模更大的Pro版本也正式加入开源行列,进一步完善了openPangu系列的开源矩阵。
行业意义与华为策略
针对openPangu-2.0-Pro总参数规模达到505B,余承东曾表示,华为将大量AI算力资源支持国内产业生态,自身可用算力相对有限,同时AI训练成本持续高企。因此,华为更注重模型在时延、吞吐率等推理效率上的优化。
通过持续开放核心模型与训练能力,昇腾原生AI开发生态有望进一步完善,并为国产大模型研发提供更多开源参考,降低行业整体研发门槛。
获取资源
开发者可访问Ascend Tribe开源社区获取模型权重、推理代码及技术报告:
https://www.huaweicloud.com/product/modelarts/studio
华为也鼓励社区开发者基于该模型进行二次创新,共同推动AI技术前沿发展。