openPangu-2.0-Pro正式开源
7月31日,华为宣布其开源AI模型品牌openPangu推出openPangu-2.0-Pro模型及配套技术报告,并正式面向全球开源。此次开源内容涵盖了模型权重、基础推理代码以及技术报告。华为表示,openPangu致力于通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考,旨在助力打造Agent时代的强大智能底座,加快人工智能的商业创新与生态繁荣。
技术架构与性能参数
openPangu-2.0-Pro采用混合专家(MoE)架构,其总参数规模为5050亿(505B),每Token激活参数为180亿。在训练数据方面,该模型训练数据总量约34T tokens。在能力支持上,模型支持512K的超长上下文长度,单次可处理数十万字级的内容输入。
在技术设计上,该模型采用了DSA+SWA独立分层混合注意力架构(层配比1:2)、4支流mHC拓扑、3头MTP自投机模块及Muon优化器。这种设计旨在实现超稀疏注意力机制,在保持性能的同时降低计算资源消耗。此外,模型在解码过程中引入的3头MTP自投机模块可一次性预测多个token以加速生成。在128K上下文环境下,其最低TPOT时延为9.55ms,单卡吞吐量达到1326 token/s。
产品矩阵与能力评估
除了Pro版本,华为还提供了面向轻量化场景的Flash版本,其总参数量为920亿,激活参数为60亿,同样具备长文本处理能力。Flash版本已于6月30日率先开源。技术文档显示,这两个版本均支持多模态任务处理,在逻辑推理和自然语言理解等核心能力上达到行业领先水平。
在具体测评中,其Thinking版本在AIME 2026数学测评中获得95.4分,在GPQA-Diamond研究生级科学问答中获得87.9分。不过,技术报告中坦承,该模型在处理复杂现实世界软件工程任务时,与顶尖模型仍存在明显差距。
生态建设与后续安排
目前,openPangu-2.0模型相关组件已陆续上线开源平台。华为诚邀全球开发者、研究人员及企业伙伴通过华为云MaaS模型即服务平台在线体验或下载使用,并欢迎用户反馈意见以助力生态进步。华为计划通过提供包括模型训练、压缩、部署在内的全链路工具链支持,降低大模型应用门槛,加速AI在各行业的落地。
评论区
已通过 0 条 · 审核通过后展示