lymm2003 发表于 2026-7-31 11:03

余承东说到做到,华为盘古 openPangu-2.0-Pro 模型及技术报告开源上线

IT之家 7 月 31 日消息,华为今日官宣,开源盘古 5050 亿参数的 openPangu-2.0-Pro 模型(模型权重、基础推理代码)及技术报告正式开源上线。
开源盘古 openPangu 是华为开源 AI 模型品牌,致力于通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考。

openPangu-2.0-Pro 是基于昇腾 NPU 训练的大规模混合专家(MoE)语言模型,参数规模约 505B,每 token 激活参数规模约 18B,模型支持 512k 上下文长度,训练数据总量约 34T tokens。后训练阶段完成快慢合一微调(SFT)、多专项强化学习(RL),并通过在线蒸馏(OPD)完成能力合一。

openPangu-2.0-Pro 在模型架构上实现了全面的升级:
Attention 架构:沿用高效 MLA,并采用 DSA+SWA 独立分层混合架构,层配比为 1:2;SWA 层负责局部窗口建模,DSA 层负责稀疏全局聚合,在保持精度的同时显著降低长序列推理的计算、显存与访存开销。
拓扑架构:将传统残差连接升级为 4 支流 mHC 架构,提升表征多样性与泛化能力。
自投机模块:采用 3 头 MTP 架构,一次额外预测 3 个 token,显著提升模型的推理速度。
Muon 优化器:训练中采用 Muon 优化器,获得更快的收敛速度。
在今年 6 月的华为开发者大会 HDC 2026 主题演讲中,华为常务董事、产品投资评审委员会主任、终端 BG 董事长余承东宣布,openPangu 2.0 计划从 6 月 30 日起陆续开源 7 大组件,包括新增开源的预训练代码、后训练代码、训练算子。
6 月 30 日,92B 参数的 openPangu-2.0-Flash 模型已正式开源上线。
对于 openPangu-2.0-Pro 总参数仅 505B,余承东曾解释称,算力大量支持了国内的其他企业需求,自己留的数量还是非常有限的;此外,AI 算力成本非常高,华为更聚焦时延和吞吐率的提升。
openPangu-2.0 模型相关组件已陆续上线开源平台,IT之家附开源地址:
https://ai.gitcode.com/ascend-tribe/openPangu-2.0-Pro

Lisylfn 发表于 2026-7-31 11:06

差距呢?

c月光咖啡 发表于 2026-7-31 11:08

强调速度延迟,估计是应对实时分析搞的,其他方面猜是不行

—— 来自 HONOR MAA-AN10, Android 16, 鹅球 v3.5.99-debug

saintsimpler 发表于 2026-7-31 12:22

华为到底有什么必要做通用大模型,做点行业订制大模型得了,天气和矿山的不是还行吗。又不是互联网企业,非要盘子摊这么大干嘛?盘古当笑话黑历史过去就算了,脸面问题是最小的问题

笨拙的机器人 发表于 2026-7-31 12:31

如果搞vllm sglang slime这个层面的东西,那是多多益善。搞大模型是嫌跟模型厂的心之壁不够厚吗?

tylunas 发表于 2026-7-31 12:39

感觉就是为了争口气做的。不提盘古之殇,这个参数量主要用于证明(不泄露客户机密的前提下)昇腾生态能跑通大参数MOE训练,不然只有面壁智能的8B模型能当证明。

雨昼斯基 发表于 2026-7-31 12:40

笨拙的机器人 发表于 2026-7-31 12:31
如果搞vllm sglang slime这个层面的东西,那是多多益善。搞大模型是嫌跟模型厂的心之壁不够厚吗? ...

英伟达也搞大模型    Re:Source

笨拙的机器人 发表于 2026-7-31 12:42

雨昼斯基 发表于 2026-7-31 12:40
英伟达也搞大模型    Re:Source

那是为了卖更多卡,以及维持自己的ai infra研究能力。更多是通过投资开源模型厂实现的。不是说要做宇宙第一

omnitoken 发表于 2026-7-31 13:08

tylunas 发表于 2026-7-31 12:39
感觉就是为了争口气做的。不提盘古之殇,这个参数量主要用于证明(不泄露客户机密的前提下)昇腾生态能跑通 ...

什么啊美团吹了昇腾训练两次了

—— 来自 鹅球 v3.3.96

foolishman 发表于 2026-7-31 13:10

笨拙的机器人 发表于 2026-7-31 12:42
那是为了卖更多卡,以及维持自己的ai infra研究能力。更多是通过投资开源模型厂实现的。不是说要做宇宙第 ...

华为能接过阿里的担子,专门做开源小模型其实是件好事

—— 来自 HUAWEI ALN-AL80, Android 12, 鹅球 v3.5.99-alpha

发呆的龙虾 发表于 2026-7-31 13:12

话说华为笔记用的绘图模型是哪个,时神时鬼的。好用的时候能平替gptimage2,不好用的时候能把人逗笑。但胜在免费,时间充足的话倒是可以直接无限抽卡。

—— 来自 HUAWEI HOP-AL10, Android 16, 鹅球 v4.0-alpha

白冷 发表于 2026-7-31 13:21

准备闻着味就来了吧

—— 来自 HUAWEI HBN-AL00, Android 12, 鹅球 v3.5.99-alpha

mitzvah 发表于 2026-7-31 13:25

tylunas 发表于 2026-7-31 12:39
感觉就是为了争口气做的。不提盘古之殇,这个参数量主要用于证明(不泄露客户机密的前提下)昇腾生态能跑通 ...

美团那longcat2不就是

Rowen233 发表于 2026-7-31 13:34

saintsimpler 发表于 2026-7-31 12:22
华为到底有什么必要做通用大模型,做点行业订制大模型得了,天气和矿山的不是还行吗。又不是互联网企业,非 ...

主要拿来打样的 以后一些国企需要本地部署LLM的时候昇腾可以做一整套方案

憂鬱臺灣烏龜 发表于 2026-7-31 13:35

何必呢,把算力卡搞好还不够赚钱?你自己上跟自己客户竞争,别人还买你的卡吗?

80后卢瑟 发表于 2026-7-31 13:38

是泥潭最爱的粪海狂蛆环节

半江瑟瑟半江红 发表于 2026-7-31 13:50

tylunas 发表于 2026-7-31 12:39
感觉就是为了争口气做的。不提盘古之殇,这个参数量主要用于证明(不泄露客户机密的前提下)昇腾生态能跑通 ...

这需要华为自己证明?

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0

shiraikuroko 发表于 2026-7-31 14:04

憂鬱臺灣烏龜 发表于 2026-7-31 13:35
何必呢,把算力卡搞好还不够赚钱?你自己上跟自己客户竞争,别人还买你的卡吗? ...

老黄也自己做,你和老黄说去?

acropolis 发表于 2026-7-31 14:30

非frontier开发次级模型已经不是多难的事情了,业务需要就可以做

yoki42 发表于 2026-7-31 14:49

页: [1]
查看完整版本: 余承东说到做到,华为盘古 openPangu-2.0-Pro 模型及技术报告开源上线