找回密码
 立即注册
搜索
查看: 2867|回复: 19

[科技] 余承东说到做到,华为盘古 openPangu-2.0-Pro 模型及技术报告开源上线

[复制链接]
发表于 2026-7-31 11:03 来自手机 | 显示全部楼层 |阅读模式
此帖将于2026-08-30 11:02自动关闭
IT之家 7 月 31 日消息,华为今日官宣,开源盘古 5050 亿参数的 openPangu-2.0-Pro 模型(模型权重、基础推理代码)及技术报告正式开源上线。
开源盘古 openPangu 是华为开源 AI 模型品牌,致力于通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考。

openPangu-2.0-Pro 是基于昇腾 NPU 训练的大规模混合专家(MoE)语言模型,参数规模约 505B,每 token 激活参数规模约 18B,模型支持 512k 上下文长度,训练数据总量约 34T tokens。后训练阶段完成快慢合一微调(SFT)、多专项强化学习(RL),并通过在线蒸馏(OPD)完成能力合一。

openPangu-2.0-Pro 在模型架构上实现了全面的升级:
Attention 架构:沿用高效 MLA,并采用 DSA+SWA 独立分层混合架构,层配比为 1:2;SWA 层负责局部窗口建模,DSA 层负责稀疏全局聚合,在保持精度的同时显著降低长序列推理的计算、显存与访存开销。
拓扑架构:将传统残差连接升级为 4 支流 mHC 架构,提升表征多样性与泛化能力。
自投机模块:采用 3 头 MTP 架构,一次额外预测 3 个 token,显著提升模型的推理速度。
Muon 优化器:训练中采用 Muon 优化器,获得更快的收敛速度。
在今年 6 月的华为开发者大会 HDC 2026 主题演讲中,华为常务董事、产品投资评审委员会主任、终端 BG 董事长余承东宣布,openPangu 2.0 计划从 6 月 30 日起陆续开源 7 大组件,包括新增开源的预训练代码、后训练代码、训练算子。
6 月 30 日,92B 参数的 openPangu-2.0-Flash 模型已正式开源上线。
对于 openPangu-2.0-Pro 总参数仅 505B,余承东曾解释称,算力大量支持了国内的其他企业需求,自己留的数量还是非常有限的;此外,AI 算力成本非常高,华为更聚焦时延和吞吐率的提升。
openPangu-2.0 模型相关组件已陆续上线开源平台,IT之家附开源地址:
https://ai.gitcode.com/ascend-tribe/openPangu-2.0-Pro

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-7-31 11:06 | 显示全部楼层
差距呢?
回复

使用道具 举报

     
发表于 2026-7-31 11:08 来自手机 | 显示全部楼层
强调速度延迟,估计是应对实时分析搞的,其他方面猜是不行

—— 来自 HONOR MAA-AN10, Android 16, 鹅球 v3.5.99-debug
回复

使用道具 举报

     
发表于 2026-7-31 12:22 | 显示全部楼层
华为到底有什么必要做通用大模型,做点行业订制大模型得了,天气和矿山的不是还行吗。又不是互联网企业,非要盘子摊这么大干嘛?盘古当笑话黑历史过去就算了,脸面问题是最小的问题
回复

使用道具 举报

     
发表于 2026-7-31 12:31 来自手机 | 显示全部楼层
如果搞vllm sglang slime这个层面的东西,那是多多益善。搞大模型是嫌跟模型厂的心之壁不够厚吗?
回复

使用道具 举报

     
发表于 2026-7-31 12:39 来自手机 | 显示全部楼层
感觉就是为了争口气做的。不提盘古之殇,这个参数量主要用于证明(不泄露客户机密的前提下)昇腾生态能跑通大参数MOE训练,不然只有面壁智能的8B模型能当证明。
回复

使用道具 举报

     
发表于 2026-7-31 12:40 | 显示全部楼层
笨拙的机器人 发表于 2026-7-31 12:31
如果搞vllm sglang slime这个层面的东西,那是多多益善。搞大模型是嫌跟模型厂的心之壁不够厚吗? ...

英伟达也搞大模型    Re:Source
回复

使用道具 举报

     
发表于 2026-7-31 12:42 来自手机 | 显示全部楼层
雨昼斯基 发表于 2026-7-31 12:40
英伟达也搞大模型    Re:Source

那是为了卖更多卡,以及维持自己的ai infra研究能力。更多是通过投资开源模型厂实现的。不是说要做宇宙第一
回复

使用道具 举报

     
发表于 2026-7-31 13:08 来自手机 | 显示全部楼层
tylunas 发表于 2026-7-31 12:39
感觉就是为了争口气做的。不提盘古之殇,这个参数量主要用于证明(不泄露客户机密的前提下)昇腾生态能跑通 ...

什么啊美团吹了昇腾训练两次了

—— 来自 鹅球 v3.3.96
回复

使用道具 举报

     
发表于 2026-7-31 13:10 来自手机 | 显示全部楼层
笨拙的机器人 发表于 2026-7-31 12:42
那是为了卖更多卡,以及维持自己的ai infra研究能力。更多是通过投资开源模型厂实现的。不是说要做宇宙第 ...

华为能接过阿里的担子,专门做开源小模型其实是件好事

—— 来自 HUAWEI ALN-AL80, Android 12, 鹅球 v3.5.99-alpha
回复

使用道具 举报

发表于 2026-7-31 13:12 来自手机 | 显示全部楼层
话说华为笔记用的绘图模型是哪个,时神时鬼的。好用的时候能平替gptimage2,不好用的时候能把人逗笑。但胜在免费,时间充足的话倒是可以直接无限抽卡。

—— 来自 HUAWEI HOP-AL10, Android 16, 鹅球 v4.0-alpha
回复

使用道具 举报

     
发表于 2026-7-31 13:21 来自手机 | 显示全部楼层
准备闻着味就来了吧

—— 来自 HUAWEI HBN-AL00, Android 12, 鹅球 v3.5.99-alpha
回复

使用道具 举报

发表于 2026-7-31 13:25 | 显示全部楼层
tylunas 发表于 2026-7-31 12:39
感觉就是为了争口气做的。不提盘古之殇,这个参数量主要用于证明(不泄露客户机密的前提下)昇腾生态能跑通 ...

美团那longcat2不就是
回复

使用道具 举报

     
发表于 2026-7-31 13:34 | 显示全部楼层
saintsimpler 发表于 2026-7-31 12:22
华为到底有什么必要做通用大模型,做点行业订制大模型得了,天气和矿山的不是还行吗。又不是互联网企业,非 ...

主要拿来打样的 以后一些国企需要本地部署LLM的时候昇腾可以做一整套方案
回复

使用道具 举报

发表于 2026-7-31 13:35 来自手机 | 显示全部楼层
何必呢,把算力卡搞好还不够赚钱?你自己上跟自己客户竞争,别人还买你的卡吗?
回复

使用道具 举报

     
发表于 2026-7-31 13:38 来自手机 | 显示全部楼层
是泥潭最爱的粪海狂蛆环节

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

     
发表于 2026-7-31 13:50 来自手机 | 显示全部楼层
tylunas 发表于 2026-7-31 12:39
感觉就是为了争口气做的。不提盘古之殇,这个参数量主要用于证明(不泄露客户机密的前提下)昇腾生态能跑通 ...

这需要华为自己证明?

—— 来自 HUAWEI SGU-AL10, Android 16, 鹅球 v4.0
回复

使用道具 举报

     
发表于 2026-7-31 14:04 | 显示全部楼层
憂鬱臺灣烏龜 发表于 2026-7-31 13:35
何必呢,把算力卡搞好还不够赚钱?你自己上跟自己客户竞争,别人还买你的卡吗? ...

老黄也自己做,你和老黄说去?
回复

使用道具 举报

发表于 2026-7-31 14:30 来自手机 | 显示全部楼层
非frontier开发次级模型已经不是多难的事情了,业务需要就可以做
回复

使用道具 举报

头像被屏蔽
     
发表于 2026-7-31 14:49 来自手机 | 显示全部楼层
提示: 作者被禁止或删除 内容自动屏蔽
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|上海互联网违法和不良信息举报中心|网上有害信息举报专区|962110 反电信诈骗|举报电话 021-62035905|Stage1st ( 沪ICP备13020230号-1|沪公网安备 31010702007642号 )

GMT+8, 2026-8-24 20:31 , Processed in 0.083290 second(s), 7 queries , Gzip On, Redis On.

Powered by Discuz! X3.5

© 2001-2026 Discuz! Team.

快速回复 返回顶部 返回列表