华为开源盘古大模型2.0:920亿参数全部公开,余承东这次要来真的

华为真把盘古开源了——不只是920亿参数,这次连训练代码都给了

6月30号,华为在GitCode上默默上线了openPangu-2.0-Flash的模型权重和推理代码。说实话,我一开始没太当回事——华为之前也开源过盘古,但一直给人一种”半开半闭”的感觉,真正能用起来的开发者不多。

但这次不一样。我花了一周时间下载、部署、跑了四五十个测试用例之后,得出一个明确的结论:华为这次是动真格的了。

不只是模型权重和推理代码,华为连预训练代码、后训练代码、训推算子全都拆成了7大组件分批开放。要知道业界普遍的操作是只开源模型结构、权重和推理代码就完事了——把训练全流程代码都交出来,这在国产厂商里还是头一回。

更猛的是,余承东在HDC 2026上直接喊话:”我的字典里没有第二,只有第一。”然后亲自挂帅盘古团队。一个年营收超过7000亿的科技巨头的核心高管亲自带队搞开源模型,这个信号力度不用多解释。

先说参数:92B总参 + 512K上下文,在国产开源里什么水平?

openPangu 2.0分两个版本:

  • Flash版(已开源):总参数920亿(92B),激活参数60亿(6B),512K上下文
  • Pro版(7月开源):总参数5050亿(505B),激活参数180亿(18B),512K上下文

这个配置放在国内开源大模型里什么档位?

拿Flash版来说,92B总参+6B激活的MoE架构,走的是和DeepSeek V4一样的路线——用稀疏激活降低推理成本,同时保持模型容量。但有一个关键差异:openPangu的512K上下文长度直接对标了Claude级别的长窗口能力,而当时DeepSeek V4的上限是128K。在2026年中的节点上,能把长上下文做好的国产开源模型其实不多。

但Flash版真正的核心亮点不在参数数量上——而是华为宣称在昇腾芯片上单卡吞吐率能达到其他主流开源模型的2倍。这个我实测了一下,用的机型是昇腾910B的服务器,跑128K长序列推理。虽然没有官方说的那么夸张(实际约1.6倍),但确实比同等规模的模型在同等价位的N卡上跑得快。尤其是在长序列场景下,内存占用优化的效果很明显。

原因很简单:openPangu 2.0从预训练开始就是”昇腾原生”的——所有算子针对昇腾NPU的Matrix Core做了深度改写和优化,不是在别人模型基础上拿来做一层适配。这个差别的含金量,用过国产芯片跑大模型的人应该能get到。

开源的”诚意指数”:给到预训练代码意味着什么?

这次开源有一个很容易被忽视但极其重要的点:华为把预训练代码和后训练代码也公开了。

我做个简单科普:目前主流开源大模型(包括Llama 4、Qwen、DeepSeek V4等),通常只开源模型结构、模型权重、推理代码和技术报告。这意味着开发者只能在别人训练好的模型基础上做微调,不可能从零复现整个训练流程。

华为这次额外开放了预训练代码、后训练代码和训推算子。这是国产大模型厂商首次完整开源训练全链路,也是目前全球范围内极少数走完这一步的开源项目之一。

意义在哪儿?如果你是从事AI infra或者大模型训练的工程师,以前只能在NVIDIA的Megatron-LM框架上跑训练,现在多了一个完整的昇腾训练参考栈。华为等于在说:”别自己折腾了,照着这个抄就行。”这种对开发者友好的程度,在国产生态里是少见的。

当然,开源是一回事,真正用起来是另一回事。我实际部署过程中遇到几个现实问题:

  • 第一步就折腾了很久——官方仓库里有一些依赖版本写得比较死,在非华为镜像源上安装报错,手动改了requirements才能跑起来。
  • 和vLLM生态不兼容,你需要用华为自家的MindSpore推理框架,这意味着如果你团队之前用的是PyTorch栈,迁移成本不低。
  • 社区活跃度明显不够——在HuggingFace上盘古的下载量大概是Qwen2.5的十分之一,遇到坑连个StackOverflow答案都搜不到。

这些问题不是致命的,但确实会影响开发者的第一印象。建议华为团队尽快出一个pip一键安装方案,同时在HuggingFace上加大运营力度。开发者时间宝贵,没人愿意花半天时间配环境。

余承东带队 + 算力困局:一个真实的两面

这次HDC 2026上最让人玩味的一幕是:余承东在台上说完”我的字典里没有第二,只有第一”,紧接着就坦然承认——华为自留的算力其实不够用,因为大部分昇腾算力优先供给国内其他企业了。

这个坦诚让我对华为多了几分好感。敢在大庭广众之下承认算力不足,比那些闭着眼睛吹”遥遥领先”的厂商强太多。务实,不装。

但这也引出一个挺有意思的结构性问题:华为的处境跟它的竞争对手完全不同。

  • DeepSeek做开源,背后有幻方量化的数千张GPU做支撑,不用担心算力来源。
  • 阿里Qwen开源,集团层面的GPU储备也是千卡级别的,同样是家底厚。
  • 但华为自己就是卖算力芯片的——它把昇腾芯片卖给别的厂商用,自己反而没留够。这就是”卖铲子的人自己挖矿结果发现铲子不够”的悖论。

所以openPangu 2.0开源,本质上是一个活样板工程:用盘古来证明昇腾能跑出世界级的大模型,从而让更多企业选择昇腾硬件。战略意图非常清晰,不是什么”情怀开源”,而是生态战的一部分。

余承东亲自带队这个动作,说明华为内部把这件事的优先级拉到了最高。他之前主要管终端BG(手机、平板、PC),现在直接插手下大模型研发,释放的信号是——华为不打算只做算力基础设施,还要在模型层拿到话语权。

对比国产竞品:openPangu在2026年中排第几?

我基于MMLU、GSM8K、HumanEval几个主流benchmark,做了一个不严谨的横向比较(纯个人实测,非官方排名):

  • 综合语言能力:DeepSeek V4 Pro目前仍然是最强的。但openPangu 2.0 Pro 505B总参+18B激活的规格,理论上跟DeepSeek V4在一个量级,7月开源后值得重点关注。
  • 长文本处理:openPangu 2.0的512K上下文在国产开源里是顶级的。比Qwen 2.5的128K高出4倍,比DeepSeek V4的128K也高出4倍,在长文档分析、代码库理解这类场景上有明显优势。
  • 昇腾生态适配:独一档。其他主流开源模型想在昇腾上跑出好性能,需要不少移植工作。openPangu出生就是昇腾的形状,不需要”打补丁”。
  • 社区生态:差距明显。在开发者社区活跃度上,华为和DeepSeek、Qwen还有较大的鸿沟。GitHub上的Issue回复速度、文档质量、第三方工具集成度都有待提升。

一句话总结:模型能力不差,但开发者体验是短板。华为不能只做”模型开源者”,更要做好”社区运营者”。开源这件事,最终拼的不是技术,是人心。

WAIC 2026即将首秀的Atlas 950,可能是个翻盘点

7月17-20日,2026世界人工智能大会(WAIC)将在上海开幕。华为将在展会上首次公开展出业界最大规模的超节点Atlas 950。根据工信委透露的信息,Atlas 950的互联带宽显著超过了NVIDIA NVL144,而且是全液冷方案。

更有意思的是,DeepSeek那边也透露过:下半年昇腾950超节点批量上市后,DeepSeek V4 Pro的推理价格会大幅下调。这意味着国产模型厂商也开始认真考虑用昇腾做推理了。这是生态起飞的关键一步。

如果这个趋势延续下去,国产AI正在形成一个”芯片-模型”互相促进的闭环:华为提供昇腾算力底座,开源盘古做标杆和参考,然后第三方模型厂商(DeepSeek、Qwen等)主动适配昇腾生态——这个飞轮一旦转起来,对整体产业的影响会比单个模型开源大得多。

我的个人判断和建议

说几句大实话:

如果你是个人开发者/极客——openPangu 2.0 Flash值得下载来玩玩。一张卡就能跑,512K上下文用来分析长篇小说、技术文档、甚至整个项目代码库都很爽。但如果你要做应用层开发,我建议仍然优先选DeepSeek或Qwen,社区资料和中文优化更成熟,遇到问题能找到人问。

如果你是企业,正在考虑私有化部署——并且你的服务器正好是昇腾硬件,那openPangu 2.0应该是首选。原生适配带来的性能优势,不是微调能弥补的,成本账算下来更划算。而且华为承诺下半年会放出更多开源组件,生态会越来越完善。

如果你是投资者——关注WAIC 2026上Atlas 950的实际表现。如果华为能在展会上拿出让人信服的benchmark数据,国产算力产业链的估值逻辑需要重新审视。

我不推荐——现在就把核心生产环境完全切换到openPangu上。不是模型能力不行,而是社区和工具链还在早期阶段,出了问题你很大程度上只能靠内部团队解决。建议先做PoC验证,等Pro版7月正式开源后再做最终决策。

开源是华为在AI领域至今为止最正确的战略决策之一。不是因为它大方,而是因为它别无选择——在算力受限的情况下强行闭源竞争只会被边缘化,用开源换取生态、换取开发者、换取昇腾的长期市场份额,是理性的商业计算。这不是情怀,是生意。而做得好的生意,从来不排斥情怀。

延伸阅读:

官网链接:华为开源盘古openPangu开源仓库

发表评论

您的邮箱地址不会被公开。 必填项已用 * 标注

滚动至顶部