華為盤古大模型的演進歷程,不僅是一部大模型技術迭代史,而且是一部圍繞其 自研昇騰(Ascend)硬件平臺,從追趕到探索,逐步構建“軟硬一體”戰略的產 業發展路徑。
1. 盤古大模型系列的起點是 PanGu-α確立基于昇騰與自研框架的技 術路線
華為盤古大模型的征程始于2021年4月,其標志性起點是PanGu-α模型的發布。 這是一個參數規模高達 2000 億的自回歸中文預訓練語言模型,其訓練語料庫是從 近 80TB 原始數據中經過復雜清洗和過濾后提煉出的 1.1TB 高質量中文文本,在 當時引起了業界的廣泛關注。PanGu-α的論文明確指出,當時 GPT-3 等模型主要 基于英文且僅提供有限訪問,而其目標正是為了推動中文預訓練語言模型的公共 研究。它首次完整地向外界展示了華為 AI 的全棧自主技術路線,模型是在一個由 2048 個自研的昇騰 910 AI 處理器組成的集群上,使用自研的 MindSpore 深度學習 框架完成訓練的。為了攻克大模型訓練的內存和算力挑戰,團隊基于 MindSpore 框架采用了包括數據并行、算子級模型并行、流水線模型并行在內的五維并行策 略,從而高效地將訓練任務擴展至整個集群,為其后續走上“為硬件效率而進行 軟件創新”的道路奠定了方向。這種優化不僅體現在系統工程層面,也體現在模 型架構的微創新上,例如論文中提到的在 Transformer 主干網絡之上增加一個獨特 的“查詢層”(Query Layer)以增強模型性能。PanGu-α解決了華為 AI 大模型 “從 0 到 1”的問題,它驗證了這條全棧自主路線的技術可行性,成為了后續所 有演進的重要基礎。

2. PanGu-Σ對稀疏化進行早期嘗試,2023 年就向萬億參數發起探索
在 PanGu-α證明了千億級稠密模型的可行性之后,華為將目光投向了更具挑戰性 的萬億參數領域。2023 年 3 月,華為發布了擁有 1.085 萬億參數的 PanGu-Σ模 型,標志著其向更大模型規模和更高效模型架構的探索上又邁進一步。PanGu-Σ 團隊認為,單純增加稠密模型的參數會帶來高昂的計算成本,而稀疏化是通往萬 億參數更經濟高效的路徑。 PanGu-Σ的核心創新在于引入了稀疏化架構。它并非沿用傳統的稠密模型設計,而是通過繼承式學習(Inheritance Learning)策略,繼承了 PanGu-α 13B 版本的 參數,并將其擴展為一個覆蓋 40 個不同領域(包括自然語言和編程語言)的稀疏 模型。這一架構的核心是隨機路由專家(Random Routed Experts,RRE),它在模 型的上層用多個條件激活的前饋網絡(即專家)替代了原有的稠密前饋網絡。與 當時主流 MoE 模型采用可學習的門控網絡來路由 token 不同,RRE 采用了一種非 學習式的、基于 token ID 和預設映射表的兩級隨機路由機制。這種設計的背后, 反映了華為在模型設計的早期階段就注意到了稀疏模型在分布式系統上的核心問 題:負載均衡。隨機路由雖然在模型表達能力上可能不如可學習路由,但它通過 隨機化和預設映射,天然地避免了部分專家過載而另一部分專家空閑的問題,保 證了訓練的穩定性和硬件資源利用率。此外,這種非學習式的路由設計還帶來了 一個關鍵的工程優勢:模型可以被靈活地拆解,允許開發者無損地提取出特定領 域的子模型(如代碼模型、雙語模型)進行獨立部署,極大地提升了模型的實用 性和落地效率。
為了支撐這個萬億參數的稀疏模型在一個適度規模的硬件資源上高效訓練,華為 同步推出了一套名為專家計算與存儲分離(Expert Computation and Storage Separation,ECSS)的系統設計。ECSS 是一種創新的異構計算方案,它將計算密 集型的任務保留在 NPU 上,而將內存消耗巨大的優化器狀態等卸載到擁有 750GB 主機內存容量(Host Memory)的主機 CPU(鯤鵬 920 CPU)上進行處理。通過這 種方式,ECSS 有效緩解了單顆昇騰 910 處理器 32GB 高帶寬內存(High-Bandwidth Memory,HBM)的瓶頸,使得在僅 512 卡的集群上訓練萬億模型成為可能,并實 現了高達 6.3 倍的訓練吞吐量提升。 PanGu-Σ的實踐,是華為從稠密模型向稀疏模型演進的一次重要嘗試。RRE 和 ECSS 的組合,清晰地展示了華為解決大規模的模型挑戰的思路:當遇到硬件瓶頸 時,不僅從軟件算法層面(RRE)進行創新,也從系統架構層面(ECSS)進行軟 硬件協同設計。這標志著其“軟硬一體”的戰略思想開始從理論走向實踐。
3. 盤古 3.0 提出“5+N+X”架構,面向多行業進行大模型落地
2023 年 7 月,在華為開發者大會上,盤古大模型 3.0 正式發布,同時提出了一個 戰略性口號,“不作詩,只做事”。這一口號的背后,是盤古大模型從通用技術展 示向深度賦能千行百業的戰略轉型。這一戰略以其在一系列行業應用為基礎:例 如,盤古氣象大模型成為全球首個在精度上超越傳統數值預報方法的 AI 模型,其 成果發表于頂級科學期刊《自然》(Nature);盤古藥物分子大模型則成功研發出一 款有望成為全球 40 年來首個新靶點、新類別抗生素的超級抗菌藥 Drug X,并將 研發周期從數年縮短至幾個月。
盤古 3.0 推出了標志性的“5+N+X”三層架構: L0 層:基礎大模型。包含自然語言處理(NLP)、計算機視覺(CV)、多模態、預 測、科學計算五個基礎大模型。同時,盤古 3.0 也為用戶提供從 100 億參數到 1, 000 億參數等五種不同規模的大模型以適應不同行業的多樣化需求。L0 層是盤古 能力的基礎,為上層應用提供通用的、可組合的 AI 技能。 L1 層:行業大模型。包含 N 個面向特定行業的模型,如政務、金融、制造、礦 山、氣象等。這些模型利用行業公開數據和華為在這些領域的相關經驗進行訓練, 實現了對行業知識的深度理解。 L2 層:場景化模型。包含更多細化場景的模型,更加專注于政務熱線、網點助手、 先導藥物篩選、傳送帶異物檢測、臺風路徑預測等具體行業應用或特定業務場景, 為客戶提供開箱即用的模型服務。 “5+N+X”架構的核心設計理念是分層解耦。它允許客戶與合作伙伴根據自身需 求,靈活地調用任意一層或多層模型的能力,既可以直接使用 L0 和 L1 的通用技 能,也可以在其基礎上結合自有數據,快速構建并迭代自己的 L2 場景化模型。這 種架構是華為對大模型商業化路徑的判斷,華為更聚焦其擁有傳統優勢的 B 端行 業市場。 這一戰略選擇,反過來又進一步凸顯了其“軟硬一體”模式的必要性。行業客戶 對 AI 解決方案的要求遠比普通消費者苛刻,他們更關心模型及硬件的可靠性、數 據的安全性、部署的成本效益以及長期的技術支持。華為云提供了工業級的解決 方案:在可靠性上,其昇騰 AI 云服務承諾千卡訓練 30 天長穩率達到 90%;在數 據安全與合規上,則提供公用云、大模型云專區、混合云等多樣化的部署形態, 以滿足不同行業客戶的嚴苛標準。通過從芯片、框架到模型的全棧垂直整合和深 度優化,華為為行業客戶提供一個性能可預期、安全可控、成本可負擔的端到端 解決方案。因此,盤古 3.0 的發布,進一步明確了華為 AI 的商業模式和市場定 位。
4. 盤古 5.0 發布、盤古 5.5 全面擁抱 MoE,體現從應用深化到架構升 維的演進
從 2024 到 2025 年,華為盤古大模型的發展呈現出一條從應用場景深化到核心架 構升維的清晰路徑。在 2024 年 6 月的開發者大會上,盤古大模型 5.0 的發布標志 著其向千行萬業的深度滲透。其核心是“全系列、多模態、強思維”的全面升級, 推出了從十億級(E 系列)到萬億級(S 系列)的完整模型矩陣,并著重強化了模 型在工業設計、自動駕駛、具身智能等領域的復雜任務規劃與工具調用能力。 在此基礎上,華為于 2025 年 6 月發布的盤古大模型 5.5,則正式標志著其技術路 線的又一次重要演進,即全面擁抱并深度優化混合專家(MoE)架構。這背后, 是 Pangu Ultra MoE(718B 總參數)和 Pangu Pro MoE(72B 總參數,16B 激活參 數)等一系列技術探索的落地。 這一系列新模型的發布,其核心驅動力是將系統效率和硬件親和性提升到了新的 高度。與早期的 PanGu-Σ采用的非學習式 RRE 路由不同,新的 MoE 模型采用了 更主流的可學習門控網絡,但在路由機制上進行了重要的創新。Pangu Pro MoE 模 型中引入了“分組專家混合”(Mixture of Grouped Experts, MoGE)架構,通過將 專家分組并強制從每個組中激活固定數量的專家,以結構性的方式緩解了傳統 MoE 在分布式系統中的負載均衡難題。
Pangu Ultra MoE、Pangu Pro MoE 的關鍵超參數,如隱層維度、網絡深度、專家數 量等,都有通過復雜的系統仿真流程,針對昇騰硬件平臺(如 Ascend 910B/C 平 臺、新一代昇騰 AI 云服務所基于的 CloudMatrix 超節點 Supernode 架構等)的特 性進行反復迭代和尋優的結果。這表明華為的模型設計理念:在設計之初就將硬 件的性能邊界作為核心約束,去尋找一個能在該硬件上運行效率最高的模型架構。 這一演進過程,本質上是華為 AI 戰略從“點”的突破,到“面”的拓展,再到“體” 的立體化構建過程。PanGu-α是一個技術單點的突破,解決了“有沒有”的問題。 PanGu-Σ和盤古 3.0/5.0 將技術能力拓展到萬億參數和行業應用的廣闊平面,解決 了“能不能用”和“用在哪”的問題。而盤古 5.5 所代表的 MoE 系列模型,與新 一代昇騰 AI 云服務的深度結合,則標志著華為正在構建一個軟硬件深度融合、自 成體系、閉環優化的 AI 生態。這個生態的效率可以用具體的指標來衡量:例如, Pangu Ultra MoE 論文中披露其在 6000 卡昇騰集群上實現了高達 30.0%的模型算 力利用率(Model Flops Utilization,MFU),并取得了媲美 DeepSeek R1 的性能。 這并非單個模型或單款硬件的貢獻,它代表了一種基于全棧整合的系統級能力, 這構成了華為在 AI 領域的一項關鍵競爭力。