交換機市場不斷擴容,關注 AI 以太網滲透及 400G/800G 高速化趨勢。
1.全球以太網交換機市場不斷擴容,數據中心場景是未來重點
全球以太網交換機市場不斷擴容。根據 IDC,2023 年全球以太網交換機市場規模達到 460 億美元,同比增長 18.8%,連續兩年增速高于 18%,23 年增速達到 2014-2023 年區間新 高,主要系 23 年 AIGC 帶動下北美交換機廠商率先放量,2018-2023 年全球以太網交換機 市場規模 CAGR 為 9%。從出貨量來看,2023 年全球以太網交換機端口出貨量達 9.07 億 個,同比增長 5.4%,較 2021/2022 年出貨量增速 18.6%/12.6%有所下降,系 AI 與云計算 組網趨勢下 100G 以上高速率端口出貨增加,而低速端口出貨減少所致。
未來空間:28 年全球數據中心交換機潛在市場空間接近 400 億美元。根據 Arista 2Q24 業 績推介材料援引 650 Group 預測,2028 年全球數據中心(以太網)交換機市場空間接近 400 億美元,其中北美 TOP 5 云廠商(亞馬遜、蘋果、Meta、谷歌、微軟)將貢獻接近 200 億美元,占比 50%;2028 年全球園區(以太網)交換機市場空間超 200 億美元。綜合來看, 650 Group 預測 28 年全球以太網交換機市場規模約 600 億美元,數據中心潛在空間占 2/3。
2.需求:24 年北美云廠商資本開支逐季增長,指引保持樂觀
需求側,3Q24 海外云廠商資本開支延續高增趨勢。3Q24 MAMG(微軟、亞馬遜、Meta、 谷歌)合計資本開支同比提升 61%至 575.20 億美元,從 2Q23 開始保持逐季增長,其中, 亞馬遜/微軟/谷歌/Meta 3Q24 資本開支分別為 212.78/149.23/130.61/ 82.58 億美元,同比 增速分別為+88.3%/+50.5%/+62.2%/+26.2%。根據 Factset 一致預期,2024 年 MAMG 合 計資本開支將同比增長 47.3%至 2103 億美元。 云廠商對 24年、25年資本開支展望較為樂觀:根據 MAMG四大云廠商在 2Q24-3Q24(CY) 兩場業績會中的表述,微軟表示 FY25 的資本支出將高于 FY24,未來資本支出將環比增加; 谷歌指引 2025 年資本支出將相比 2024 年有額外的增長,但同比增幅沒有 24 年相對 23 年 的大,并表示對 AI 投入不足的風險遠高于投資過度的風險;亞馬遜指引 2024 年總資本支 出約為 750 億美元,同時 2025 年支出將超過 2024 年;Meta 預計 2024 年資本開支將在 380-400 億美元(上季度指引范圍為 370-400 億美元,本季度再次上調下限),同時預計 2025 年資本開支將大幅增長。
3.趨勢#1:性能提升+需求變化+海外巨頭引領,以太網在 AI 集群中的滲透率有望持續提升
InfiniBand 與以太網同為常見網絡協議,IB 原生支持 RDMA,提供低時延+無損傳輸,適 配 AI 網絡需求。InfiniBand(IB)、RoCE 和 TCP/IP 是分布式存儲網絡中較常使用的協議, 前兩者支持 RDMA(遠程直接內存訪問)技術。相較于 TCP/IP 通過內核發送消息從而產生 較高的數據移動和數據復制開銷,RDMA 通過內核旁路機制和內存零拷貝機制可提供高吞 吐、低延遲的網絡通信:1)內核旁路機制,允許應用與網卡之間直接的數據讀寫,將服務 器內的數據傳輸時延降低到接近 1us;2)內存零拷貝機制,允許接收端直接從發送端的內 存讀取數據,繞開核心內存的參與,較大地減少了 CPU 的負擔,提升 CPU 的效率,綜合 下來 RDMA 尤其適合在大規模并行計算集群中使用,比如 AI/ML 和 HPC。Infiniband 在設 計之初便考慮了 RDMA,從硬件級別保證了可靠傳輸(無損),提供更高的帶寬和更低的時 延,但是成本較高,需要支持 IB 網卡和交換機,而 RoCE(RDMA over Converged Ethernet) 是傳統以太網引入 RDMA 后的技術,雖具備 RDMA 的一些機制特點,但在時延、無損傳輸 上相較原生支持 RDMA 的 IB 仍有差距。

過去一年來海外 AI 產業鏈高景氣度驅動 IB 交換機需求高增長,IB 在全球 AI/HPC 場景中 占據較高份額,以太網交換機尚未放量。自 ChatGPT 出圈以來,海外 AI 產業鏈保持著較 高景氣度,英偉達數據中心網絡業務持續高速增長,其中,2Q24 英偉達數據中心網絡產品 收入同比增長 114%,連續 5 個季度同比增速在 90%及以上,遠高于同期海外以太網交換 機廠商的收入增速,我們認為主要系英偉達 InfiniBand 交換機產品在高帶寬、低延遲、無 損傳輸等性能符合 AI/HPC 集群的需求,且與其計算 GPU 芯片產品高度綁定,因而出貨量 高速增長。過去,AI/HPC 網絡多以 InfiniBand 組網解決方案為主,根據 Top 500 List 統計, 截止 2024 年 6 月,全球超算能力前 500 的計算中心中,IB 網絡方案占據 46%的份額。相 較而言,以太網方案在全球前 500 的計算中心中的占比僅 28%,且 2023 年高速以太網交 換機在 AI 網絡中的放量并不十分明顯,例如,Arista 在其 2023 年年報業績會上表示,2023 年其 AI 網絡業務仍處于試點階段,收入貢獻體量較小。
進入 2024 年,我們看到 AI 以太網興起的多種跡象,我們認為,以太網在 AI 集群組網中的 滲透率有望持續增加,原因在于:1)性能提升,以太網與 IB 在 AI 組網中性能的差距有望 縮小,如華為在武漢人工智能計算中心網絡部署前進行對比測試,在 MPI、Benchmark 等 典型應用測試中,華為 RoCE 的網絡性能與 IB 網絡整體基本持平;2)需求變化,AIGC 應 用興起,AI 有望步入推理階段,屆時客戶對網絡性能的要求降低,而更加追求性價比,同 時以太網具備云上動態分租能力,相比 IB 更易于滿足未來靈活的、多租戶的云上推理場景; 3)海外巨頭引領,24 年以來海外巨頭相繼擁抱 AI 以太網,具體而言:a.長期以 InfiniBand 為主要技術路徑的英偉達在 1Q24 業績會中表達對其以太網方案 Spectrum-X 的高度重視, 并稱該產品的收入規模有望在一年內增長至數十億美金;b.博通在 1Q24 業績會中表示全球 最大的 8 個 AI 集群中有 7 個部署了博通的以太網解決方案,25 年將會有更多的超大規模集 群部署在以太網上;c.Arista 亦發布全新的以太網交換機平臺 Etherlink AI,支持 UEC 協議 的同時規模組網能力顯著增強,最高支持數十萬卡互聯。
趨勢#2:從云計算到 AI,網絡帶寬高速化(400G/800G)趨勢延續
我們回顧云計算發展時期,東西向流量激增曾推動網絡架構由傳統三層網絡轉向 Spine-Leaf,對交換機端口帶寬的速率要求持續提升。由于云和容器化基礎設施的普及, 東西向流量(服務器到服務器)持續增加,這類流量增加給傳統三層架構帶來困難,因為 服務器之間的通信需完整經過接入、匯聚和核心交換機,帶來較高延遲;Spine-Leaf 架構 確保設備間通信時具有更短的路徑(三跳可達,Leaf→Spine→Leaf),因此具備:1)低且 可預測的延遲;2)帶寬利用率高;3)拓展性好等優勢。Spine-Leaf 架構雖然相比傳統三 層網絡架構具有更強的東西向流量處理能力,但為了支持如此大規模的水平流量、避免出 現網絡擁塞,網絡必須升級端口速率以滿足高帶寬需求,因此 400G/800G 端口交換機成為 應對云計算這種數據密集型應用場景的理想選擇。
從數據密集型的云計算任務到數據+計算密集型的 AI 任務,網絡端口高帶寬的需求并未改 變。從云計算到 AI,一個非常重要的改變在于,云計算是數據密集型任務,而 AI 是數據+ 計算密集型任務,典型的 AI 訓練工作負載涉及數十億個參數和大量的稀疏矩陣計算,這些 計算分布在成千上萬個 XPU(GPU、TPU 等)上,這些 XPU 進行密集計算后與其他節點 交換數據,來自其他節點的數據將被歸約或與本地數據,然后啟動新的處理周期,在這個 計算-交換-歸約周期中,大約 20%-50%的作業時間被用于網絡通信,因此網絡的性能將對 AI 訓練任務的效率產生重要影響。 我們看到,云計算和 AI 對網絡的需求的“變與不變”:1)變化在于:a.本質上,云計算更 加強調數據的大規模傳輸、存儲和處理,而 AI 強調處理海量數據的同時,亦需兼顧大量的 復雜運算;b.網絡架構方面,云計算以葉脊架構為主流,葉脊架構能夠高效處理云服務帶來 的大規模東西向流量,但網絡架構有所收斂,而 AI 網絡以胖樹架構為主流,胖樹架構能夠 帶來所有路徑上帶寬完全對稱,這樣的對稱性能夠提供每個節點間的全帶寬通信,而不會 因為網絡擁塞或路徑不對稱導致帶寬損失,因此為無收斂網絡;c.延遲性能方面,AI 網絡 對“低延遲”的要求更高,原因在于 AI 網絡需要在各個節點間進行高頻的通信,尤其是 AI 訓練場景,任何延遲對于模型訓練的效率影響都非常可觀;d.可拓展性方面,云計算需要面 對大規模、多租戶、動態變化的計算和存儲環境,因而隨著云用戶和應用的拓展,網絡需 要快速、無縫地擴大容量,而 AI 對于可拓展性的需求更集中于集群內部通信,而無需處理 大量的動態資源變動,因此我們認為云計算對可拓展性的需求比 AI 更強;2)不變在于,云計算和 AI 任務在網絡高帶寬的需求上趨于一致,云計算涉及大量的數據 存儲、檢索、處理和分發,而大規模分布式 AI 訓練中,各計算節點也需要頻繁、大量的交 換訓練數據、梯度和參數模型,因而均需要 400G/800G 甚至未來的 1.6T 的高帶寬數據中 心網絡支持。
市場側驗證:目前全球 200G/400G 交換機高速增長,25 年后 800G 將逐漸成為主流。根 據 IDC 數據,2Q24 全球 200G/400G 以上交換機銷售合計收入達到 15.9 億美元,同比提 升 104%,環比提升 36%,相比 1Q22 2.9 億的水平已增長 454%,展現出市場因 AI 智算 中心建設對高速數據中心交換機的強勁需求。根據 Dell’Oro 在 2024 年 1 月的預測,2025 年以后 400G/800G 將逐漸成為數據中心交換機主流,25 年 400G/800G 合計占比有望接近 市場的一半,26 年以后 800G 交換機占比將繼續提升,成為第一大需求,屆時也有望開始 出現 1.6T 的市場需求,至 28 年高速數據中心交換機總市場有望超過 210 億美元。