谷歌作為云大廠中自研芯片的先行者和 AI 領域的奠基者之一,其自研的 TPU 是專為神經 網絡設計的 ASIC 芯片,具有矩陣乘法單元(MXU)和專有的互連拓撲等專用功能。
谷歌 TPU 對比其他科技廠商擁有先發優勢,主要在以下兩個方面: 1) 專為神經網絡的張量運算而設計,高度匹配自身生態。TPU 專為神經網絡設計,具有 矩陣乘法單元(MXU)、專有互連拓撲、多重切片等功能來優化模型訓練端。其不僅適 合訓練大模型,且對比通用 GPU 具備成本(TCO)優勢。此外,谷歌不僅已通過 TPU 實現包括 Gemini 在內的自身模型訓練,其專門為谷歌開源深度學習框架而定制,與 TensorFlow、PyTorch、JAX 等機器學習框架集成在一起,且已商業化落地,能為云端 客戶提供自研模型的硬件支持。對比 Meta 目前的 MTIA 系列芯片僅用于廣告推薦、信 息流等業務,在模型訓練領域性能仍較為不足;AWS 在硬件支持自身生態系統方面稍 遜一籌,其自研芯片主要通過實例來供客戶使用;微軟旗下 Maia AI 芯片則推出較晚, 目前僅優先為自身云服務提供支持。 2) 研發經驗豐富,已經歷多次迭代。TPU 自 2016 年開始推出,八年間已迭代至第六代, 對比 AWS 及 Meta 分別在 18/23 年才陸續布局,而微軟早年雖有布局但因選用 FPGA 而導致裹足不前。谷歌芯片研發經驗優于同業,且具備先發優勢。此外,AWS、微軟 及 Meta 在模型訓練上也仍需英偉達等外部廠商的支持,其中微軟計劃將在 2024 年直 接購買超過 40 萬個 GPU,用于訓練端和 Copilot /API 推理端;而 Meta 也聲稱在生成 式 AI 與模型端,公司仍以采購英偉達芯片為主。對比下谷歌已成功基于 TPU 完成對 Gemini、Gemma 等模型的訓練。
谷歌在硬件方面深耕已久,TPU 在架構與性能參數上不斷迭代。第一代 TPU 于 2016 年谷 歌 I/O 大會上正式發布,主要為谷歌云計算數據中心的機器學習應用提供,彼時僅面向推理 端,但從 2017 年推出第二代開始,TPU 已同時擁有訓練和推理能力,不僅能支持浮點數 運算,且具有更高的片上內存。2018 年發布的 TPU v3 旨在提高性能和能效以滿足不斷增 長的機器學習任務需求,但其應用范圍仍然受限于谷歌的生態系統和軟件包。第四代 TPU 于 2021 年發布,主要突破在于部署可重構光電路交換機(Optical Circuit Switch,OCS) 來快速動態重新配置芯片之間的連接,有助于在出現故障時實時調整。專為中大規模訓練 和推理而構建的 TPU v5e 于 2023 年發布。與 TPU v4 相比,TPU v5e 可為大語言模型提 供高達 2 倍的訓練性能和 2.5 倍的推理性能,并能節約一半以上的成本。Gemini 1.0 是基 于 TPU v4 和 TPU v5e 在人工智能優化基礎上進行的大規模訓練,在 TPU v5p 也會應用于 加速 Gemini 開發。 2024 年 5 月 15 日,谷歌于 I/O 大會宣布第六代 Trillium TPU,并于 10 月底正式推出預覽 版。Trillium TPU 通過改良芯片設計,包括擴大矩陣乘法單元(MXU)并提高時鐘速度,以 及提升 HBM 和芯片間互連(ICI)帶寬至 v5e 的 2 倍,使單芯片峰值算力對比 TPU v5e 提 高 4.7 倍,能效也比 v5e 高 67%以上。芯片擴展方面,Trillium 不僅通過 Multislice 技術能 在單個 Pod 中擴展至 256 個 TPU,且能通過多切片技術實現集群,從而每秒處理 PB 級數 據。目前谷歌 Trillium TPU 已于 24 年 10 月底推出預覽版。此外,目前谷歌僅通過谷歌云 服務平臺向外部客戶提供 TPU 的算力租賃服務,而未有將其作為硬件產品出售。
相較于 GPU,TPU 在 AI 領域具有以下優勢:1)性能:TPU 專為張量運算而設計,能針 對特定 AI 工作負載(訓練、微調和推理)進行經濟高效的擴縮,因此在特定情況下,神經 網絡的訓練和推理效率或更高。2)集成性:TPU 專門為谷歌開源深度學習框架而定制,與 TensorFlow、PyTorch、JAX 等機器學習框架集成在一起,可加速其工作負載,在一同使用 下效率或更高。3)成本:谷歌云上 TPU 相比 GPU 價格而言,配置 1 個 H100 芯片,內存 為 234GB 的 A3 虛擬機價格為 11.06 美元/小時,H100 現貨價格為 9.04 美元/芯片/小時, TPU v4/v5e/v5p/v6 的價格分別為 3.22/1.2/4.2/2.7 美元/芯片/小時,TPU 收費存在優勢。 不過,TPU 作為 ASIC 存在通用性較弱等問題。此外,TPU 的應用也在一定程度上受到英 偉達 CUDA 生態圈一家獨大的影響。谷歌云作為 AI 云服務商,需滿足有 AI 訓練和推理需 求的客戶,而英偉達 GPU 擁有生態圈成熟和開發者眾多的 CUDA,是目前大部分 AI 訓練 所必需的工具。因此,我們認為 TPU 或其他云大廠自研芯片不會完全取代英偉達的 GPU, 二者與英偉達 GPU 應能形成良性互補,并非零和博弈,但若未來科技廠商算法相對成熟, 設計 ASIC 去取代部分英偉達的算力也較為合適。此外,谷歌在自研 AI 芯片同時,也大量 采購英偉達 GPU,包括 H100 以及 Blackwell 平臺,也引入公司 AI 云基礎設施和超級計算 機架構中,目前已公布基于 Blackwell GB200 NVL 機架的預覽照片。對比微軟、AWS 與 Meta 亦同時采取自研+外購 AI 芯片齊頭并進策略,實現優勢互補與降本增效。
總的來說,我們認為:1)谷歌 TPU 或其他云廠商的自研芯片不會在一夜之間取代所有英 偉達的 GPU;2)若算法已相對成熟,可使用 TensorFlow 框架編程并在 TPU 上運行,可 有效利用其優化和加速,節省成本,或是性價比較高的選擇;3)面對英偉達 CUDA 的成熟 生態圈,云廠商自研芯片無需以完全取代作為目標,而僅需為客戶提供更多算力選擇即可 有效打開市場。
如今模型應用發展有兩大趨勢:1)單一文本模型向多模態大模型轉變;2)大參數模型向 輕量化與端側發展。谷歌在兩方面部署上均處于第一梯隊,對比同業模型競爭優勢明顯。 我們認為,在大模型競爭中,OpenAI 雖憑借早期先發優勢與商業化落地率先搶占市場, 但目前谷歌憑借自身硬件、數據與生態優勢,疊加以 Gemini 為主的“AI 全家桶”重振旗 鼓,逐漸搶回 AI 賽道上的主動權。如今 OpenAI 不僅模型迭代的速度開始變慢,且管理層 接連出現變動,23 年 11 月 CEO Sam Altman 出現領導力危機,24 年 5 月聯合創始人 IIya Sutskever 離職,9 月 CTO Mira Murati、首席研究官 Bob McGrew 和研究副總裁 Barret Zoph 均宣布離職,顯現出公司管理層內部或存在一定問題。對比下谷歌有望在此次 AI 競 賽中逐漸縮小與 OpenAI 的技術與份額差距。
各科技公司針對自身軟硬件優勢各有側重: 1) 谷歌憑借自身 TPU 與數據集賦能大模型發展,持續拓寬模型應用范圍。先后推出大語 言模型 PaLM、PaLM2,并加強垂直應用布局,依據特定領域的數據進行了模型微調, 以執行企業客戶的特定任務。多模態大模型 Gemini 在多項基準測試中的優秀表現已成 功挑戰到 OpenAI 一家獨大的地位。此外,谷歌在輕量化大模型、可交互生成式世界模 型上亦有部署,旗下 Gemma 系列及 Genie 先后推出以強化自身模型端競爭力。另外, 作為 Transformer 的發明者,谷歌也非常明白大模型的幻覺問題,因此,他們并沒有將 此技術直接應用到搜索里。不過,面對像 Perplexity 等“先搜索、后整理”的正確運用 大模型去整理爬蟲等搜索結果的后起之秀,我們認為谷歌也有必要急起直追,以鞏固其 在搜索的霸主地位,防止份額被進一步蠶食。 2) 微軟聯盟 OpenAI 在大模型領域占據先發優勢,多元布局欲打造 AI 模型帝國。2022 年 11 月 30 日,基于 GPT-3.5 的 ChatGPT 正式發布,開創了人工智能新紀元。微軟則 通過與 OpenAI 相互賦能,成為一時無兩的大模型領域領跑者。但近期 OpenAI 的各種 問題,包括多位高管和創始人的離職,加上競爭格局愈發激烈,以及 Scaling Law 的發 展開始眾說紛紜,并涉及到通用性(Artificial Generative AI)和垂直領域(domain expertise)應用的爭議等,也將影響微軟在 AI 應用的落地。截至 24 年 10 月,微軟已向 OpenAI 投資共計 137.5 億美元,并擁有 GPT-4o 和包括 DALL·E、Embedding、Whisper 等在內的所有其他 OpenAI 人工智能模型的獨家授權,讓其 Azure OpenAI 服務旗下模 型種類眾多且能商業化率先落地。而微軟自身也針對輕量化模型領域于 2024 年 4 月發 布開源模型 Phi-3,包含單語言模型的 mini、small 和 medium 版本和多模態的 vision 版本,助力邊緣智能終端部署,但先發優勢能否維持則有待觀察。 3) 亞馬遜也具備較完整的硬件端產品布局,專注 B 端客戶布局中間層服務。亞馬遜主要 聚焦 B 端客戶需求,其借助自研訓練芯片 Trainium 與推理芯片 Inferentia 具備構筑大 模型的成本優勢,擁有自研大語言模型 Amazon Titan,亦為 B 端提供 Amazon Bedrock 服務平臺,讓用戶能訪問來自 Anthropic、Cohere、Meta with Llama2 和 Stability Al 等豐富的 AI 模型庫。 4) Meta 深耕開源大語言模型 LlaMa,多模態與輕量級模型齊發力。Meta 深耕輕量化模 型領域,旗下 LlaMa 能以較小的參數量媲美主流大模型性能,并通過開源免費提供給 研究者和商業使用者。2024 年 4 月,Meta 發布 Llama 3,12 月更新到 Llama 3.3 版本, 使性能與效率雙升,并進一步節省算力。此外,Meta 不僅通過 ImageBind 實現跨多模 態創建聯合嵌入空間技術,還構建了針對翻譯、語音、圖像及視頻的多款輕量化模型。 5) 字節跳動豆包大模型嶄露頭角,快速工廠式復制 AI 應用。豆包大模型具備多模態處理 能力,日均 tokens 使用量超過 4 萬億,相比發布時增長了 33 倍。至 2024 年 11 月, 豆包 APP 的月活躍用戶數(MAU)已達到約 5998 萬。我們認為,字節跳動具備爆款 應用的生產能力,有望在 AI 垂類領域復制,但后續盈利能力仍待觀察。6) 百度飛槳+文心大模型打造中間技術層,賦能模型應用蓬勃發展。文心大模型 ERNIE 涵蓋 NLP、視覺、跨模態、生物計算和行業模型五大領域。目前,百度 AI 架構已具備 垂直一體式布局,下游行業覆蓋面廣泛,已有多家合作伙伴接入文心生態。
2023年 12月 6日,谷歌宣布多模態大模型 Gemini 1.0 正式上線。模型分為 Gemini Nano、 Gemini Pro、Gemini Ultra 三個版本,被用于從數據中心到移動設備的所有設備上,并將 滲透于整個 Google 生態中。谷歌在大模型領域深耕多時:公司于 2023 年 3 月發布聊天機 器人 Bard;4 月份將 Google Brain 和 DeepMind 人工智能實驗室合并;5 月份在 Google I/O 大會上,宣布新實驗室 Google DeepMind 開始研發 Gemini;歷經半年大規模開發,團隊 成果得以面世。2024 年 5 月,谷歌于 I/O 大會宣布推出 Gemini 1.5 Pro 和輕量化版本 Gemini 1.5 Flash。2024 年 12 月,谷歌宣布推出 Gemini 2.0,先行推出 Flash 實驗版本可供用戶 和開發者使用,目前尚未明確定價方式。
1) Gemini 1.5 Pro:首創大型模型長上下文窗口。不僅升級了翻譯、編碼、推理、音頻和 圖像理解等功能,且其私人預覽版上下文窗口已達 200 萬 tokens,對比遠超 GPT-4o 的 12.8 萬。在文本、代碼、圖像、音頻和視頻評估測試中,1.5 Pro 87%的表現優于 1.0 Pro,與 1.0 Ultra 大致相似。在 NIAH 評估中,1.5 Pro 在 99%的時間內都能從長文 本塊中找到所需嵌入文本。此外,Gemini 1.5 Pro 還具備情境學習技能,可從長信息中 學習新技能,而不需要額外微調。 2) Gemini 1.0 Ultra:谷歌最大、性能最強的模型。用戶能訪問 Gemini Advanced 使用 Gemini Ultra。Gemini Ultra 能有效執行編碼、邏輯推理、遵循復雜指令以及協作創意 項目等復雜任務。此外,移動端用戶也能使用 Android 和 iOS 來體驗 Gemini Ultra。 3) Gemini 2.0 Flash:最受開發者歡迎的模型,主打低延遲下的增強性能。2.0 Flash 在 關鍵基準測試中速度是 1.5 Pro 的兩倍。除了支持圖像、視頻和音頻等多模式輸入外, 2.0 Flash 還支持多模式輸出,例如與文本混合的原生生成圖像和文本轉多語言音頻。 此外還可以原生調用 Google 搜索、代碼執行以及第三方用戶定義函數等工具。 4) Gemini 1.0 Nano:設備端任務模型。可在支持 Android 的設備上運行,此外,需要使 用 Android 版 Google AI Edge SDK。2023 年 12 月,Google 官宣 Gemini Nano 將在 Pixel 8 Pro 上正式運行,有助于防止敏感數據離開手機,并提供在沒有網絡連接的情況 下獲取錄制的對話、采訪、演示等內容的摘要。 Gemini 模型采用多模態模型技術,發展前景廣闊。Gemini 1.0 模型建立在 Transformer 之 上,并使用 TPUv5e 和 TPUv4 進行訓練與優化,Gemini 2.0 則基于最新的 Trillium TPU 上 進行訓練和推理。預訓練數據集選取于網絡文檔、書籍和代碼。谷歌沒有像 OpenAI 構建 DALL·E 和 Whisper 那樣單獨訓練圖像和語音模型,而是直接建立原生多模態模型,這有 助于 Gemini 無縫理解和推理各種輸入,不僅優于 GPT-3.5 純文字大語言模型,也不需要 像 GPT-4 那樣依賴插件和集成來實現推理、編碼、文本、圖像、音頻等功能。
多維度基準測試展現 Gemini 性能,挑戰 OpenAI 一枝獨秀的地位。得益于谷歌專有數據 與多模態特性的支持,Gemini 1.0 Ultra 在基準測試中的 30 項上領先于 GPT-4,但幅度較 小。多任務語言方面,Gemini 1.0 Ultra 在 MMLU(大規模多任務語言理解)中的得分率高 達 90.0%,首次超越人類專家,對比 GPT-4 的準確率為 86.4%;圖像基準方面,Gemini 1.0 Ultra 無需從圖像中提取文本,能直接進行 OCR 處理,在 MMMU 基準測試中準確率為 59.4%; 代碼處理方面,Gemini 創建的代碼生成系統 AlphaCode 2 表現優于 87%的競賽參與者, 能夠理解 Python、Java、C++等高質量代碼。隨著谷歌 AI 產品逐步商業落地,未來將成為 OpenAI 有力的競爭對手,估值低于微軟的局面或將扭轉。 Gemini 2.0 推出思維模式,對標 OpenAI o1 模型,在“幻覺”處理方面更進一步。基于 Gemini 2.0 Flash,谷歌經過專門訓練推出 Thinking 模式,可使用思維(thoughts)來增強 其推理能力。與 o1 思維鏈(chain of thoughts)的關鍵區別是,Gemini 2.0 Flash Thinking 在進行過程中會明確展示其推理過程,而 o1 則會隱藏其步驟,對于需要確保在長思維鏈中 不會出現幻覺的領域來說,我們認為這是谷歌相對于 OpenAI 產品的重大進步。截止 2024 年 12 月,Gemini 2.0 Flash Thinking 模型已經躍居 Lmarena Chatbot Arena 的第一位,且 在編程、數學、創意寫作等各項評測任務上均為第一名。Targum 創始人和 CEO Alex Volkov 通過 10 個難題對 o1-2024-12-17 和 Gemini-2.0-flash-thinking 進行了對比測試,結果發現 這兩個推理模型的表現相當,而后者的速度更快。
Gemini 定價對標 GPT Plus,踏上大模型商業化落地萬里長征的第一步。目前,用戶能免 費使用 Gemini 聊天機器人,谷歌 Gemini Ultra 1.0 通過 Google One AI Premium 提供,具 有兩個月免費試用期,此后訂閱價格為 19.99 美元/月。對比 OpenAI 提供“GPT Plus”訂 閱價格為 20 美元/月。新貴 AI 搜索公司 Perplexity 同樣將其 Perplexity Pro 版本價格定位 在 20 美元/月。Google Gemini 開發者模式則分不同模型定價,其中 1.5 Flash 免費版本速 率限制在 15RPM,付費版本無限制,價格與 GPT-4o-mini 對標;1.5 Pro 免費版本速率限 制在 2RPM,付費版本無限制,價格與 GPT-4o 對標。
全新輕量化大語言模型 Gemma 系列除在 TPU v5e 和 v5p 上優化以外,也針對英偉達芯 片進行優化,跨設備兼容性提升。2024年2月,谷歌推出首款輕量化開源大語言模型Gemma, 其采用與 Gemini 相同的技術構建,分為 20 億參數和 70 億參數兩種規模,更類似 Gemini Nano 模型的 18 億和 32.5 億參數量。Gemma 配備多框架工具,能夠在 Keras 3.0、本機 PyTorch、JAX 和 TensorFlow 進行推理和微調。此外,Gemma 還具備跨設備兼容性,可 在筆記本電腦、臺式機、物聯網、移動設備、谷歌云中運行,并可部署在 Vertex AI 和 Google Kubernetes Engine(GKE)上。2024 年 5 月,谷歌宣布宣布推出 Gemma 2(27B 參數), 其采用全新架構,通過算法改進實現輕量化,其性能可媲美 Meta 參數更大的模型 Llama 3 (70B 參數)。
谷歌 Genie 打造可交互生成式世界。2024 年 2 月,谷歌發布 Genie,作為谷歌繼推出大模 型 Gemini、開源大模型 Gemma 之后的新模型。Genie 能接受文本和圖像提示,并生成類 似視頻游戲的交互式環境。Genie 參數量達 110 億,在 2D 平臺游戲的超過 200000 小時的 視頻上進行訓練。Genie 的核心組件基于 Vision Transformer 構建,可用于處理視頻等具有 時間和空間維度的數據,底層數據庫則基于大量游戲視頻建立。不同于 Sora、Runway 等 模型,Genie 生成的內容具備可交互屬性,用戶可通過文本對所生成虛擬環境中的角色動作 進行操控。此外,Genie 由潛在動作模型、視頻分詞器、動態預測模型三大核心組件組成, 其不僅能理解并推理每幀之間的潛在動作,還能逐幀預測視頻,并生成符合運動規律的序 列幀。Genie 也具備可模擬性,其能通過短視頻模擬物體的動態變化來訓練機械臂等多功能 智能體,有助于機器人的發展。2024 年 12 月,谷歌發布 Genie 2,在上一代的基礎上實 現了通用性的飛躍,不同于 Genie1 只能生成 2D 元素,Genie 2 能夠生成豐富的 3D 世界, 并具備例如對象交互、復雜的角色動作、物理建模以及預測其他 NPC 行為的能力。

2023 年初至今谷歌加碼投資多家 AI 獨角獸,豐富 AI 版圖。伴隨 2022 年末以 ChatGPT 為首的生成式 Al 走入大眾視野,谷歌在 2023 年對各領域 AI 初創企業的投資持續推進。根 據 Pitchbook 數據,自 2023 年起,谷歌已經投資包括 Anthropic、Hugging Face、Runway 在內的多家 Al 獨角獸企業。我們認為此舉或出于谷歌對拓寬業務渠道與鞏固生態壁壘的需 求,如推出 Claude 3 的初創公司 Anthropic。 2023 年初,谷歌已對 Anthropic 投資 3 億美元,并獲得該公司 10%的股權,2023 年 10 月 谷歌再次向 Anthropic 追加投資 20 億美元,AWS 也于 2024 年 3 月向 Anthropic 追加 27.5 億美元投資,總投資額達 40 億美元,使得 AWS 成為其主要云提供商。24 年 11 月 Anthropic 宣布將使用亞馬遜的 Trainium 和 Inferentia 芯片來訓練和部署其未來的基礎模型。我們認 為,谷歌二度注資 Anthropic 能增強谷歌云在 AI 模型部署上的生態豐富程度,同時也能在 與 OpenAI 的模型競爭中減少新樹敵,未來科技巨頭爭奪 AI 霸主的軍備競賽或更為激烈。
Anthropic 由 OpenAI 前研究副總裁 Dario Amodei 等人于 2021 年創立,旗下 Claude 系列 模型基于 Transformer 架構,且具備推理、視覺分析、代碼生成與多語言處理等功能,全面 對標 GPT 系列。2023 年 7 月 11 日發布的 Claude 2 單次可處理高達 10 萬 Tokens 的上下 文窗口,對比 GPT-4.0 Turbo 為 12.8 萬 Tokens。而在 MMLU 準則中,Claude 2 評分也僅 次于 GPT-4,且已被 Slack、Notion 和 Quora 等眾多公司使用。2024 年 3 月 4 日,Anthropic 宣布推出 Claude 3 系列,包括 Haiku、Sonnet 和 Opus 三種型號,能支持文字與圖像輸入, 并在速度與準確性優化的前提下支持 20 萬 Tokens 的上下文窗口。其中,Claude 3 Opus 首次在 MMLU、GPQA 與 GSM8K 等 10 項評分準則中超越了 GPT-4 與 Gemini 1.0 Ultra, 在 3 月發布之后曾經成功登頂 Chatbot Arena 排行榜第一,目前仍保持前十地位,成為 OpenAI 在 LLM 領域的有力競爭者。