接下來從算法模型、算力 和數據三方面對多模態大模型的技術原理進行深入分析。
1.算法方面,多模態大模型技術壁壘更高,可拓展性更強
自然語言類大模型的訓練是對不同文字信息編解碼的過程。自然語言類大模型的訓 練數據類型較為單一、組織方式比較有規律性。在語句的分析中,標點符號、空格是 AI天然的可識別分隔符,可簡單快速的識別不同語句。其次,在字詞的屬性(主謂 賓)等較為固定的情況下,語句中的語義信息的提取和識別有規律可循。將標點符 號、不同屬性的字詞編碼,根據其在文中的作用對編碼反復進行排列組合的訓練即 可以得到自然語言類的大模型。
多模態大模型開發的難度更大,技術壁壘更高。與自然語言類大模型相比,多模態 大模型需要對多種類型數據進行編碼、配對、擬合,訓練過程更加復雜。在“文字圖像”的對照訓練的過程中,首先通過分別解構文字和圖像的內容,將各自內容中 的單一元素抽象出來,單獨編碼;然后再對文字和圖像不同編碼間建立一一映射的 關系,最后得到的“文字-圖像”的編碼配對組合即是多模態模型的雛形。對圖像類 數據的編解碼難度更大。圖像數據是大量像素排列組合而成的,不僅單個像素的固 定屬性難以確定,其排列組合的方式也無規律可循??傮w而言,多模態大模型需要 處理的數據類型更多、開發難度更大、技術壁壘更高。

多模態大模型的拓展性較好。多模態大模型采用多種類型數據的編碼配對擬合的方 法訓練得到。除了“文字-圖像”兩種類型的數據可以建立編碼配對組合外,我們也 可以建立類似“圖像-音頻-文字”等多種類型數據間的編碼配對組合,從而訓練出通 用性更強、應用場景更豐富的多模態大模型。谷歌在2023年3月發布的Palm-E多模態大模型的訓練數據不僅包括文字、圖像、語音類數據,還包括三維空間狀態和感 知數據,除了具備一般語言來大模型的能力外,還能執行視覺問答、感知推理、機器 操作等復雜的任務。我們認為,多模態大模型可通過增加訓練數據類型,打造出交 互方式更多、生成內容更豐富以及更加泛化的能力,可拓展的應用場景更加豐富。
OpenAI已推出多款多模態大模型,并且開放了API。OpenAI已經開發的多模態大模 型包括可識別圖像大模型GPT-4、文生圖模型DALL?E 2、以及語音轉文字模型 Whisper。近期,以上多模態大模型的API接口陸續開放供程序開放人員調用。在不 同場景中,傳統軟件廠商在既有軟件產品上調用多模態大模型的API進行二次開發, 可有效提升其產品的智能化水平和用戶體驗。我們判斷,OpenAI的多模態大模型在 開放API接口后,其在各場景的滲透有望呈現出加速和擴散的趨勢,推動不同應用領 域IT產品的智能化升級。GPT4、DALL?E 2和Whisper模型的具體介紹如下: (1)GPT-4:2023年3月,OpenAI推出了GPT-4多模態模型并開放了API接口,不 僅在對話的準確性、語言豐富性以及長文本生成能力上較GPT-3.5有較大提升,還可 識別、理解圖像類的數據,并根據圖像內容與用戶進行互動問答。我們認為,相較于 ChatGPT自然語言類模型,GPT-4多模態模型與人類可交互的信息類型更多、信息 量更大、通用性更強、應用場景更加廣闊。 (2)DALL?E 2:DALL?E大模型是OpenAI于2021年1月公布的產品,并于2022年4 推出第二代,可根據自然語言的描述創作高質量的圖像。DALL?E大模型的文生圖功 能的訓練過程是將圖像的特征提取后抽象為一組編碼,將其與文字的編碼建立一一 映射的關系。在推理階段,DALL?E大模型可根據用戶給的文字提示詞,通過自回歸 算法或擴散算法,推演出圖片的編碼,將編碼重新組合后得到最終的圖片。2022年 11月,OpenAI將DALL?E 2的API開放供第三方調用。 (3)Whisper:Whisper大模型是OpenAI于2021年9月推出的產品,可將語音信息 轉換為文字信息。其可實現多語言、多方言以及嘈雜背景音環境下的語音轉換,識別和轉換的準確率較高。2023年3月1日,OpenAI宣布開放Whisper大模型的API,供 程序開放人員調用。
谷歌的Palm-E大模型可用于機器操作。2023年3月,谷歌和柏林工業大學共同發表 論文《PaLM-E: An Embodied Multimodal Language Model》,對其已開發的PaLME多模態大模型的訓練方法、訓練環境及通用化效果進行了詳細闡述。擁有的5620億 參數的PaLM-E大模型是在語言類模型PaLM(5400億參數)和視覺類模型ViT(220 億參數)的基礎上開發的。通過在預訓練的語言類大模型中嵌入圖像、狀態、感知等 多類型數據,PaLM-E模型不僅具備通用化語言能力,還能執行視覺問答、感知推理、 機器操作等復雜的任務。相較于自然語言類AI模型,PaLM-E多模態模型具備的能力 得到了很大程度的提升,其功能拓展如下: (1)機器人操作:嵌入PaLM-E模型的機器人手臂可以執行人類給出的語音指令。 (2)空間感知:PaLM-E模型可以識別三維空間的物體并根據人類指令給予實現目 標的動作規劃。 (3)視覺問答:根據圖像內容,PaLM-E可以和人類進行自由對話。 (4)人機對話:PaLM-E可應對較多話題的日常交流。
2023年5月,谷歌召開2023年I/O開發者大會,發布最新大語言模型PaLM 2,融入AI 能力的搜索引擎、升級版聊天機器人Bard和Workspace中的AI工具包Duet AI等。在 2023年I/O開發者大會上,谷歌推出了最新一代大語言模型PaLM 2,其基于 Pathways架構,使用TPU v4和JAX框架訓練,在高級推理任務,包括代碼和數學, 分類和問答,翻譯和多語言能力,以及自然語言生成方面都比前一代PaLM大模型表 現得更好。我們認為,此次谷歌發布大模型并導入旗下產品,有助于谷歌增強與其 它生成式AI大模型廠商競爭的能力,展示了谷歌在人工智能領域的強大創新能力和 產品化落地能力。
Meta公司的ImageBind模型融合了6種類型的訓練數據。2023年5月,Meta公司推 出的多模態大模型ImageBind融合了文本、圖像/視頻、音頻、熱量、空間深度、三維 慣性(位置和運動)數據。其以某一物體的視覺類數據為核心,設置了多種傳感器搜 集對應的聲音、3維形狀、熱量以及運動數據。ImageBind的訓練是通過將各種類型 的數據在多維向量空間中建立一一映射關系,使其具備跨模態的能力,具體包括: (1)多模態信息轉換:根據單一類型的信息,生成對應的多種類型的信息。例如, 根據火車汽笛聲,即可生成多張火車的圖像,或是火車在某一場景中的空間深度信 息,或是火車鳴笛的情境描述文字。 (2)組合信息轉換:在輸入兩種不同類型的信息進行嵌入和疊加后,可智能化提取 其組合信息。例如,將一張小鳥的圖片數據和一段摩托車的音頻數據輸入到 ImageBind后,可自動生成多張摩托車騎行時小鳥飛翔的圖像。

國內的多模態大模型主要集中于文字和圖像信息的轉換。當前,國內廠商推出的多 模態大模型多以文生圖或圖像描述生成文字為主等。與海外相比,國內多模態大模 型融合的數據類型較少,應用場景有限,通用性有待提升。不同廠商有不同的自身 技術優勢及數據積累領域,因此不同多模態模型在不同細分領域各有優劣。典型例 如百度在搜索領域、阿里巴巴在電商領域、商湯在視覺領域均有其獨特積累及數據, 在這樣的技術調教及數據喂養下,生成的多模態大模型自然也各有特點。
在文生圖多模態大模型領域,百度文心ERNIE-ViLG 2.0模型已具備較強競爭力。百 度文心ERNIE-ViLG 2.0模型通過引入基于時間步的混合降噪專家網絡,讓模型在不 同的生成階段選擇不同的“降噪專家”,從而提升生成圖像的精細度。在提升圖文一 致性方面,該模型通過視覺、語言等多源知識指引擴散模型學習,強化文圖生成擴 散模型對于語義的精確理解,以提升生成圖像的可控性和語義一致性。在圖文相關 性和圖像保真度兩個維度的人工評估上,ERNIE-ViLG 2.0相對DALL-E 2 和Stable Diffusion等模型已具有一定優勢。
2.數據層面,多模態大模型需要處理的數據量龐大、數據類型多樣
多模態大模型的訓練數據量龐大、數據類型多樣,需要大數據產品的支持。從傳統 AI模型向多模態大模型發展的過程中,數據的計算、分析、轉換和存儲方式也發生著 較大變化。過去識別類AI模型(物體識別、人臉識別)訓練數據的類型較為單一且數 據量較小,多數情況下傳統的集中式數據庫即可滿足訓練數據的預處理、存儲和分 析需求。在自然語言類大模型出現后,訓練數據量快速增長到TB級別,導致其部分 場景中的數據訓練需要采用分布式架構的數據平臺產品才能解決。多模態大模型訓 練的數據量龐大、數據類型多樣,需要分布式架構下的大數據產品才能滿足其數據 訓練的要求。我們認為,未來分布式大數據軟件產品將在多模態大模型的開發過程 中扮演重要的作用。
分布式大數據平臺較好的滿足多源、異構的數據處理需求。分布式大數據平臺是一 個集數據接入、處理、存儲、查詢檢索、分析挖掘等為一體的平臺。而數據庫是按照 數據結構來組織、存儲和管理數據的倉庫。在異構的分布式數據庫中,不同的節點 可采用不同的數據模型、數據管理工具、操作系統和硬件。各子節點通過應用程序 接口、全局模式和聯邦計算等方式實現不同數據類型的信息共享及融合分析。總體 而言,分布式大數據平臺具有以下優勢: (1)單機硬件性能要求較低,擴容成本較低:在分布式架構中,軟件平臺可搭載于 普通的PC服務器上,擺脫了對小型機、高端存儲等高價格硬件設備的依賴,擴容的 成本較低。 (2)海量數據處理能力,擴容過程便捷:分布式架構采用多臺服務器,存儲和計算 資源天然比集中式架構的單臺服務器要多,擴容便捷,可擴展性強。 (3)多源數據融合處理和分析能力:不同節點的數據平臺上可存儲和計算不同類型 的數據,各節點數據處理和分析的結果匯總和集成在控制節點后可實現較好的融合 分析。
向量數據庫可滿足多模態大模型中較多的向量相似性搜索需求。多模態大模型和用 戶交互的信息往往包含大量的非結構化的數據。例如,用戶將圖片輸入到GPT-4后, 就圖片信息進行問答。在這一過程中,原始的圖像(由像素組成)需要轉化成為向量 數據才能被多模態大模型識別和理解,之后這一組向量數據需要遍歷龐大的神經網 絡,搜索與之對應的另一組向量數據后才能生成用戶想要的文字。在多模態大模型 中,向量搜索的過程往往耗時較長,可能會影響到即刻需要得到內容生成的用戶體 驗。而向量數據庫通過ANN(Approximate Nearest Neighbor)算法給不同的向量數 據構建索引,有效提升搜索效率,縮短生成內容的反饋時間。
2023年5月,星環科技發布向量數據庫產品Transwarp Hippo。Hippo主要用于AI領 域,支持快速高效的數據存儲和檢索以及管理向量式數據集,能夠高效地解決向量 相似度檢索、高密度向量聚類等常見的AI問題。與開源的向量數據庫不同,Hippo具 備高可用、高性能、易拓展等特點,支持多種向量搜索索引,支持數據分區分片、數 據持久化、增量數據攝取、向量標量字段過濾混合查詢等功能,能很好地滿足企業 針對海量向量數據的高實時性查詢、檢索、召回等場景。 我國在分布式大數據平臺領域與海外廠商的性能、生態方面的差距較小。從技術演 進角度而言,我國分布式數據平臺技術與海外公司發展歷史相當。基于Hadoop等開 源生態,國產分布式大數據平臺快速開發和迭代,且在金融、公共部門、能源等行業 商業化落地過程中持續打磨產品,性能與海外競品差距較小。以星環科技TDH為代 表的大數據產品不僅憑借分布式架構的優勢對傳統數據庫Oracle、IBM DB2以及 Teradata等傳統數據庫實現了較好的替代,還以較高的性價比和安全性實現了 Ealstic Search、CDP等海外分布式架構數據產品的替代。
隨著多模態大模型的訓練和應用的增多,國產大數據產品和向量數據庫有望快速增 長。分布式大數據產品擁有的海量、異構、多源數據的處理能力,以及向量數據庫的 高效數據搜索能力,在多模態大模型的訓練和推理中有較好的應用前景。另一方面, 大數據是新興技術,發展時間較短,國產大數據產品和海外競品的差距較小。在大 數據領域,星環科技技術積累深厚、技術原創性強,已實現對關鍵組件和核心功能 的自主研發,有望受益于多模態大模型的快速滲透。我們認為,在各科技公司對于 多模態大模型持續研發投入,以及AI大模型在各行業加速滲透的趨勢下,國產大數 據產品有望迎來發展機遇,實現快速成長。
3.算力層面,海量和多源的數據處理需要更大的算力支持
表達同級別的信息量,非結構化比結構化所需的數據量更大。同一數據大小情況下, 不同數據類型所包含的信息量不同。一般而言,文字類的數據組織方式較為簡單, 同級別的數據量可包含的信息量較大,例如1MB的數據量可包含500頁的文字內容。 與之相比,圖像、音頻、網頁等非結構化數據組織方式更為復雜。一張圖片是由成千 上萬個像素點組成;音頻的組織方式是由一系列的數據幀組成。同級別數據量的非 結構化數據包含的信息量較小,例如1MB的數據只包含1張2048X1536像素的JPEG 格式圖片或1分鐘MP3格式的音頻。因此,相較于訓練數據為純文字的自然語言類大 模型,多模態大模型的訓練過程若要包含相同量級的信息,其所需的非結構化數據 的數量更大。

OpenAI的大模型生成圖像的成本高于生成文字的成本。OpenAI的自然語言大模型 的收費標準是0.002-0.012美元/1000 tokens。Tokens是包括了單詞、標點符號在內 的字符,因此可以簡單理解為單個文字。與之相比,多模態大模型DALL?E生成圖片 的價格為0.016-0.02美元/張。從用戶需求角度,用戶與平臺單詞對話所需生成內容 是文字信息在千個單詞的級別,是圖片信息則在1-4張圖片之間。因此,單次對話對 于圖像信息生成所需的成本要高于文字信息生成的成本。我們認為,多模態大模型 需要處理的非結構化數據較多,相較于自然語言類模型,在訓練和推理階段消耗的 成本更大,所需的算力支持更高。
英偉達AI芯片每秒鐘推理圖像類模型(3D U-Net)遠低于自然語言類模型(BERT)。 針對不同的AI模型,英偉達的AI芯片推理計算的性能不同。以A100為例,其對BERT 自然語言模型推理運算性能為每秒1828次,而對3D U-Net醫療影像模型的推理運算性能為每秒4次。H100在采用更先進制程芯片,矩陣運算性能優化的情況下,其推理 運算性能有較大提升。我們認為,多模態大模型所需處理的數據類型更多、算法更 復雜的情況下,在應用和推理階段對算力的消耗也更大。未來,隨著多模態大模型 開發量和應用量的增加,AI芯片的需求有望加速增長。
英偉達H100對大模型運算的性能較A100提升較大。2022年3月,英偉達推出Hopper 架構的新品H100,浮點數算力較A100有2.6倍提升,整數算力較A100有4.8倍提升。 H100的算力提升不僅通過采用4nm先進制程的方式從物理層面提升晶體管密度芯 片,在軟件層面還針對大模型設計了Transformer引擎,有針對性的提升大模型的算 力水平。在GPT-3大模型訓練任務中,H100的速度可以達到A100的4倍。2023年3 月,英偉達又推出了H100 NVL產品。其通過拓展GPU內存帶寬,升級GPU和GPU 互聯技術NVLink,將產品在大型計算集群中的性能進一步提升。在GPT-3大模型訓 練任務中,搭載H100 NVL的AI服務器的速度達到了搭載A100的服務器12倍的效果。
國產AI芯片已經追趕上英偉達Ampere架構GPU的水平。國產高端AI芯片在過去幾 年性能有了較大提升,以華為昇騰910和寒武紀思元370為代表的國產AI芯片已經追 趕上英偉達Ampere架構下的AI芯片的性能,但距離其最新一代H100仍有一定差距。 我們判斷,隨著國產AI芯片與英偉達等海外競品性能差距逐漸縮小,AI芯片國產替代 范圍有望擴大。另一方面,在芯片制造環節,中國大陸晶圓廠的先進制程芯片規模 化量產能力與國際一流廠商仍有一定差距。未來,AI芯片國產替代的節奏仍取決于 美國對華實施高端芯片出口管制政策的變化以及芯片制造產業鏈自主可控建設的進 展。