理解世界,預測未來。
1.世界模型——預測未來的“夢境”。
對于世界模型,最早可以追溯到 20 世紀四 五十年代的心理學研究,認為任何動物可以依靠世界模型預測世界的下一個狀態。 谷歌在 2018 年發表了影響深遠的論文《World Models》,對世界模型做出了如下描述: 人類通常會以有限的感官所能感知到的事物為基礎,在內心建立一個世界模型,我 們所有的行為都基于這個內部的模型來展開。這樣的模型不僅能夠預測未來,而且 能夠根據我們當前的運動行為來預測未來的感官數據,我們能夠基于這種預測迅速 采取行動。以棒球為列,棒球運動員只有毫秒級的擊球時間,甚至比視覺信號從眼 球傳到大腦還短,因此運動員根本無法在揮棒過程中調整和規劃路線,之所以能夠 提前控制肌肉以正確的方式揮出球棒并擊中棒球,得益于他們大腦中的“預測模型”, 這個能夠預測未來世界狀態,在我們大腦中憑空演示一遍的“夢境”,就被稱為世界 模型。之后這篇論文里還構建了一套世界模型的體系,并通過游戲實驗發現,如果 讓模型在“夢境”中預測未來會發生的事情,那么模型的游戲技能將明顯提升。

世界模型也是對物理世界“常識”的理解。另外一個被經常提到的是人工智能 三巨頭之一的 Yann Lecun 的“World Model”。在 Yann Lecun 的著名論文《A Path Towards Autonomous Machine Intelligence》中提到,青少年可以在 20 小時練習中學 會開車,而人工智在大量的訓練中仍然無法實現良好的自動駕駛,因此動物和人對 世界的理解能力遠超當前人工智能和機器學習系統。人類和動物快速學習能力是基 于對于世界的基礎認識和常識。在人類最初出生的幾天,幾周,幾個月就會學習了 大量關于世界如何運轉的基本知識,如左右眼有視差,物體不會憑空產生、消失、 變形或傳送,有些物體的軌跡可預測(如無生命的物體)、有些物體的行為方式有些 不好預測(如風沙、水、風中的樹葉等),在此基礎之上,又會形成一些如穩定性、 重力、慣性等概念。后續抽象的概念正式基于這樣簡單的概念建立。有了這些世界 的知識(常識),動物或者人類就可以快速學習新事物,對合理與否進行判斷。當然 “具備常識”可以被認為是一種實現的路徑,基于對世界更深入的理解,最終更好 的“預測未來”。
2、 世界模型是自動駕駛助推器,助力模型訓練、驗證測試、甚至推理
世界模型可以有效賦能智駕。在自動駕駛領域,能夠準確預測駕駛場景未來的 演變至關重要,通過對場景即將發生的事件進行預判,汽車可以自如的進行規劃和 控制做出更明智的決策。怎樣構建這樣一個可以通過理解世界運行規律進而預測未 來的模型,學界和工業界都進行了不懈的探索。與大語言模型類似,玩家采用自回 歸的模型,將數據壓縮和提煉,在潛在空間通過無監督的訓練構建模型對未來進行 預測,之后通過不同的解碼器將預測好的信息解碼成為需要的表達方式進而構建世 界模型。從結果來看模型可以通過海量的數據一定程度上總結世界運行的物理規律 并對未來進行一定程度的預測。在自動駕駛領域,世界模型可以用來生成場景,也 可以直接用來做決策規劃。具體而言:(1)可以生成諸多逼真的場景,生成稀缺、 難以采集的場景,為模型訓練提供足量的數據;(2)同樣生成的場景亦可以作為仿 真測試工具對算法進行閉環驗證;(3)多模態的世界模型亦可以直接生成駕駛策略 來指導自動駕駛行為。
自動駕駛進入深水區,端到端逐步成為未來方向,世界模型重要性凸顯。一方 面,隨著自動駕駛走入深水區,玩家對數據的要求日益提升,廠家希望數據能夠模 擬復雜交通流、具有豐富的場景、廣泛收集各類長尾場景、并且具備 3D 標注信息。 而現實狀態下,數據的采集成本居高不下,部分危險的場景如車禍等難以采集,長 尾場景稀缺,同時 3D 標注的成本高昂,因此采用合成數據來助力自動駕駛模型訓練 測試成為頗具前景的發展方向,而世界模型恰為良好的場景生成和預測器。另一方 面,隨著端到端自動駕駛成為未來的發展方向,開發者需要依靠數據將駕駛知識賦 予模型,數據需求會伴隨模型體量的增加而擴大。此外更重要的影響在于,在仿真 和驗證環節,傳統的模塊化算法時代可以對感知和規控模塊分別進行驗證,感知端 可以進行開環的檢測(即將感知的結果和帶有標注的真實世界狀況直接對比即可, 不需要反饋和迭代),規控環節可以依靠仿真工具,將世界的狀況(各類場景)輸入, 通過環境的變化來給與模型反饋,進而閉環的(外部環境可以根據智能體的輸出變 化而改變,形成反饋)驗證規控算法的性能。這其中,感知環節更注重仿真環境的 逼真性,而規控環節更注重邏輯的豐富度。在端到端時代,感知和規控合二為一, 這要求仿真工具既可以逼真的還原外部環境,同時能夠給與模型反饋實現閉環測試, 盡管 Nerf、3D 高斯等等算法層出不窮,但能夠很好的做到自動駕駛全過程完整的閉 環測試亦難度較高,而世界模型則能夠很好的應對類似的場景。
3、 自動駕駛各方勢力發力研究世界模型
特斯拉的 World Model: 特斯拉世界模型可預測駕駛場景下的未來發展。特斯拉在 2023CVPR 對其端到 端模型進行了簡單的介紹,希望能夠構建一個完整的 4D 神經網絡,能夠理解世界運 行的規律。具體而言,世界模型可以根據過去的視頻預測未來場景的演化,形成幾 大功能:(1)預測未來;(2)在沒有本體實體的情況下幫助網絡學習;(3)行動本 身可以作為生成的條件;(4)自車的行為會影響生成的效果,比如左轉右轉會分別 生成不同的視角。(5)可以用于仿真;(6)可以生成圖像、幾何空間的信息、語義 信息等;(7)泛化性比較好。 經過訓練,模型具備了一定程度對物理世界的理解。特斯拉發現網絡可以聯合 預測汽車周圍 8 個攝像頭的信息;同時各個攝像頭的顏色保持一致,表明可以更好 地預測傳感器的特性;此外盡管開發者沒有顯式的要求它以三維或者非三維的方式 進行計算,網絡即自行理解了三維空間的概念,視頻中運動的物體也具有一致性,通過自然語言的提示,模型可改變視角;其可根據要求以相同的起點生成不同的結 局;對視頻語料的適應性好,可以通過行駛記錄、油管或者自己手機中的數據來訓 練這個模型。相比游戲引擎所生成的仿真場景,這樣的世界模擬器可以表示一些很 難用顯式系統描述的事物,如物體的意圖和行為等。
從感知基礎模型窺探特斯拉世界模型端倪。特斯拉在 2023 年 CVPR 的演講中介 紹到了其感知基礎模型的構建方式,算法中先將外部的信息經過特征提取網絡進行 壓縮和特征提取,送入基于 Transformer 的模型,構建對于 4D 的時空環境的理解。 之后根據不同的任務需求,加入不同的解碼器或者其他算法模塊來實現不同任務, 如自動駕駛加入表面輸出、體積網格輸出等,供后續的模塊使用,機器人也是同樣 的道理。并且我們看到特斯拉的模型中不光包含多攝像頭視角的視頻信息,還包含 里程計、自車軌跡等信息,當然特斯拉也提到,在如何將里程信息和視頻信息很好 的融合,以及如何提升模型的時空理解能力方面,亦做了大量工作。而我們看到這 樣的基礎模型和玩家們構建的世界模型出現了諸多相似之處。
Wayve:GAIA-1
GAIA-1 亦可實現對場景的理解。英國的端到端自動駕駛公司 Wayve.ai 在 2023 年發布了 GAIA-1 模型,它可以依靠視頻、文本和動作的輸入生成逼真的視頻。模型 可以生成分鐘級的視頻,同時可以生成多種合理的未來,模擬多種場景:如與道路 使用者的交互、自車行為的改變等,同時可依靠文字來對視頻中元素進行精細粒度 的控制,幫助自動駕駛模型的訓練和仿真。
多模態數據訓練后的模型亦呈現出對駕駛場景出人意料的認知。GAIA-1 模型呈 現出一些有趣的特點:(1)學習到了高級結構和場景動態:可以生成連貫的場景, 其中的對象位于合理的位置并且展示出合理的交互狀態,如路燈、道路規則、讓路 等,表明模型不僅記住統計模式,還理解世界上物體的排列和基本規則。(2)擁有 強泛化性和創造性:可以產生訓練集中尚未明確出現的對象和場景。(3)擁有情景 意識:可以根據上下文的信息生成連貫的動作和響應,并展示出對 3D 幾何的理解以 及道路使用者決策過程中的因果關系的理解,如可反應道路不平整引起的視角俯仰 等作用。
自回歸+擴散模型形成模型的骨架。GAIA-1 的構建采用了自回歸的世界模型和 視頻擴散模型結合的方式,原理上和大語言模型以及各類視頻生成模型相似,采用 向量化的表示,將預測未來轉變成預測下一個 Token 的任務。首先采用不同的編碼 器將圖像、文本、動作編碼和壓縮變成各類 Token,之后將其送入以 Transformer 為 基礎構成的世界模型中來對未來進行預測,最后將預測好的向量送入以擴散模型為 主體的視頻解碼器將其輸出成為視頻。

模型架構特殊設計來增強生成視頻的幀間一致性。在模型架構方面,GAIA-1 采 用了專門的設計的圖像分詞器(Image Tokenizer),以保證在對視頻信息進行切分的 時候,能夠有效壓縮原始圖像信息減少冗余和噪聲,同時能夠讓壓縮后的內容包含 較多的語義信息而非高頻像素信號。世界模型方面,采用因果掩碼的方式讓模型嘗 試預測未來。此外在視頻解碼器方面,GAIA-1 采用視頻去噪擴散模型,并讓模型在 擴散過程中對幀序列去噪(多幀同步生成),從而提高了視頻輸出的時間一致性。此 外對視頻解碼器在多個任務上進行訓練如圖像生成、視頻生成、自回歸解碼和視頻 插值等,因為同時訓練會提升單一任務的性能。
Wayve 訓練的 GAIA-1 呈現出良好的規模效應和潛力。GAIA-1 在數據方面采用 了 2019-2023 年在英國倫敦收集的 4700 小時,25Hz 的專有駕駛數據,對應大約 4.2 億張圖像。模型總共約 90 億參數,其中視覺編碼器部分(Image tokenizer)擁有 3 億參數,在 32 張英偉達 A100GPU 上訓練了 4 天;世界模型擁有 65 億參數,在 64 張英偉達 A100 GPU 上訓練了 15 天;視頻解碼器擁有 26 億參數,在 32 張英偉達 A100 上訓練了 15 天。模型顯示出顯著的規模效應,當將模型的參數量增加,或者 將模型的計算量增加,都可以顯著提升模型的性能,表明模型仍然具有較好的潛力。
英偉達: 英偉達的基礎模型基于多模態數據訓練,可生成逼真且靈活變化的駕駛場景視 頻。英偉達在近期 2024 年 GTC 大會上也展示了其在世界模型領域的新進展,通過 將多模態數據(傳感器參數、文字如天氣等、自車行為、2D/3D 檢測框、道路布局 等;Token 化的傳感器感知數據)輸入模型訓練并讓模型預測未來駕駛場景,自動駕 駛基礎模型可以穩定生成多個攝像頭拍攝到的駕駛場景演變,效果逼真。此外通過 語言提示詞也可以使得模型呈現的場景靈活變化,如告訴模型視角為前視攝像頭, 汽車正行駛在雪天的道路上,兩側道路的樹木被雪覆蓋,道路上也有雪散落,模型 可以生成逼真的相應駕駛場景。
學術界: 學術界的自動駕駛世界模型方案層出不窮。學術界尤其是 GPT 出現后在 2023 年和 2024 年涌現出一大批關于構建自動駕駛世界模型的方案。AI 創業公司極佳科技 和清華大學聯合推出的 DriveDreamer 在架構上和 GAIA-1 類似,但在輸入端包含更 多模態的數據如高精地圖等,可實現更加深入的理解,更加精確的控制駕駛場景的 生成,同時還增加了 ActionFormer 模塊來使得模型可輸出控制信號,之后的 DriveDreamer v2 結合了大語言模型和新的架構來增強模型的可塑性和一致性;此外 雙方還聯合推出 WorldDreamer,采用了新的架構結合 Transformer 和 Diffusion 優勢 進行視頻生成。曠世科技、早稻田大學、中科大等機構的論文中提出了 ADriver-1 模型,使用多模態大語言模型作為主干網絡,以自回歸的方式輸出控制信號,使用視 頻潛在擴散模型來生成未來的視頻輸出。德國信息技術研究中心和 KTI 推出的 MUVO 模型則包含三個部分,首先將視頻、點云信息進行解碼壓縮以及特征融合, 并和編碼過的行為數據一同輸入基于 Transformer 構建的世界模型,對未來進行預測, 之后通過不同的解碼器分別輸出 3D 占用網絡、激光雷達點云、圖像。中科院自動化 所提出的 DriveWM 采用多圖聯合建模提升了所生成駕駛場景的質量。
DriveDreamer 構建世界模型可實現未來場景的生成以及駕駛員可能相應產生 的動作。以極佳科技和清華大學聯合推出的 DriveDreamer 為例,模型主要采用注意 力機制和 Diffusion 模型構建。可對駕駛場景實現全面的理解,集成了多模態的輸入 數據如文本、視頻、高精度地圖、3D 檢測框、駕駛行為等,可以實現可控的駕駛視 頻生成和預測未來的駕駛行為。同時 DriveDreamer 還可以與駕駛場景互動,根據輸 入的駕駛動作預測不同的未來駕駛視頻。