如果你對(duì)該問(wèn)題感興趣的話,推薦你看看《計(jì)算機(jī)行業(yè)專題報(bào)告:Meta Movie Gen的論文告訴我們什么?》這篇報(bào)告,下面是部分摘錄的內(nèi)容,具體請(qǐng)以原報(bào)告為準(zhǔn)。
1.視頻生成模型:創(chuàng)新模型架構(gòu)實(shí)現(xiàn)高效訓(xùn)練
Movie Gen Video 訓(xùn)練過(guò)程分為三個(gè)主要步驟:低分辨率 T2I(Text to Image 文本到圖像)預(yù)訓(xùn)練:在低分辨率(256px)圖 像數(shù)據(jù)集上進(jìn)行預(yù)訓(xùn)練,讓模型學(xué)會(huì)基本的文本到圖像的生成能力,并形成 對(duì)基礎(chǔ)視覺(jué)元素的理解。
聯(lián)合低分辨率圖像和視頻預(yù)訓(xùn)練:通過(guò)同時(shí)訓(xùn)練文本到圖像和文本到視頻的 任務(wù),模型可以在相同的框架中生成圖像和視頻,從而共享視覺(jué)和時(shí)間建模 能力,有助于模型在處理時(shí)間維度時(shí),更好地捕獲視頻的運(yùn)動(dòng)特征。
高分辨率微調(diào):模型在高質(zhì)量的視頻數(shù)據(jù)集上進(jìn)行微調(diào),以提高視頻生成的 質(zhì)量。模型逐步提高視頻的空間分辨率(從 256px 提升到 768px),并進(jìn)行針 對(duì)性的優(yōu)化,有助于提高生成視頻的細(xì)節(jié)水平和視覺(jué)質(zhì)量,使生成的視頻更 加逼真、連貫。

創(chuàng)新模型訓(xùn)練架構(gòu),TAE+Flow Matching+Transformer 提升訓(xùn)練和推理效率。 Meta 訓(xùn)練了一個(gè)單一的時(shí)間自動(dòng)編碼器模型(TAE,Temporal Autoencoder)來(lái)將 圖像和視頻映射到時(shí)空壓縮的潛在空間(spatiotemporally compressed latent space) 中,使用預(yù)訓(xùn)練的文本編碼器對(duì)輸入文本進(jìn)行編碼,以獲得文本提示嵌入。Meta 使用流匹配(FM,F(xiàn)low Matching)訓(xùn)練方法,以采樣噪聲和用戶文本作為輸入, 最終通過(guò) TAE 解碼器將其映射回像素空間并生成圖像或視頻。過(guò)去的主干網(wǎng)絡(luò)以 DiT(擴(kuò)散 Transformer)為主,而 Meta 使用了 LLaMa3(Transformer)結(jié)構(gòu)。訓(xùn) 練過(guò)程對(duì)文本提示的處理分為三個(gè)部分:
UL2(統(tǒng)一語(yǔ)言學(xué)習(xí)范式,Unifying Language Learning Paradigms):可構(gòu)建一 種獨(dú)立于模型架構(gòu)以及下游任務(wù)類型的預(yù)訓(xùn)練策略(自監(jiān)督目標(biāo)),可以靈活 地適配不同類型的下游任務(wù)。使用大量純文本數(shù)據(jù)進(jìn)行訓(xùn)練,提供了強(qiáng)大的 文本推理能力。
Long-prompt MetaCLIP:通過(guò)對(duì)較長(zhǎng)文本標(biāo)題的 MetaCLIP 文本編碼器進(jìn)行微 調(diào),將輸入文本 token 長(zhǎng)度從 77 增加到 256。提供了與視覺(jué)對(duì)齊的文本表示, 有利于跨模態(tài)生成。
ByT5(Byte-to-byte Text-to-Text Transfer Transformer):基于 T5 架構(gòu)的預(yù)訓(xùn)練 字節(jié)級(jí) Transformer(不再處理 token,而直接作用于文本字節(jié)或字符),對(duì)噪 聲的魯棒性更強(qiáng),對(duì)拼寫(xiě)和發(fā)音敏感的任務(wù)上表現(xiàn)更好。
硬件與基礎(chǔ)設(shè)施:使用多達(dá) 6144 個(gè) H100 GPU 來(lái)訓(xùn)練多模態(tài)模型,每個(gè) GPU 都運(yùn)行在 700W TDP,配備 80GB HBM3,使用 Meta 的 Grand Teton AI 服務(wù) 器平臺(tái)進(jìn)行訓(xùn)練。每個(gè)服務(wù)器內(nèi)有 8 個(gè) GPU,通過(guò) NVSwitches 均勻連接。 服務(wù)器之間的 GPU 通過(guò) 400Gbps RoCE RDMA NICs 連接。訓(xùn)練任務(wù)由 Meta 的全球規(guī)模訓(xùn)練調(diào)度程序 MAST 進(jìn)行調(diào)度。
與大語(yǔ)言模型的比較:與大型語(yǔ)言模型(LLM)使用結(jié)構(gòu)化因果注意力掩碼 來(lái)強(qiáng)制 token 的因果性不同,Movie Gen Video 使用的全雙向注意力(full bidirectional attention),其核心優(yōu)勢(shì)在于其能夠雙向交互,增強(qiáng)模型對(duì)上下文的 理解深度。這種機(jī)制不僅允許模型在編碼器和解碼器之間雙向流動(dòng),而且還 能夠更精確地聚焦于問(wèn)題相關(guān)的文段部分,從而顯著提升了機(jī)器理解自然語(yǔ) 言的能力。此外,LLaMa3 使用分組查詢注意力(GQA)代替多頭注意力 (MHA),這減少了 K-頭和 V-頭的數(shù)量,從而減少了鍵(Key)和值(Value) 投影的總維度。這不僅減少了 FLOPs 和張量?jī)?nèi)存大小,還提高了內(nèi)存帶寬利 用率。
模型并行方法:LLaMa3 訓(xùn)練分為不同上下文長(zhǎng)度的階段。由于模型規(guī)模大、 上下文長(zhǎng)度極長(zhǎng),需要使用多種并行性來(lái)實(shí)現(xiàn)高效訓(xùn)練。Meta 采用 3D 并行 性來(lái)支持模型在參數(shù)量、輸入 token 和數(shù)據(jù)集大小三個(gè)維度上的擴(kuò)展,同時(shí) 允許水平擴(kuò)展到更多的 GPU。Meta 利用了完全分片的數(shù)據(jù)并行性、張量并行 性、序列并行性和上下文并行性。
TAE 用于將 RGB 像素空間的視頻和圖像編碼,進(jìn)入時(shí)空壓縮的潛在空間中學(xué)習(xí), 通過(guò)優(yōu)化目標(biāo)函數(shù),提高生成質(zhì)量和效率。TAE 基于變分自動(dòng)編碼器(VAE,采 用變分推斷的用于降維、數(shù)據(jù)壓縮和生成的神經(jīng)網(wǎng)絡(luò)),通過(guò)在 2D 空間卷積后加 入 1D 時(shí)間卷積,使得模型能夠更好地處理視頻的時(shí)間維度。TAE 將輸入的各個(gè) 時(shí)空維度(T 時(shí)間、H 高度、W 寬度)壓縮 8 倍,從而減少 Transformer 核心網(wǎng)絡(luò) 的整體序列長(zhǎng)度,使其能夠生成長(zhǎng)時(shí)間和高分辨率的視頻。TAE 的目標(biāo)函數(shù)在標(biāo) 準(zhǔn)的重建損失之外增加了一個(gè)懲罰項(xiàng),用于對(duì)遠(yuǎn)離均值的潛在值進(jìn)行懲罰,從而 限制模型生成高范數(shù)潛在點(diǎn)(high-norm latent dots),防止模型過(guò)度依賴局部高范 數(shù)(范數(shù)用于衡量矩陣的“距離”、“長(zhǎng)度”或者“大小”)信息而影響全局的學(xué)習(xí), 以解決生成視頻時(shí)出現(xiàn)的“斑點(diǎn)”偽影問(wèn)題。這種設(shè)計(jì)使得生成的視頻在視覺(jué)上更 加自然和一致,從而顯著提高了重建質(zhì)量和生成效果。
原始視頻和通過(guò) TAE 編解碼后的重構(gòu)樣本對(duì)比,發(fā)現(xiàn) TAE 可以在保留視覺(jué)細(xì)節(jié) 的情況下重建視頻幀。對(duì)于圖像和視頻幀中的高頻空間細(xì)節(jié),以及視頻中的快速 運(yùn)動(dòng),TAE 的重建質(zhì)量會(huì)下降。將經(jīng)過(guò) 8 倍時(shí)間壓縮的 TAE 模型與未經(jīng)過(guò)時(shí)間壓 縮的幀自動(dòng)編碼器(Frame-wise AutoEncoder)比較,視頻數(shù)據(jù)在結(jié)構(gòu)相似度(SSIM)、 峰值信噪比(PSNR)、初始距離(FID)表現(xiàn)相當(dāng),圖像數(shù)據(jù)方面 TAE 優(yōu)于幀自 動(dòng)編碼器。
Movie Gen 采用流匹配(Flow Matching)作為訓(xùn)練目標(biāo),避免了傳統(tǒng)擴(kuò)散模型中 的逐步去噪過(guò)程,而是通過(guò)找到生成空間中從初始狀態(tài)到目標(biāo)狀態(tài)的最優(yōu)傳輸路 徑(OT,Optimal Transport),從而以更少的計(jì)算步驟達(dá)到高質(zhì)量生成。流匹配 是一種訓(xùn)練連續(xù)歸一化流(CNF,Continuous Normalizing Flows)的方法,它通過(guò) 學(xué)習(xí)與概率路徑相關(guān)的向量場(chǎng)來(lái)訓(xùn)練模型,并使用 ODE(常微分方程)求解器來(lái) 生成新樣本。連續(xù)歸一化流的核心思想是通過(guò)一系列可逆的變換將一個(gè)簡(jiǎn)單的分 布逐步轉(zhuǎn)換為復(fù)雜的目標(biāo)數(shù)據(jù)分布,這種模型框架在概率密度函數(shù)變換方法的基 礎(chǔ)上,通過(guò)神經(jīng)網(wǎng)絡(luò)參數(shù)化這些變換,使得模型能夠?qū)W習(xí)到輸入數(shù)據(jù)的概率分布 。對(duì)應(yīng)到圖像生成領(lǐng)域,圖片數(shù)據(jù)與高斯噪聲可以理解為不同的數(shù)據(jù)分布,CNF 即為讓模型學(xué)習(xí)從噪聲到圖像的變換方法,F(xiàn)M 流匹配 +OT 最優(yōu)傳輸路徑即為相 比去噪擴(kuò)散概率模型(DDPM,擴(kuò)散模型的基石)更具一般性、高效的變換方法。 如圖 10 顯示,從噪聲到棋盤的生成過(guò)程中,OT 路徑更早地引入了棋盤模式,而FM 則實(shí)現(xiàn)了更穩(wěn)定的訓(xùn)練。使用 FM+OT 使得采樣步驟較少時(shí)就形成了棋盤的 初始形態(tài)。

Movie Gen Video 的各個(gè)模塊架構(gòu)在最終實(shí)現(xiàn)綜合質(zhì)量和文本對(duì)齊方面,與其他 同類架構(gòu)具備顯著優(yōu)勢(shì)。根據(jù) FM 與 Diffusion、視頻與圖片標(biāo)題、類 LLaMa3 與 DiT 相比的凈勝率,F(xiàn)M、圖片標(biāo)題、類 LLaMa3 的架構(gòu)表現(xiàn)出更高的凈勝率。
Movie Gen Video 生成質(zhì)量在當(dāng)前視頻大模型當(dāng)前為最優(yōu)。Movie Gen 在整體質(zhì) 量、一致性、真實(shí)度、美學(xué)方面方面顯著優(yōu)于 Runway Gen3 和 LumaLabs。在文 字對(duì)齊和真實(shí)性方面優(yōu)于 Sora,在真實(shí)性和美學(xué)方面優(yōu)于快手的 Kling1.5,僅在 動(dòng)作完整度方面明顯弱于 Kling1.5。根據(jù) Prompt“一只帶腿的鼠標(biāo)在跑步機(jī)上跑 步”,Movie Gen Video 生成的視頻邏輯上更合理,畫(huà)面更清晰流暢,Runway Gen3 在對(duì)齊方面有欠缺(生成了老鼠而不是鼠標(biāo)),LumaLabs 在邏輯上不合理(沿著 垂直于跑步機(jī)帶的方向運(yùn)動(dòng)),Kling1.5 生成畫(huà)面較為雜亂,缺乏美感。
2. 音頻生成模型:生成與畫(huà)面和情緒匹配的動(dòng)效聲、環(huán)境聲
Movie Gen Audio 旨在為視頻剪輯和短片生成幾秒至幾分鐘不等的配樂(lè),還原電 影級(jí)音效,高度匹配畫(huà)面與環(huán)境。模型考慮的原聲包括環(huán)境聲、音效和樂(lè)器聲, 但不包括語(yǔ)音或人聲。該模型實(shí)現(xiàn)環(huán)境音效與視覺(jué)環(huán)境相匹配,音效與動(dòng)作在時(shí) 間上保持一致,并與視覺(jué)對(duì)象保持一致,表達(dá)出視頻的情緒和情感,并與場(chǎng)景融合統(tǒng)一。要生成長(zhǎng)音頻,用戶需要先輸入長(zhǎng)視頻(例如,58s)和音頻文本標(biāo)題, 進(jìn)而長(zhǎng)視頻被拆解為幾個(gè)視頻塊(例如,20s)。從第二個(gè)塊開(kāi)始,模型不僅需要 視頻塊和文本標(biāo)題,還需要之前生成的音頻片段(例如,最后 5 秒),以便生成與 前一個(gè)保持風(fēng)格統(tǒng)一的新音頻片段。
Meta 采用了基于流匹配的生成模型和擴(kuò)散 Transformer 的模型架構(gòu),并增加了 額外的調(diào)節(jié)模塊以提供控制。在流程圖中,黃色塊表示輸入,藍(lán)色塊表示預(yù)訓(xùn)練 和凍結(jié)的模塊,灰色塊表示沒(méi)有可學(xué)習(xí)參數(shù)的操作,綠色塊表示可學(xué)習(xí)的模塊, 粉色塊表示輸出的已學(xué)習(xí)的流場(chǎng)(通過(guò) Flow Matching 學(xué)到的去噪方法)。Meta 選 擇流匹配而不是擴(kuò)散,是因?yàn)榕c擴(kuò)散模型(DDPM)相比,流匹配具有更好的訓(xùn)練 效率、推理效率和性能。

逐幀添加視覺(jué)和音頻特征可以改善視頻-音頻對(duì)齊,進(jìn)而實(shí)現(xiàn)視頻畫(huà)面與音頻同步。 從 MetaCLIP 中微調(diào)的長(zhǎng)提示 MetaCLIP 用于提取視頻中每幀的 1024 維嵌入。由 于視頻的幀率可能與音頻的幀率不匹配,Meta 對(duì)每個(gè)音頻幀取最接近的視覺(jué)幀。 然后用門控線性投影層將重新采樣的序列投影到 DiT 模型維度,并逐幀添加到音 頻特征中。與沿著時(shí)間維度拼接特征相比,逐幀添加視覺(jué)和音頻特征可以改善視 頻-音頻對(duì)齊。Meta 發(fā)現(xiàn),長(zhǎng)提示 MetaCLIP 特征編碼更高級(jí)的語(yǔ)義信息,使學(xué)習(xí) 更容易,同時(shí)保留足夠的細(xì)節(jié)來(lái)捕捉每個(gè)運(yùn)動(dòng)的時(shí)間,以便模型產(chǎn)生與運(yùn)動(dòng)一致 的聲音效果。 訓(xùn)練數(shù)據(jù)選擇方面,模型將學(xué)習(xí)音頻和條件輸入之間不同層次的關(guān)系:
屏幕上的敘事聲音在視頻和音頻之間有很強(qiáng)的對(duì)應(yīng)關(guān)系。這種情況下,聲音 與畫(huà)面同步度較高,這要求模型具有更強(qiáng)的視頻理解能力和密集動(dòng)作識(shí)別能 力。難度取決于事件的密集程度和結(jié)構(gòu),一般聲音總體上比音樂(lè)或語(yǔ)音更容 易(例如,生成高爾夫球桿擊球比生成一個(gè)人彈吉他匹配和弦更容易)。
生成敘事化的屏幕外音頻需要理解什么聲音可能出現(xiàn)在什么環(huán)境中(例如,在 森林場(chǎng)景中可能出現(xiàn)鳥(niǎo)鳴)和事件之間的邏輯順序(例如,人群歡呼可能發(fā)生 在一個(gè)人表演一個(gè)困難的把戲之后,而不是之前)。因此,與屏幕上的聲音相 比,它需要更強(qiáng)的推理能力。
非敘事音頻在語(yǔ)義層面上與視頻相關(guān)。例如,背景音樂(lè)需要與氣氛相匹配, 而升調(diào)通常用來(lái)創(chuàng)造一種緊張或期待的感覺(jué)。這需要超越理解世界物理的最 深層次的理解,需要推理和模擬人類的情感。 訓(xùn)練結(jié)果:在不同數(shù)據(jù)集上,Movie Gen Audio 的凈勝率(范圍[-100%,100%])在 總體質(zhì)量(圖中的 Ovr.)、自然度(Nat.)、專業(yè)度(Pro.)、敘事正確性(Corr.)、 敘事同步性(Sync.)等指標(biāo)均優(yōu)于對(duì)比模型。
3. 個(gè)性化視頻模型:用于生成特定人像的微調(diào)模型
基于 30B 的 Movie Gen Video 模型,Meta 將參考人像、個(gè)性化文本作為輸入,實(shí) 現(xiàn)了個(gè)性化視頻(PT2V)輸出。Meta 從已訓(xùn)練好的 T2V Movie Gen Video 參數(shù)作 為初始化權(quán)重,在微調(diào)當(dāng)中使用視覺(jué)標(biāo)記串聯(lián),使其集成到一個(gè)統(tǒng)一的框架中, 從而允許擴(kuò)展模型大小。使用可訓(xùn)練的長(zhǎng)提示 MetaCLIP 視覺(jué)編碼器從人臉圖像 中提取身份特征,然后使用投影層將其與文本特征維度對(duì)齊,進(jìn)而輸入到 Transformer 的交叉注意力模塊進(jìn)行訓(xùn)練。黃色模塊表示凍結(jié)層,采用已訓(xùn)練好的 參數(shù),綠色表示可訓(xùn)練模塊。訓(xùn)練策略包括 PT2V 預(yù)訓(xùn)練階段,然后是 PT2V 高 質(zhì)量的微調(diào)。
PT2V 生成人物身份正確性和各幀的面部一致性優(yōu)于此前 SOTA 模型。Meta 在對(duì) PT2V 預(yù)訓(xùn)練和高質(zhì)量監(jiān)督微調(diào)之后,與 ID-Animator、單獨(dú) PT2V 預(yù)訓(xùn)練、單獨(dú) PT2V 微調(diào)對(duì)比,比較發(fā)現(xiàn) Meta 個(gè)性化模型在最佳相似幀、最差相似幀和跨幀的 面部一致性三個(gè)方面取得優(yōu)異的結(jié)果,尤其在面部一致性方面顯著勝出。另外, 其微調(diào)模型與 ID-Animator 相比,在總體質(zhì)量、一致性、動(dòng)作自然度、動(dòng)作復(fù)雜 度、文本對(duì)齊方面全部勝出。而 PT2V 預(yù)訓(xùn)練在動(dòng)作自然度、動(dòng)作復(fù)雜度、文本 對(duì)齊方面略遜色于 T2V 預(yù)訓(xùn)練,我們認(rèn)為可能是 PT2V 模型注意力集中于輸入人 物形象,對(duì)基礎(chǔ)動(dòng)作和環(huán)境的學(xué)習(xí)略有減弱。
4.可編輯視頻模型:無(wú)需大量監(jiān)督視頻數(shù)據(jù)實(shí)現(xiàn)模型訓(xùn)練
專業(yè)視頻編輯軟件門檻高、操作復(fù)雜,Meta 發(fā)布基于自然語(yǔ)言指令的視頻編輯模 型,可提升普通人或半專業(yè)群體的視頻編輯效率。當(dāng)前由于缺乏大量的監(jiān)督視頻 編輯數(shù)據(jù),開(kāi)發(fā)高效的視頻編輯模型仍有較大挑戰(zhàn)。為了解決數(shù)據(jù)不足的問(wèn)題, Movie Gen Edit 創(chuàng)新地采用了一系列訓(xùn)練策略,使得無(wú)需依賴大量監(jiān)督數(shù)據(jù),也 能實(shí)現(xiàn)出色的視頻編輯效果。其基礎(chǔ)架構(gòu)基于視頻生成模型進(jìn)行了若干改動(dòng):
視頻輸入:模型通過(guò)在 Patch Embedder 中添加額外的輸入通道來(lái)實(shí)現(xiàn)視頻輸 入的條件化。將輸入視頻的隱向量和噪聲/輸出的隱向量沿通道維度進(jìn)行拼接, 再傳遞給模型。
任務(wù)嵌入向量:參考 Emu Edit,在模型中加入了用于特定編輯任務(wù)的嵌入向 量,每種不同的任務(wù)都有一個(gè)可學(xué)習(xí)的任務(wù)嵌入向量。
權(quán)重初始化:為了保證視頻生成的能力,所有新添加的權(quán)重被初始化為 0,其 余的權(quán)重則從預(yù)訓(xùn)練好的 Movie Gen 模型中繼承。 視頻訓(xùn)練分為三個(gè)階段:第一階段利用圖像編輯來(lái)模擬單幀視頻編輯,第二階段 通過(guò)合成多幀編輯任務(wù)來(lái)減少模糊問(wèn)題,第三階段則通過(guò)反向翻譯增強(qiáng)了輸出視 頻的自然感。該訓(xùn)練方法克服了由于缺乏監(jiān)督數(shù)據(jù)而產(chǎn)生的“訓(xùn)練—測(cè)試”不一 致性問(wèn)題。
第一階段:?jiǎn)螏曨l編輯。由于缺乏監(jiān)督視頻編輯數(shù)據(jù),Movie Gen Edit 利用 圖像編輯數(shù)據(jù),將其視為單幀視頻編輯來(lái)進(jìn)行訓(xùn)練。具體地,圖像編輯數(shù)據(jù) 由三元組組成,表示輸入圖像、編輯指令和輸出圖像。高質(zhì)量的視頻編輯不 僅需要精確編輯單個(gè)幀,還需要確保輸出視頻保持時(shí)間一致性,以及新元素的合理性。因此,模型被同時(shí)訓(xùn)練進(jìn)行圖像編輯和文本到視頻生成,以保持 時(shí)間一致性和生成質(zhì)量。
第二階段:多幀視頻編輯。雖然第一階段的模型已經(jīng)具備了編輯單幀圖像和 生成高質(zhì)量視頻的能力,但在進(jìn)行視頻編輯時(shí)仍然會(huì)產(chǎn)生模糊的結(jié)果。為了 減少這類問(wèn)題,第二階段的訓(xùn)練通過(guò)創(chuàng)建兩個(gè)包含多幀視頻輸入和輸出的合 成數(shù)據(jù)集來(lái)進(jìn)行改進(jìn),數(shù)據(jù)集包括:(1)動(dòng)畫(huà)幀編輯:利用視頻-字幕數(shù)據(jù)對(duì) 生成編輯指令,并對(duì)隨機(jī)幀進(jìn)行編輯,然后通過(guò)仿射變換將這些幀進(jìn)行動(dòng)畫(huà) 化,從而生成多幀編輯的示例。(2)生成式指令引導(dǎo)視頻分割:要求模型根 據(jù)指令用高亮顏色標(biāo)記視頻中的特定對(duì)象,以補(bǔ)充動(dòng)畫(huà)幀編輯中缺乏自然運(yùn) 動(dòng)的問(wèn)題。
第三階段:基于反向翻譯(back translation)的視頻編輯。雖然第二階段訓(xùn) 練的模型減輕了模糊問(wèn)題,但新生成的元素仍然缺乏足夠的運(yùn)動(dòng)感,且有時(shí) 會(huì)過(guò)度飽和。因此,Meta 通過(guò)創(chuàng)建包含真實(shí)輸出視頻的視頻編輯數(shù)據(jù)集來(lái)解 決這些問(wèn)題,并引入了反向翻譯技術(shù)。模型首先生成一個(gè)編輯后的視頻,然 后通過(guò)反向指令將其還原至原視頻,從而實(shí)現(xiàn)“去噪”獲得真實(shí)視頻。這種 方法構(gòu)建了一個(gè)弱監(jiān)督的視頻編輯數(shù)據(jù)集,使模型能夠在帶有噪聲的視頻和 編輯指令的條件下進(jìn)行“去噪”。
Movie Gen Edit 編輯效果顯著優(yōu)于其他視頻編輯模型。前期相關(guān)工作包括:隨機(jī) 差分編輯(SDEdit)通過(guò)向輸入視頻添加噪聲,然后用描述性文本進(jìn)行微調(diào)的同 時(shí)進(jìn)行去噪來(lái)執(zhí)行圖像編輯,這種方法可能會(huì)導(dǎo)致重要細(xì)節(jié)的丟失,例如主體身 份和紋理,從而降低了精確編輯的效果;目前表現(xiàn)最優(yōu)的視頻編輯方法,是利用 事先訓(xùn)練好同時(shí)克服了視頻編輯缺乏監(jiān)督數(shù)據(jù)集的問(wèn)題,例如 InsV2V 將 InstructPix2Pix 的一般方法擴(kuò)展到視頻編輯,可以使用合成數(shù)據(jù)創(chuàng)建和訓(xùn)練視頻編 輯模型;EVE 采用無(wú)監(jiān)督訓(xùn)練,通過(guò)使用來(lái)自兩個(gè)專家模型的知識(shí)蒸餾,一個(gè)用 于圖像編輯,另一個(gè)用于文本到視頻的生成。Meta 在 TGVE+(Text Guided Video Editing,文本引導(dǎo)視頻編輯)和在 Movie Gen Edit Bench 基準(zhǔn)上,與所有模型進(jìn)行 比較,人類評(píng)估分?jǐn)?shù)取自[0,100],50 代表模型水平相當(dāng)。下圖數(shù)據(jù)顯示,Meta 模 型在文本、結(jié)構(gòu)、質(zhì)量、綜合評(píng)分明顯優(yōu)于 InsV2V、Runway Gen3 V2V、SDEdit 等。
