2024年P(guān)atchTST、TSMixer、ModernTCN時(shí)序深度網(wǎng)絡(luò)構(gòu)建量?jī)r(jià)因子
- 來(lái)源:華創(chuàng)證券
- 發(fā)布時(shí)間:2024/03/12
- 瀏覽次數(shù):1313
- 舉報(bào)
PatchTST、TSMixer、ModernTCN時(shí)序深度網(wǎng)絡(luò)構(gòu)建量?jī)r(jià)因子.pdf
PatchTST、TSMixer、ModernTCN時(shí)序深度網(wǎng)絡(luò)構(gòu)建量?jī)r(jià)因子。深度學(xué)習(xí)強(qiáng)大的表征能力使其在多個(gè)領(lǐng)域取得了顯著成果,在時(shí)序領(lǐng)域同樣也有許多模型選擇。本文探索了PatchTST、TSMixer、ModernTCN三個(gè)近年的時(shí)序深度學(xué)習(xí)模型在因子挖掘上的運(yùn)用,它們采用了Patch+通道獨(dú)立的模型設(shè)計(jì),骨干網(wǎng)絡(luò)分別基于自注意力、MLP、CNN機(jī)制。模型特點(diǎn)本文介紹的深度學(xué)習(xí)模型以多變量時(shí)序類數(shù)據(jù)為出發(fā)點(diǎn),相比于基于RNN類的時(shí)序模型,最顯著的區(qū)別在于采用了通道獨(dú)立的設(shè)計(jì),即將多變量時(shí)間序列先拆為多個(gè)單變量時(shí)間序列,骨干網(wǎng)絡(luò)的模塊分別學(xué)習(xí)單變量序列的時(shí)序、特征交互以及跨變量的信息交互。這...
一、動(dòng)機(jī)
時(shí)序類數(shù)據(jù)廣泛存在各個(gè)領(lǐng)域中,傳統(tǒng)基于統(tǒng)計(jì)的方法需要專業(yè)的先驗(yàn)知識(shí)以及人工特 征處理,基于機(jī)器學(xué)習(xí)、深度學(xué)習(xí)的方法減輕了這種負(fù)擔(dān),它們以數(shù)據(jù)驅(qū)動(dòng)的方式學(xué)習(xí) 時(shí)間序列中的潛在模式,提供了富有吸引力的方案。 近年,許多基于深度時(shí)序模型的工作被提出,依托于神經(jīng)網(wǎng)絡(luò)強(qiáng)大的表示學(xué)習(xí)能力以及 不斷優(yōu)化的模型設(shè)計(jì),深度學(xué)習(xí)網(wǎng)絡(luò)在解決長(zhǎng)期依賴性和動(dòng)態(tài)變化等問(wèn)題上有了更強(qiáng)的 能力,在多個(gè)領(lǐng)域的時(shí)序任務(wù)展現(xiàn)出了優(yōu)秀的性能,包括但不限于金融市場(chǎng)、氣象、交 通等。 盡管許多時(shí)序深度模型都聲稱取得了重大成就,但相關(guān)工作的結(jié)論是否適用于其研究外 的數(shù)據(jù)集、應(yīng)用場(chǎng)景,模型的泛化能力,是值得思考的。
在本文中,我們以深度學(xué)習(xí)模型骨干網(wǎng)絡(luò)中的所用的基礎(chǔ)架構(gòu)為分類基礎(chǔ): RNN:循環(huán)神經(jīng)網(wǎng)絡(luò)是一個(gè)經(jīng)典的處理序列數(shù)據(jù)的網(wǎng)絡(luò)架構(gòu),它緊湊地“記憶”過(guò) 去信息并利用更新的數(shù)據(jù)進(jìn)行迭代,因此也常被用于時(shí)間序列任務(wù)。 Transformer:Transformer 模型基于注意力機(jī)制,可以同時(shí)處理輸入序列的所有位置, 并能捕捉序列中長(zhǎng)距離的依賴關(guān)系。Transformer 模型在 NLP 領(lǐng)域取得了巨大成功 后,其變體模型被廣泛嘗試應(yīng)用于圖像、時(shí)序等任務(wù)中。 CNN:CNN 最初是為處理圖像數(shù)據(jù)設(shè)計(jì)的,但它也可以用于時(shí)間序列數(shù)據(jù),例如通 過(guò)一維卷積操作,CNN 能夠?qū)崿F(xiàn)捕捉序列中的局部特征。 MLP:一些研究指出,通過(guò)合理設(shè)計(jì)的 MLP 架構(gòu)的簡(jiǎn)易模型,也能夠達(dá)到與復(fù)雜模 型相媲美的性能水平。
在我們之前的報(bào)告中采用了基于 RNN 的 GRU 網(wǎng)絡(luò)進(jìn)行量?jī)r(jià)因子挖掘任務(wù),因此在本篇 中我們從剩下的三類中——Transformer、CNN、MLP,分別選擇近年較為流行的時(shí)序模 型繼續(xù)進(jìn)行探索; 事實(shí)上,基于 Transformer、CNN、MLP 的時(shí)序模型數(shù)之不盡,最終我們選擇 PatchTST、 ModernTCN、TSMixer 作為代表,它們的骨干網(wǎng)絡(luò)設(shè)計(jì)思路上相似,采用了近年時(shí)序網(wǎng) 絡(luò)流行的做法,有一定借鑒意義;其次,每個(gè)模型以對(duì)應(yīng)的基礎(chǔ)架構(gòu)為主體,分別僅用 自注意力、卷積、MLP 完成信息提取,而不使用不同類別堆疊;最后,模型設(shè)計(jì)簡(jiǎn)潔, 便于添加額外組件。
二、模型介紹
在我們之前的報(bào)告《GRU 網(wǎng)絡(luò)在風(fēng)格自適應(yīng)中的創(chuàng)新與應(yīng)用》中,我們嘗試了基于 RNN 的 GRU 模型,GRU 由 Cho 等在 2014 年提出,它在每個(gè)時(shí)間點(diǎn)上通過(guò)門控單元自適應(yīng)地 捕獲序列數(shù)據(jù)中的依賴關(guān)系,在股價(jià)序列的因子挖掘任務(wù)中是一個(gè)常見的基線模型。

本篇介紹的 PatchTST、ModernTCN、TSMixer 模型,它們?yōu)槎嘧兞繒r(shí)間序列設(shè)計(jì),采用 了近年時(shí)序網(wǎng)絡(luò)常見的 Patch+通道獨(dú)立的設(shè)計(jì),并在骨干網(wǎng)絡(luò)中用多個(gè)模塊分別實(shí)現(xiàn)時(shí) 序信息交互的學(xué)習(xí)、通道/特征的信息交互的學(xué)習(xí)。
(一)時(shí)序嵌入
Embedding(嵌入)是深度學(xué)習(xí)中一種表示技術(shù),例如自然語(yǔ)言處理中,通常將單個(gè)詞轉(zhuǎn) 為“詞向量”的形式。詞被映射為固定維度的向量后,模型能夠?qū)W習(xí)詞與詞之間的更為 復(fù)雜的模式和關(guān)系。時(shí)序數(shù)據(jù)在輸入深度學(xué)習(xí)模型前同樣也需要進(jìn)行嵌入,獲取時(shí)間序 列的向量表征。和自然語(yǔ)言的不同之處在于,現(xiàn)實(shí)中的時(shí)序數(shù)據(jù)大多是多變量時(shí)間序列, 自然語(yǔ)言可以視為單變量時(shí)間序列。
1、Patch
Patch 指將輸入數(shù)據(jù)分為多個(gè)局部區(qū)域,在視覺(jué)領(lǐng)域有較多運(yùn)用。例如一張圖片按一定窗 口大小切分成多個(gè)子區(qū)域,將子區(qū)域排列后轉(zhuǎn)為序列數(shù)據(jù),每個(gè)區(qū)域可以看作類似自然 語(yǔ)言序列中的一個(gè) token,進(jìn)而能使用序列模型對(duì)圖片進(jìn)行建模:
本篇介紹的時(shí)序模型均在 Embedding 時(shí)采用了 Patch 的時(shí)序處理方式。 Patch 在時(shí)間序列類數(shù)據(jù)的方法類似于圖像:在原始時(shí)間序列上使用一個(gè)固定大小為 P 的 窗口進(jìn)行滑動(dòng)截取,窗口每次滑動(dòng)的步長(zhǎng)為 S,由此原始時(shí)間序列被拆分為若干個(gè)子序 列,每個(gè)子序列包含 P 個(gè)時(shí)點(diǎn)的數(shù)據(jù),子序列被視為一個(gè) token,映射至目標(biāo)嵌入維度。 使用 Patch 處理的優(yōu)勢(shì)在于: Patch 后新序列長(zhǎng)度近似為原序列的 1/S,降低了計(jì)算成本; 有研究提出時(shí)序類數(shù)據(jù)單獨(dú)一個(gè)時(shí)點(diǎn)的信息量較少,而 Patch 實(shí)質(zhì)上實(shí)現(xiàn)了局部信 息提取,使單個(gè) token 能包含更多信息; 鑒于上述優(yōu)點(diǎn),Patch 成為了近年的時(shí)序模型中常見的做法。
2、通道獨(dú)立
對(duì)多變量時(shí)序任務(wù),“通道”指輸入序列的變量,而“特征”表示序列 token 經(jīng)過(guò) Embedding 后在骨干網(wǎng)絡(luò)中的隱狀態(tài)維度。通道獨(dú)立(channel-independent)是近年網(wǎng)絡(luò)的一類處理 方法,表現(xiàn)為將多變量序列拆分多個(gè)單變量序列,共享同一個(gè)網(wǎng)絡(luò),深度學(xué)習(xí)模型對(duì)單 變量序列輸入產(chǎn)生對(duì)應(yīng)的單變量輸出序列。最近相關(guān)工作(例如,Nie 等人,2022;Zeng 等人,2023)表明,通道獨(dú)立的模型設(shè)計(jì)優(yōu)于通道混合模型。 通道獨(dú)立的設(shè)計(jì)在 Embedding 階段做法為,每個(gè)輸入的 token 只包含來(lái)自單個(gè)變量(通 道)的信息。與通道獨(dú)立對(duì)應(yīng)的概念是通道混合,每個(gè)輸入 token 含有來(lái)自多個(gè)變量的信 息。
(二)PatchTST
PatchTST 由 Nie 等 2022 年提出,是一種基于 Transformer 的時(shí)序模型,它將同樣基于 Transformer 的視覺(jué)模型 ViT 的思想運(yùn)用在了時(shí)序類數(shù)據(jù)上。
1、Transformer
Transformers 在論文 Vaswani, Ashish, et al. "Attention Is All You Need."中首次提出,首先 被廣泛應(yīng)用于 NLP 任務(wù),近年模型的核心之一是自注意力機(jī)制(Self-Attention),它通過(guò) 自注意力機(jī)制使序列中的任何部分進(jìn)行交互,從而有效地捕獲長(zhǎng)距離依賴關(guān)系。
關(guān)于 Transformer 中涉及的自注意力機(jī)制的原理此處不再贅述。 若我們希望將 Transformer 用于時(shí)序任務(wù),最為簡(jiǎn)單的流程是將每一天的 M 個(gè)變量作為 一個(gè) token 進(jìn)行 Embedding(即通道混合),使用 encoder 部分的自注意力機(jī)制進(jìn)行時(shí)序 信息提取,最后取整個(gè)序列的表征,輸入下游任務(wù)的預(yù)測(cè)頭得到最終輸出。
2、PatchTST
經(jīng)過(guò) Patch Embedding 后,PatchTST 模型將多變量序列中的每一個(gè)序列看作一個(gè)獨(dú)立樣 本,將單變量序列輸入模型 backbone(Transformer encoder)中,通過(guò)注意力機(jī)制學(xué)習(xí)時(shí) 序的依賴關(guān)系,最后拼接不同變量的輸出。 以一個(gè)多變量時(shí)序預(yù)測(cè)任務(wù)為例,假設(shè)輸入序列變量數(shù)為 M,輸入每個(gè)變量過(guò)去 L 天的 數(shù)據(jù)、目標(biāo)為預(yù)測(cè)每個(gè)變量未來(lái) T 日; 從一個(gè) batch 數(shù)據(jù)形狀的角度看,輸入數(shù)據(jù)形狀為(?, ?, ?),其中 B 為 batch 大小,M 為 變量數(shù),L 為原始序列長(zhǎng)度;patch embedding 后數(shù)據(jù)形狀變?yōu)?(?, ?,?, ?),其中 N 為新 序列長(zhǎng)度,D 為每個(gè) token 的嵌入特征維度; 在進(jìn)入模型 backbone 之前,PatchTST 模型將 B、M 維度合并,數(shù)據(jù)形狀變?yōu)?(??,?, ?), 表示將每個(gè)變量視為一個(gè)單獨(dú)的樣本,一個(gè) batch 中的樣本數(shù)量變?yōu)?(??) ,encoder 接 受單變量輸入,輸出形狀同樣為(??,?, ?),經(jīng)過(guò)預(yù)測(cè)頭、拼接合并后得到預(yù)測(cè)輸出形狀 為(?, ?, ?),即得到了每個(gè)輸入樣本的多變量預(yù)測(cè)結(jié)果。
(三)TSMixer
在上文的 PatchTST 中,模型將一個(gè)多變量時(shí)間序列視為多個(gè)獨(dú)立的單變量時(shí)間序列,缺 少考慮不同通道(變量)之間的交互作用。在后續(xù)的工作中,一種常見的流程是保留通 道獨(dú)立的同時(shí),在骨干網(wǎng)絡(luò)中加入通道交互模塊,讓模型進(jìn)行預(yù)測(cè)時(shí)能考慮到不同變量 之間的交互信息,更符合直覺(jué)。TSMixer 由 Ekambaram 等于 2023 年提出,通過(guò)基于 MLP 的模塊完成時(shí)序、特征、通道間的交互信息提取。
1、門控注意力
TSMixer 作者在 MLP 塊后添加了一個(gè)簡(jiǎn)單的門控注意力(Bahdanau 等,2014)加強(qiáng) MLP 信息抽取能力,它比自注意力機(jī)制簡(jiǎn)單,起到特征加權(quán)的作用。
2、TSMixer Backbone
TSMixer 同樣先對(duì)數(shù)據(jù)進(jìn)行 patch embedding,骨干網(wǎng)絡(luò)由時(shí)序信息提取模塊、特征信息 提取模塊、通道信息提取三個(gè)模塊組成,三個(gè)模塊則均由 MLP、門控注意力、殘差連接 構(gòu)成,通過(guò)調(diào)整輸入 MLP 層的數(shù)據(jù)形狀實(shí)現(xiàn)不同類型的信息抽取。TSMixer 同樣使用了 Patch+通道獨(dú)立的設(shè)計(jì),相比于 PatchTST,它的骨干網(wǎng)絡(luò)包含了通道信息交互提取。

(四)ModernTCN
ModernTCN 在骨干網(wǎng)絡(luò)中同樣包含時(shí)序、特征、通道的信息提取模塊,流程同 TSMixer 類似,區(qū)別在于各個(gè)模塊采用了卷積網(wǎng)絡(luò)實(shí)現(xiàn)。 在 Patch Embedding 步驟,ModernTCN 與上述模型略有不同,它采用 1D 卷積實(shí)現(xiàn),kernel size 對(duì)應(yīng) Patch 的窗口大小 P,stride 對(duì)應(yīng)為 Patch 的步長(zhǎng) S,輸出通道數(shù)對(duì)應(yīng)目標(biāo)嵌入維 度 D。
1、分組卷積
自 AlexNet 在 2012 年贏得 ImageNet 比賽后,更大、更深的神經(jīng)網(wǎng)絡(luò)逐漸成為研究主流。 雖然模型深度對(duì)于提高性能有重要影響已經(jīng)成為了共識(shí),但這些更大更復(fù)雜模型始終不 可避免需要面對(duì)一個(gè)現(xiàn)實(shí)應(yīng)用的問(wèn)題——如何在計(jì)算資源有限的硬件平臺(tái)上執(zhí)行算法。 分組卷積技術(shù)提供了一種可行的方案以緩解上述問(wèn)題,它在不顯著影響準(zhǔn)確性的同時(shí),減少了計(jì)算成本和參數(shù)數(shù)量。
2、深度可分離卷積
深度可分離卷積(Depthwise Separable Convolution)最早由 Sifre 提出,在 MobileNets 和 Xception 等模型中有應(yīng)用。深度可分離卷積對(duì)圖像的空間特征、通道特征進(jìn)行單獨(dú)、分步的學(xué)習(xí),它將標(biāo)準(zhǔn)的卷積核分解為兩步:深度卷積(Depthwise Convolution)和點(diǎn)卷積 (Pointwise Convolution): 深度卷積對(duì)每個(gè)輸入通道單獨(dú)對(duì)應(yīng)一個(gè)卷積核(每個(gè)卷積核的通道數(shù)為 1),可以看 作分組卷積的一種形式(分組數(shù)等于輸入數(shù)據(jù)的通道數(shù)),一個(gè)通道數(shù)為 c 的輸入數(shù) 據(jù)經(jīng)過(guò)深度卷積后,輸入數(shù)據(jù)的通道數(shù)同樣為 c; 在上一步的深度卷積中,相當(dāng)于對(duì)每個(gè)通道進(jìn)行了單獨(dú)學(xué)習(xí),沒(méi)有考慮不同通道之 間的交互;深度可分離卷積的第二步為點(diǎn)卷積,采用了 1×1 的卷積,組合不同通道 得到最終輸出。
3、ModernTCN Backbone
在之前的部分我們簡(jiǎn)單介紹了深度可分離卷積,它由深度卷積(Depthwise,簡(jiǎn)寫為 DW 卷積)和點(diǎn)卷積(Pointwise,簡(jiǎn)寫為 PW 卷積)兩步組成,深度可分離卷積的特點(diǎn)是將圖 像的空間信息、通道信息抽取單獨(dú)處理。 經(jīng)過(guò) ModernTCN 的 Patch 處理后,一個(gè)樣本的形狀為(?,?, ?),其中 M 為變量維度、 D 為 Embedding 后的特征維度,N 為序列維度。進(jìn)行卷積操作前需要將 M 和 D 維度合并 為通道維度,變?yōu)?? × ?, ?)。 ModernTCN 也用了其解耦的方案,將變量/特征的時(shí)序信息學(xué)習(xí)、通道交互兩個(gè)步驟用單 獨(dú)的模塊進(jìn)行處理。 DWConv 模塊實(shí)現(xiàn)了深度可分離卷積中的第一步——深度卷積,深度卷積不提取通道之 間的交互,輸入通道數(shù)量等于輸出通道數(shù)量(? × ?)。在時(shí)間序列的語(yǔ)境下,它表示對(duì) 每個(gè)變量進(jìn)行了時(shí)序信息提取。 接下來(lái),類似深度可分離卷積的第二步的點(diǎn)卷積,后續(xù)的兩個(gè) ConvFFN 模塊(按順序記 為 ConvFFN1、ConvFFN2)被設(shè)計(jì)用于對(duì)不同通道維度的信息進(jìn)行學(xué)習(xí)。
點(diǎn)卷積采用了分組卷積技術(shù),兩個(gè) ConvFFN 采用不同的分組邏輯: ConvFFN1 分組數(shù)設(shè)置為 M,此時(shí)分組點(diǎn)卷積表示學(xué)習(xí)同一個(gè)變量的特征交互; ConvFFN2 分組數(shù)設(shè)置為 D,此時(shí)分組點(diǎn)卷積表示學(xué)習(xí)同一特征維度不同變量的交 互。 經(jīng)過(guò) 2 個(gè) ConvFFN 后,通過(guò)殘差連接便得到一個(gè) Block 的輸出結(jié)果。 此外,ModernTCN 還在 DWConv 中采用了大核卷積技術(shù),在此不再展開。
(五)小結(jié)
三個(gè)模型都采用了通道獨(dú)立的設(shè)計(jì),通過(guò)骨干網(wǎng)絡(luò)學(xué)習(xí)時(shí)間、特征以及通道的交互。下 面我們以常見的通道混合設(shè)計(jì)的 GRU 和 ModernTCN 為例,簡(jiǎn)單對(duì)比兩種思路的區(qū)別: 以一只股票的 5 天價(jià)格序列為例,它的變量為高、開、低、收,我們將其嵌入為 D 維向 量。
對(duì) GRU 網(wǎng)絡(luò),在 Embedding 階段,將每一天的高、開、低、收作為一個(gè) token,輸入模型的每個(gè)樣本為長(zhǎng)度為 5 的 token 序列;每個(gè) token 的維度為 4,我們 將其映射到更高的維度得到 D 維特征表征,通過(guò)后續(xù)的 GRU 網(wǎng)絡(luò)學(xué)習(xí)不同時(shí)點(diǎn)的 信息交互;
對(duì) ModernTCN 網(wǎng)絡(luò),在 Embedding 階段,用大小為 P 的窗口在每個(gè)變量 時(shí)序上進(jìn)行滑動(dòng)截取,得到 4 條長(zhǎng)度為 N 的新序列,每個(gè)窗口中 P 個(gè)時(shí)點(diǎn)的數(shù)值被 視為一個(gè) token,將 token 映射到 D 維后輸入骨干網(wǎng)絡(luò),骨干網(wǎng)絡(luò)根據(jù)單變量序列輸 入產(chǎn)生對(duì)應(yīng)輸出,最后將每個(gè)單變量的輸出拼接還原為多變量序列,骨干網(wǎng)絡(luò)對(duì)時(shí) 序、嵌入隱狀態(tài)、不同變量間的交互進(jìn)行了學(xué)習(xí)。
如何實(shí)現(xiàn)骨干網(wǎng)絡(luò)中的時(shí)序信息交互、變量/特征信息,PatchTST、TSMixer、ModernTCN 分別使用基于多頭自注意力、門控 MLP、卷積的模塊設(shè)計(jì)。 我們認(rèn)為,Patch Embedding、骨干網(wǎng)絡(luò)的解耦思路具有一定參考意義;從股價(jià)或因子類 時(shí)序數(shù)據(jù)的特點(diǎn)看,Patch +通道獨(dú)立的方法或是通道混合的方式,二者均有合理之處, 通道混合時(shí)表征了每天的蠟燭圖,通道獨(dú)立時(shí)表征了單個(gè)變量的局部時(shí)間特征,無(wú)法直 接得出孰優(yōu)孰劣的結(jié)論。在后文,我們?cè)谏鲜鋈齻€(gè)模型的基礎(chǔ)上再加入通道混合的 Transformer 進(jìn)行對(duì)比,檢驗(yàn)上述模型在端到端量?jī)r(jià)因子挖掘任務(wù)中的表現(xiàn)。
三、量?jī)r(jià)因子挖掘測(cè)試
(一)數(shù)據(jù)集介紹
數(shù)據(jù)集說(shuō)明: 2007-2024 年 2 月 2 日 A 股日頻量?jī)r(jià)數(shù)據(jù),包括高、開、低、收、均價(jià)、成交量 6 個(gè)序 列,我們以每周的最后一個(gè)交易日?為截面,回溯截面上??個(gè)股票過(guò)去 30 個(gè)交易日的數(shù) 據(jù),作為一個(gè)截面(對(duì)應(yīng)??個(gè)標(biāo)簽),以此滾動(dòng)生成數(shù)據(jù)截面(?1,30,6)、(?2,30,6)…(?? ,30,6),在第一個(gè)維度上進(jìn)行拼接得到全部訓(xùn)練數(shù)據(jù)。 同時(shí),我們?cè)谥芏冉孛婀善边M(jìn)行如下排除: 1、剔除上市不滿 120 天的股票; 2、剔除流通市值最小的 10%的股票; 3、剔除有數(shù)據(jù)缺失的股票。
在進(jìn)行模型重訓(xùn)練時(shí),設(shè)置 3 個(gè)隨機(jī)種子,將 3 次預(yù)測(cè)結(jié)果合成作為最終結(jié)果。 數(shù)據(jù)預(yù)處理方法: 在拼接數(shù)據(jù)截面(?1,30,6)、(?2,30,6)…(?? ,30,6)之前,進(jìn)行如下的預(yù)處理步驟: 1、MAD 法對(duì)異常值進(jìn)行縮尾處理; 2、每個(gè)截面用最后一個(gè)交易日作為除數(shù)進(jìn)行歸一化,再進(jìn)行 Z-score 標(biāo)準(zhǔn)化;
模型預(yù)測(cè)標(biāo)簽: 預(yù)測(cè)標(biāo)簽為標(biāo)準(zhǔn)化未來(lái) 10 日收益(t+1 日~ t+11 日以收盤價(jià)計(jì)算),每個(gè)模型最終預(yù)測(cè)頭 輸出維度均設(shè)置為 50,將 50 個(gè)因子用均值聚合,作為每只股票的最終得分,計(jì)算其與上 述未來(lái) 10 日收益的 IC 作為損失函數(shù)。
(二)模型流程
我們測(cè)試 PatchTST、Transformer、TSMixer、ModernTCN 模型。我們?cè)?PatchTST 骨干網(wǎng) 絡(luò)中也加入一個(gè)基于自注意力機(jī)制的通道交互模塊;對(duì) PatchTST 和 Transformer 模型, 在時(shí)序編碼時(shí)添加可學(xué)習(xí)的特殊 token(類似自然語(yǔ)言中的[CLS]),用于獲取序列表征。
除 Transformer 模型外,其余通道獨(dú)立模型的樣本經(jīng)過(guò) Backbone 的輸出形狀為(?,?, ?), 在進(jìn)入最后預(yù)測(cè)頭之前我們進(jìn)行如下處理: 對(duì) TSMixer 和 ModernTCN 模型,合并 D、N 兩個(gè)維度并用一個(gè) Linear 層消除時(shí)序 維度,數(shù)據(jù)形狀變?yōu)??,?),最后合并 M、D 兩個(gè)維度; 對(duì) Transformer-base 的模型,取每個(gè)變量的特殊 token 作為單變量序列表征,數(shù)據(jù)形 狀變?yōu)??,?),合并 M、D 維度。
(三)參數(shù)設(shè)定
本文介紹的模型涉及參數(shù)較多,我們對(duì)主要參數(shù)進(jìn)行設(shè)定說(shuō)明: 在 Patch Embedding 步驟,我們將 S 固定為 P 的一半,考慮到輸入序列長(zhǎng)度僅為 30,因 此取S = 2、P = 4的參數(shù)組合;TSMixer、ModernTCN嵌入特征維度D設(shè)定為16,PatchTST、 Transformer 設(shè)定為 32,注意力頭數(shù)為 2;所有模型的層數(shù)設(shè)定為 1;在后續(xù)章節(jié),我們 進(jìn)行更多參數(shù)的測(cè)試,以進(jìn)一步了解模型各個(gè)組件、參數(shù)的影響。
(四)因子測(cè)試
1、IC 測(cè)試結(jié)果
在本部分我們展示不同模型因子的 IC 結(jié)果,因子為周度頻率。

2、相關(guān)性
觀察 IC 的時(shí)序圖,我們可以看到,四個(gè)模型的 IC 時(shí)序圖非常相似。
間統(tǒng)計(jì)范圍內(nèi),兩兩相關(guān)性最低也達(dá)到了 78%,為 ModernTCN 模型與 Transformer 模型,其次為 ModernTCN 模型與 PatchTST 模型,達(dá)到 81%;但在 2018 年、2024 年 1 月,ModernTCN 和 Transformer 系模型的相關(guān)性降低至 50% - 60%之間;
從模型角度看,兩個(gè) Transformer 系模型相關(guān)性高、ModernTCN 和 TSMixer 相關(guān)性 高;基于不同架構(gòu)模型的相關(guān)性較低,如 ModernTCN 和 Transformer 模型,前者為 CNN + 通道獨(dú)立架構(gòu),后者為注意力+通道混合架構(gòu),二者相關(guān)性低于其他組合。 由于我們采用的訓(xùn)練數(shù)據(jù)變量較少,趨同性較高,不同深度學(xué)習(xí)模型產(chǎn)生高相關(guān)性的因 子結(jié)果可能是難以避免的;另一方面,我們也發(fā)現(xiàn),架構(gòu)越不同的模型產(chǎn)生的因子差異 相對(duì)更大。
3、分組測(cè)試結(jié)果
本部分我們對(duì)因子進(jìn)行分組測(cè)試。分組數(shù)設(shè)置為 20,根據(jù)每周最后一個(gè)交易日因子值進(jìn) 行分組,按次周第一個(gè)交易日收盤價(jià)進(jìn)行調(diào)倉(cāng),不計(jì)交易成本。超額收益基準(zhǔn)為中證全 指。
(五)消融測(cè)試
在因子測(cè)試的部分我們已經(jīng)發(fā)現(xiàn),基于注意力的兩個(gè)模型——PatchTST 和 Transformer, 采用通道獨(dú)立設(shè)計(jì)的 PatchTST 模型綜合表現(xiàn)優(yōu)于 Transformer 模型。在本節(jié)我們進(jìn)一 步探索 Patch、通道獨(dú)立設(shè)計(jì)的必要性,我們以 TSMixer、ModernTCN 兩個(gè)模型為基礎(chǔ)進(jìn) 行部分模塊剔除,重復(fù)上文的量?jī)r(jià)因子挖掘步驟,以此大致了解各個(gè)組件的影響:
1、剔除 Patch
保留原先模型的時(shí)序編碼模塊,但將其中的參數(shù) P 以及 S 設(shè)定為 1 實(shí)現(xiàn)剔除 Patch。修改 后的模型后綴記為“-NoPatch”。
2、剔除通道獨(dú)立
兩個(gè)模型的剔除通道獨(dú)立的方法為: ModernTCN:修改輸入數(shù)據(jù)的形狀以及 1D 卷積的輸入通道數(shù)實(shí)現(xiàn)通道混合,嵌入 維度設(shè)定為 50,骨干網(wǎng)絡(luò)中排除通道交互對(duì)應(yīng)的點(diǎn)卷積模塊; TSMixer:采用 ModernTCN 的 1D 卷積(P=4,S=2)進(jìn)行時(shí)序編碼,嵌入維度為 50, 骨干網(wǎng)絡(luò)中排除通道交互對(duì)應(yīng) MLP 模塊。 修改后的模型后綴為“-CM”。
3、剔除 Patch 與通道獨(dú)立
兩個(gè)模型剔除 Patch、通道獨(dú)立的方法為: ModernTCN:修改輸入數(shù)據(jù)的形狀以及 1D 卷積的輸入通道數(shù)實(shí)現(xiàn)通道混合,嵌入 維度設(shè)定為 50,骨干網(wǎng)絡(luò)中排除通道交互對(duì)應(yīng)的點(diǎn)卷積模塊; TSMixer:采用 ModernTCN 的 1D 卷積(P=1,S=1)進(jìn)行時(shí)序編碼,嵌入維度為 50, 骨干網(wǎng)絡(luò)中排除通道交互的對(duì)應(yīng) MLP 模塊。 修改后的模型后綴為“-NoPatch-CM”。
4、測(cè)試結(jié)果
對(duì)原始模型去除 Patch 與通道獨(dú)立后,兩個(gè)模型在量?jī)r(jià)因子挖掘任務(wù)中的因子 IC、TOP 組表現(xiàn)出現(xiàn)了不同程度的下降,TSMixer 模型去除 Patch 性能無(wú)明顯差異;將 Patch 和通 道獨(dú)立均剔除后,兩個(gè)模型的 TOP 組表現(xiàn)均發(fā)生了明顯的性能下降,年化收益分別降低 8.07%、5.25%,在因子相關(guān)性方面,剔除組件后的模型和原始模型的相關(guān)性仍然較高, ModernTCN 在 90%以上,TSMixer 在 85%以上,在 IC 測(cè)試擁有相近表現(xiàn);
最后,本篇報(bào)告所有的實(shí)驗(yàn)的損失函數(shù)均使用 IC 損失,不同模型 IC 表現(xiàn)相近、TOP 組 表現(xiàn)差異較大的情況時(shí)常出現(xiàn),如何兼顧深度學(xué)習(xí)因子的 IC 和多頭組收益值得更深一步 的研究;從本節(jié)消融測(cè)試的結(jié)果看,我們認(rèn)為骨干網(wǎng)絡(luò)的合理設(shè)計(jì)能顯著改善因子的綜 合表現(xiàn),為解決上述問(wèn)題提供了一種可能的實(shí)踐方案。
編輯:火腿腸-
標(biāo)簽
- 網(wǎng)絡(luò)
- 量?jī)r(jià)因子
- 相關(guān)標(biāo)簽
- 熱門文檔
- 熱門文章
- 本年熱門
- 本季熱門
- 本月熱門
- 1 關(guān)于2025年國(guó)民經(jīng)濟(jì)和社會(huì)發(fā)展計(jì)劃執(zhí)行情況與2026年國(guó)民經(jīng)濟(jì)和社會(huì)發(fā)展計(jì)劃草案的報(bào)告——2026年3月5日在第十四屆全國(guó)人民.pdf
- 2 中國(guó)網(wǎng)絡(luò)視聽協(xié)會(huì):中國(guó)網(wǎng)絡(luò)視聽發(fā)展研究報(bào)告(2026) .pdf
- 3 市場(chǎng)監(jiān)管局:2025直播電商行業(yè)發(fā)展白皮書.pdf
- 4 房地產(chǎn)行業(yè)第8_9周周報(bào)(2026年2月14日_2026年2月27日):26年春節(jié)新房成交量低于23_25年,二手房成交量高于23_25年;上海優(yōu)化限購(gòu)、公積金和房產(chǎn)稅政策.pdf
- 5 中國(guó)新就業(yè)形態(tài)研究中心-2025中國(guó)藍(lán)領(lǐng)群體就業(yè)研究報(bào)告.pdf
- 6 中國(guó)股票策略:中國(guó)最佳商業(yè)模式研究(第二版).pdf
- 7 互聯(lián)網(wǎng)行業(yè):第57次中國(guó)互聯(lián)網(wǎng)絡(luò)發(fā)展?fàn)顩r統(tǒng)計(jì)報(bào)告.pdf
- 8 2026年政府工作報(bào)告.pdf
- 9 中國(guó)2026年展望:探索新動(dòng)能.pdf
- 10 2025中國(guó)新就業(yè)形態(tài)報(bào)告.pdf
- 1 中國(guó)新就業(yè)形態(tài)研究中心-2025中國(guó)藍(lán)領(lǐng)群體就業(yè)研究報(bào)告.pdf
- 2 騰訊研究院-從超級(jí)個(gè)體到超級(jí)團(tuán)隊(duì):AI時(shí)代組織變革的涌現(xiàn)路徑.pdf
- 3 騰訊研究院:2026豐饒之后:AI Coding 觀察報(bào)告.pdf
- 4 中國(guó)臨床腫瘤學(xué)會(huì)指南工作委員會(huì)-醫(yī)療行業(yè)中國(guó)臨床腫瘤學(xué)會(huì)(CSCO)非小細(xì)胞肺癌診療指南2026.pdf
- 5 蘭花科創(chuàng)-600123-優(yōu)質(zhì)無(wú)煙煤龍頭,煤化一體靜待周期反轉(zhuǎn)與技改紅利釋放.pdf
- 6 機(jī)械設(shè)備行業(yè):擁抱科技,重視AI為主線的設(shè)備及硬件等投資機(jī)會(huì).pdf
- 7 TGV玻璃基板行業(yè)動(dòng)態(tài)報(bào)告:玻璃基板崛起,賦能先進(jìn)封裝.pdf
- 8 電力設(shè)備行業(yè)跟蹤周報(bào):鋰電儲(chǔ)能業(yè)績(jī)亮眼、拓展AI第二增長(zhǎng)曲線.pdf
- 9 玻璃基封裝行業(yè)專題:玻璃基板有望成為先進(jìn)封裝新平臺(tái).pdf
- 10 投資策略-激光通信行業(yè)深度:行業(yè)現(xiàn)狀、終端結(jié)構(gòu)、市場(chǎng)規(guī)模及相關(guān)公司深度梳理.pdf
- 1 深藍(lán)君:2026AI+HR趨勢(shì)觀察報(bào)告:從工具提效到組織重構(gòu).pdf
- 2 機(jī)器人行業(yè)2026H1人形機(jī)器人產(chǎn)業(yè)盤點(diǎn):2026H1人形機(jī)器人盤點(diǎn),量產(chǎn)前的加速與分化.pdf
- 3 儲(chǔ)能與電力設(shè)備行業(yè)2026年中期策略報(bào)告:全球需求共振,算電協(xié)同啟新.pdf
- 4 中電聯(lián)電動(dòng)交通與儲(chǔ)能分會(huì):電化學(xué)儲(chǔ)能行業(yè)發(fā)展報(bào)告2026.pdf
- 5 中國(guó)汽車流通協(xié)會(huì)-汽車行業(yè):2026年6月中國(guó)汽車保值率報(bào)告.pdf
- 6 大化工行業(yè)周報(bào):油價(jià)回落下化工有望迎來(lái)補(bǔ)庫(kù)行情.pdf
- 7 易觀分析-具身智能行業(yè):2026年中國(guó)具身智能重點(diǎn)行業(yè)應(yīng)用與場(chǎng)景價(jià)值分析報(bào)告.pdf
- 8 紡服行業(yè)周報(bào):運(yùn)動(dòng)品牌Q2流水放緩,安踏、361度表現(xiàn)韌性強(qiáng).pdf
- 9 行業(yè)景氣度跟蹤報(bào)告(2026年7月):景氣,右側(cè)AI景氣持續(xù),左側(cè)細(xì)分方向亦值得關(guān)注.pdf
- 10 中國(guó)汽車工業(yè)協(xié)會(huì)-汽車行業(yè):2025中國(guó)汽車后市場(chǎng)年度發(fā)展報(bào)告.pdf
- 本年熱門
- 本季熱門
- 本月熱門
- 1 2025年醫(yī)藥行業(yè)2026年度策略報(bào)告:創(chuàng)新藥產(chǎn)業(yè)鏈景氣度持續(xù)提升
- 2 2026年大族激光公司研究報(bào)告:PCB消費(fèi)電子利好有望助力2025_27年盈利持續(xù)增長(zhǎng)
- 3 2026年春季港股及海外中資股投資策略:分化與回歸
- 4 2026年春季A股投資策略:為第二階段上漲蓄力,時(shí)代資產(chǎn)不退場(chǎng)
- 5 2026年春季北交所化工新材料行業(yè)投資策略:周期迎拐點(diǎn),成長(zhǎng)正當(dāng)時(shí)
- 6 2026年航空行業(yè)夏航季民航時(shí)刻計(jì)劃詳解:穩(wěn)中求進(jìn),國(guó)內(nèi)控總量、國(guó)際促?gòu)?fù)蘇
- 7 2026年春季海外宏觀展望:結(jié)構(gòu)性“滯脹”
- 8 2026年中銀香港公司研究報(bào)告:高股息護(hù)航,財(cái)富與出海共促成長(zhǎng)
- 9 2026年固收增厚產(chǎn)品系列報(bào)告之一:可轉(zhuǎn)債基金的再定位與再解析
- 10 2026年春季轉(zhuǎn)債投資策略:主線清晰,沖擊已過(guò),倉(cāng)位致勝
- 1 2026年6月人形機(jī)器人行業(yè)月報(bào):資本化提速與量產(chǎn)漸近
- 2 2026年6月A股市場(chǎng)研判:AI引領(lǐng)向上,聚焦算力與景氣延伸
- 3 2026 AI重塑影視產(chǎn)業(yè):漫劇爆發(fā)與產(chǎn)業(yè)鏈重構(gòu)深度解析
- 4 氧化鋯斷供與HBM瓶頸:全球產(chǎn)業(yè)趨勢(shì)跟蹤周報(bào)(2026年6月29日)
- 5 2026年7月A股量化擇時(shí):AI識(shí)圖聚焦半導(dǎo)體與芯片賽道
- 6 2026 ASCO年會(huì)國(guó)產(chǎn)創(chuàng)新藥雙抗ADC臨床數(shù)據(jù)梳理
- 7 A股2026年6月策略:景氣強(qiáng)化與震蕩上行配置建議
- 8 2026年全球人工智能技術(shù)、政策、產(chǎn)業(yè)與投融資趨勢(shì)全景洞察
- 9 寧德時(shí)代發(fā)布鈉電儲(chǔ)能方案,7月中國(guó)電池排產(chǎn)環(huán)比增長(zhǎng)
- 10 2026年中期醫(yī)藥生物行業(yè)投資策略:AI新藥加速推進(jìn)
- 1 2026年7月A股量化擇時(shí):AI識(shí)圖聚焦半導(dǎo)體與芯片賽道
- 2 寧德時(shí)代發(fā)布鈉電儲(chǔ)能方案,7月中國(guó)電池排產(chǎn)環(huán)比增長(zhǎng)
- 3 2026年7月醫(yī)藥生物行業(yè)投資月報(bào):創(chuàng)新藥產(chǎn)業(yè)鏈景氣度持續(xù)向上
- 4 恒生科技指數(shù)2026年6月復(fù)盤及7月走勢(shì)展望
- 5 2026年7月策略觀點(diǎn):科技接力與盈利主導(dǎo)下的行業(yè)輪動(dòng)
- 6 2026年7月黃金震蕩格局與長(zhǎng)期配置價(jià)值分析
- 7 2026年7月策略:科技接力與盈利主導(dǎo)下的行業(yè)配置
- 8 2026年7月醫(yī)藥生物行業(yè)周報(bào):多重利好催化創(chuàng)新藥板塊情緒
- 9 2026年7月A股回調(diào)歸因與底部布局策略分析
- 10 華新水泥海外產(chǎn)能布局與非洲市場(chǎng)盈利深度解析
