LLM-MCTS框架如何解決傳統因子挖掘中效率與可解釋性的矛盾?
請分析LLM-MCTS框架在因子挖掘中的具體運作機制,特別是LLM與MCTS各自的職責分工,以及該框架如何通過迭代優化解決傳統因子研究中存在的效率瓶頸和“黑箱”問題。
最佳答案
由匿名用戶編輯于2026/06/24 07:00
LLM-MCTS框架通過將因子挖掘過程分解為搜索控制、語義生成和數據評測三個層次,有效解決了傳統因子研究的效率與可解釋性矛盾。首先,MCTS作為控制層,負責管理搜索樹、分配搜索預算并決定路徑切換。它利用蒙特卡洛樹搜索算法,通過選擇、擴展、評測和回傳四個步驟,在巨大的公式空間中高效尋找潛在優質因子。MCTS使用基于預測強度、穩定性、覆蓋率、換手友好度、多樣性和過擬合懲罰的綜合獎勵分數(mcts_reward)來評估候選因子,并通過UCT算法平衡對已知高分分支的利用和對未充分探索分支的試探,避免搜索陷入局部最優。
其次,LLM作為生成與審查層,負責將金融邏輯轉化為候選公式。在每次擴展節點時,LLM讀取父節點公式、根節點邏輯、當前評測弱項、歷史搜索路徑及可用算子邊界,生成帶有明確金融假說、預期方向、適用場景及組件解釋的新公式。LLM還承擔邏輯審查職責,過濾掉不自洽、使用非法字段或偏離根節點大邏輯的候選,確保生成的因子具備經濟學解釋能力。
最后,數據評測層負責用真實歷史數據檢驗候選因子的有效性。候選因子必須通過邏輯審查和公式解析后,才能進入回測環節,計算RankIC、RankIR等指標。評測結果轉化為獎勵分數回傳給MCTS,指導下一輪搜索。這種閉環機制使得因子挖掘不再是純粹的黑箱生成或機械模板枚舉,而是一個由金融假說、搜索控制和實證反饋共同驅動的迭代過程,既提高了研究效率,又保證了因子的可解釋性和穩健性。
參考報告REPORT
本報告構建了LLM-MCTS可解釋因子迭代框架,旨在實現從人工寫因子到AI挖因子的范式升級。框架中,MCTS負責在公式或代碼搜索樹中進行選擇、擴展、評測和回傳,LLM負責生成金融假說、可執行表達式或Python函數,并解釋機制及審查數據合法性。相比一次性讓模型寫公式,該框架將候選生成、周度RankIC/IR評測、樣本內選擇、樣本外檢驗和經驗庫沉淀組織成閉環,覆蓋日頻Seed改造、低頻Seed池批量挖掘和高頻分鐘行為挖掘。在日頻Seed定向改造中,以29個低頻價量原始因子為起點,結果顯示候選池層面25/29個Seed至少搜索到過樣本外優于原始Seed的候選。在低頻Seed池批量挖掘中,以12個根...