Google DeepMind發布DataRater,實現數據質量自動化評估。
1.前沿行業動態
1.人形機器人首次打通視覺感知與運動斷層
LeVERB (Latent Vision-Language Encoded Robot Behavior)是由UC伯克利、卡內基梅隆大學(CMU)等團隊開發的一種創新性人形機器人控制框架,首次實現了視覺語義理解與全身運動控制(Whole-BodyControl,WBC)的無縫連接,使機器人能夠像人類一樣“從思考到執行”復雜任務。
LeVERB框架的關鍵突破在于實現了人形機器人的零樣本部署能力,使其無需預先熟悉環境,僅通過視覺感知和語言指令(如"坐在椅子上""跨過箱子")就能完成復雜的動態全身動作,在簡單導航任務中成功率高達80%,整體任務成功率達到58.5%。該框架采用創新的分層架構設計:高層(LeVERB-VL)是一個基于Transformer的視覺-語言模型(102.6M參數),負責將語言指令和視覺信息轉換為"潛在動作詞匯"這一抽象指令,運行頻率為10Hz;底層(LeVERBA)則是一個通過強化學習訓練的全身控制策略(1.1M參數),能夠將這些潛在詞匯實時解碼為精確的關節級動作,以50Hz的頻率實現動態控制。特別值得一提的是,LeVERB通過合成數據訓練(采用IsaacSim的光線追蹤渲染技術)和動作捕捉重定向技術,有效解決了真實機器人數據稀缺的難題,并在宇樹G1機器人上成功驗證了從仿真環境到真實場景的零樣本遷移能力。
實驗表明,LeVERB框架性能遠超傳統分層VLA方案,提升幅度達7.8倍,并通過消融實驗驗證了判別器、運動學編碼器等關鍵組件的必要性。在實際演示中,搭載該框架的宇樹 G1機器人成功完成了"走向椅子坐下"、"敲門"等任務,展現了卓越的環境適應性和動作靈活性。這一突破性進展有效解決了傳統機器人"能理解但不會動"或"能動但不懂語義"的行業難題,為服務機器人、工業自動化等應用場景開辟了新可能。
2.普林復旦打造AI歷史助手,AI圈人文學科
普林斯頓大學 AI實驗室與復旦大學歷史學系聯合推出的HistBench和HistAgent,標志著AI在歷史研究領域的重大突破。HistBench作為全球首個歷史研究AI評測基準,填補了人文學科系統性評估工具的空白。這一基準包含414道由歷史學者精心設計的問題,覆蓋29種語言和36個歷史子領域,從基礎信息檢索到跨學科深度分析形成完整難度梯度。測試顯示,主流大模型在 HistBench上的準確率不足20%,凸顯了AI在歷史認知上的局限性。
專為歷史研究打造的HistAgent則展現了突破性的解決方案。這個多智能體協作系統從底層架構就針對史學研究需求設計,集成了OCR識別、多語言翻譯、文獻檢索等核心功能。通過中央調度模塊協調各子模塊,HistAgent能夠模擬歷史學者的研究流程,處理手稿、古地圖等復雜材料。在HistBench測試中,其36.47%的準確率遠超通用模型,同時在GAIA通用基準上也保持60%的成績,證明了專業定制與通用能力的兼容性。
重新定義了科技與人文的互動方式。HistBench和HistAgent不僅提供了實用工具,更開創了AI參與文明記憶構建的新范式。研究團隊計劃持續擴展題庫和優化系統,使AI能夠跟上史學研究的演進步伐。雖然當前技術尚不能替代歷史學家,但這一突破表明,通過領域適配的架構設計和系統性評估,AI完全可以成為人文研究的得力助手。
3.AI自生成訓練數據,靠「演繹-歸納-因」解鎖推理能力
新加坡國立大學、清華大學和Salesforce Al Research提出的元能力對齊(Meta-AbilityAlignment)框架,通過模仿人類推理的心理學理論(演繹、歸納、溯因),系統化訓練大模型的推理能力。該方法自動化生成訓練數據,并采用分階段專家訓練+參數融合策略,顯著提升了模型在數學、編程和科學任務上的穩健性和泛化能力。
該框架為在數學、編程和科學領域提升推理能力提供了一種可擴展、可推廣且可控的方法有助于構建可解釋且魯棒的推理模型。這種模塊化的訓練方式,借鑒了混合專家模型,同時使用來自心理學對人類推理本質的洞見,讓大模型的每個專家進行專業分工,擅長一種推理方式,從而能夠用小數據集完成快速的性能提升。
2.前沿企業動態
1.Google DeepMind發布DataRater,實現數據質量自動化評估
Google DeepMind 團隊最新推出的DataRater 框架,通過元學習技術自動評估和篩選訓練數據,顯著提升模型訓練效率。該技術能夠減少低質量數據對模型性能的影響,同時降低計算資源消耗,為大模型訓練提供更高效的數據處理方案。
核心優勢:1)自動化數據篩選:通過元梯度優化,自動識別高質量數據,減少人工干預。2)計算效率提升:最高減少46.6%的訓練浮點運算(FLOPS),加速模型收斂。3)跨規模泛化能力:基于4億參數模型訓練的DataRater,可適配5000萬至10億參數的不同規模模型。
4)低質量數據識別:有效過濾文本編碼錯誤、OCR噪聲及無關內容,提升數據純凈度。
針對不同質量的數據集,DataRater自動學習到最佳數據丟棄比例:高質量數據(C4):僅需丟棄10%的低價值樣本。中等質量數據(C4/noclean):最優丟棄比例為50%。低質量數據(Pile):可安全丟棄75%的聲樣本。
這一結果表明,DataRater能夠自適應不同數據分布,在保證模型性能的同時最大化計算效率,尤其適用于大規模預訓練場景。
DataRater 采用元學習框架實現動態數據篩選,首先為每個數據點分配0~1連續的重要性權重以替代傳統二值化選擇,隨后通過Softmax函數對權重進行歸一化處理,構建可微的評分函數來動態調節不同數據對訓練過程的影響。
其核心機制通過元梯度優化實現:基于測試集性能構成的外層損失函數,反向傳播優化數據評分策略的參數,使模型能夠自動學習最優的數據權重分配方案,從而提升下游任務的泛化性能。該框架將數據篩選過程轉化為可學習的權重調整問題,實現了篩選策略與模型訓練的端到端協同優化。
DataRater的元學習數據篩選框架可廣泛應用于以下場景:大語言模型(LLM)預訓練:優化海量數據的篩選流程,自動識別并剔除低價值樣本,顯著降低訓練成本,同時維持或提升模型性能。
合成數據清洗:高效檢測并過濾偏差大、重復或低效的合成數據(如來自LLM生成或數據增強的數據),提升訓練數據的有效性。
多模態學習:可擴展至圖像、語音等非文本數據,通過自適應權重分配評估數據質量,適用于跨模態預訓練或對齊任務。DataRater的智能數據篩選框架對AI行業產生深遠影響:在研發效率方面,大幅減少數據工程師手動清洗和標注的工作負擔;在成本控制維度,通過優化計算資源使用,顯著降低企業訓練大模型的邊際成本(最高可節省46.6%資源消耗);同時帶來模型性能的實質性提升,在HellaSwag、PIQA等關鍵下游評測任務中展現出更優表現。該技術通過元學習驅動的自動化數據價值評估,正在重塑大規模AI訓練的數據處理范式,為行業提供兼顧效率與性能的新型解決方案。
2.0penAI發布03-pro型
03-pro 在數學、編程、科學基準測試中表現驚艷,大幅超越 o1-pro和 03,甚至碾壓 Gemini2.5 Pro 和 Claude 4 0pus.
關鍵改進:
專為深度思考和超可靠答案設計,兼具長思考、超長上下文、工具調用能力。
支持自動調用工具(網頁搜索、文件分析、視覺輸入推理、Python代碼執行)。
通過記憶功能實現個性化回答,提升清晰度、全面性、指令遵循度和準確性。
DeepSeek在多項權威測試(如AIME 2024、GPOA、Codeforces)中均取得最高分,并在「4/4可靠性」評估標準下表現卓越,這得益于其優化的推理架構顯著提升了復雜任務(如數學、編程、科學問答)的處理能力,同時支持超長上下文輸入,為復雜分析和報告生成提供了強大支持。此外,其工具調用能力的大幅增強,使其能更精準地識別環境需求并選擇合適工具,進一步提升了任務執行效率。
DeepSeek在保持高性能的同時展現出顯著的價格優勢:o3-pro定價為輸入20美元/百萬token、輸出80美元/百萬 token,僅為o1-pro的 87%;而 03版本更是降價 80%,輸入低至2美元/百萬 token、輸出8美元/百萬 token,與 GPT-40相當。
在效率方面,03-prO在ARC-AGI半封閉評估中通過率大幅提升,單任務成本進一步優化盡管響應速度較慢(部分復雜任務需3-13分鐘思考),但其優先保障可靠性,特別適合數學推理、編程和科學分析等高難度需求。
3.華為MOE訓練系統優化方案
混合專家模型(MOE)的重要性日益凸顯,隨著大模型參數規模持續擴大,MoE架構成為突破算力瓶頸的關鍵路徑,但訓練效率與內存占用仍是核心挑戰。華為在該領域的探索包括此前通過 Adaptive Pipe&EDPB框架優化分布式訓練,而本次研究進一步聚焦單節點效率提升,實現了算子加速與內存優化,推動MoE模型的高效訓練與部署:
在昇騰計算加速方面,通過對MoE核心算子(FlashAttention、MatMul、Vector)的深度優化,訓練吞吐提升15%。其中,FlashAttention采用"瘦身術"消除冗余計算,性能提升 50%(前向)/30%(反向);MatMul通過數據搬運策略調整提升Cube利用率10%;Vector算子融合技術實現3倍性能提升。進一步結合昇騰+鯤鵬協同優化,采用算子下發"零等待"策略(同步消除+下發序重排+綁核優化)使Host-Bound耗時降低70%,配合SelectiveR/S內存優化技術(細粒度重計算+智能Swap+自適應管理),最終實現額外 20%吞吐提升和70%內存節省,顯著提升訓練效率。
4.TicNote--全球首款 Agentic AI隨身大腦
TicNote是全球首款 Agentic AI硬件,由出門問問推出,定位為“聽得懂、記得住、會思考”的隨身AI伙伴。它采用3mm超薄磁吸設計,支持20小時連續錄音,具備雙模式收聲和多端同步功能,搭載自研 Shadow AgenticAI系統,可完成120+語言轉寫翻譯、智能總結、靈感捕捉及深度交互(如精準問、報告生成)。實測中,它能將13分鐘英文演講自動提煉為思維導圖,或幫助職場媽媽同時處理家長會和工作復盤,展現碎片信息結構化能力。
作為國產 AGI技術落地的標桿,TicNote通過軟硬結合顛覆傳統工作流。其背后是出門問問“猴子序列”大模型和AgenticAl架構,利用硬件數據反哺模型迭代,目標從工具升級為“思考伙伴”。該產品在職場、教育、創作場景中實現10倍效率提升,標志著中國企業在AgenticAI硬件領域的全球突破,也為通用人工智能發展提供雛形。