OpenAI 發布 o1 系列大模型,AI 大模型進入新紀元。
9 月 12 日,OpenAI 宣布開發了一系列全新 AI 模型,旨在在回應前投入更多時間思 考。與之前的模型相比,這些模型能夠更好地進行推理,并在科學、編程和數學等領域 解決更為復雜的問題。 作為早期模型,它還沒有許多 ChatGPT 上的實用功能,例如瀏覽網絡信息或上傳 文件和圖片。然而,對于復雜的推理任務而言,這是一項重大進展,代表了 AI 能力的新 高度。因此,OpenAI 將計數器重臵為 1,并將該系列命名為 OpenAI o1。 OpenAI 訓練這些模型在做出響應前花更多時間思考問題,類似于人類的思維方式。 通過訓練,它們學會了優化思維過程、嘗試不同策略并識別錯誤。 在 OpenAI 的測試中,OpenAI o1 在物理、化學和生物學等困難的基準任務中表現 與博士生相似。此外,OpenAI o1 在數學和編程領域也表現優異。在國際數學奧林匹克 競賽(IMO)的資格考試中,GPT-4o 僅正確解答了 13%的問題,而 OpenAI o1 的正確 率達到了 83%。在 Codeforces 編程比賽中,OpenAI o1 的表現達到了第 89 個百分位。 在 OpenAI 看來,這些增強的推理能力可能對解決科學、編程、數學等領域的復雜問題 特別有用。例如,o1 模型可以幫助醫療研究人員注釋細胞測序數據,物理學家生成量子 光學所需的復雜數學公式,開發者在各個領域構建和執行多步工作流。 9 月 12 日,OpenAI 宣布在 ChatGPT 和 API 中推出了 OpenAI o1 系列的首個模型, 這是一個預覽版本,其被命名為 OpenAI o1-preview。
為了突出相較于 GPT-4o 在推理能力上的提升,OpenAI 對模型進行了多樣化的人 類考試和機器學習基準測試。結果顯示,o1 在絕大多數推理密集型任務中明顯優于 GPT-4o。

在許多推理密集型的基準測試中,o1 的表現與人類專家相媲美。OpenAI 評估了 o1 在 AIME 考試中的數學表現,該考試旨在挑戰美國最優秀的高中數學學生。在 2024 年 的 AIME 考試中,GPT-4o 平均僅能解答 12%的問題(即 1.8/15),而 o1 平均解答正確 率為 74%(即 11.1/15),單次樣本測試的結果為 83%(即 12.5/15)時通過 64 個樣本 的共識,若通過學習得分函數對 1000 個樣本進行重新排名,其正確率達到了 93%(即 13.9/15)。得分 13.9 足以讓其躋身美國全國前 500 名學生,并超過參加美國數學奧林匹 克競賽(USA Mathematical Olympiad)的分數線。 OpenAI 還對 o1 在 GPQA-diamond 基準測試上的表現進行了評估,該測試是一個 困難的智力基準,評估在化學、物理和生物學方面的專業知識。為了將模型與人類進行 比較,OpenAI 邀請了擁有博士學位的專家來回答 GPQA-diamond 的題目。結果顯示, o1 超越了這些人類專家的表現,成為首個在該基準測試中表現優于人類專家的模型。這 一結果并不意味著 o1 在所有方面都比博士更有能力,而僅表明模型在解決某些問題上 比博士生預期的表現更為出色。在其他多個機器學習基準測試中,o1 也超越了當前的最 先進水平。啟用了視覺感知功能后,o1 在 MMMU 測試中得分為 78.2%,成為首個在人 類專家中具備競爭力的模型。此外,o1 在 MMLU 的 57 個子類別中,有 54 個超越了 GPT-4o 的表現。
o1 在編程領域表現優異,OpenAI 訓練了一款模型,命名為 o1-ioi,這個模型在 2024 年國際信息學奧林匹克競賽(IOI)中獲得了 213 分,排名在第 49 百分位。該模型基于 o1 進行初始化,并進一步訓練以提升編程技能。 o1-ioi 在 2024 年 IOI 比賽中與人類參賽者在相同條件下競爭,有 10 小時的時間解 決 6 道復雜的算法問題,每題允許提交 50 次解答。對于每個問題,OpenAI 的系統生成 了多個候選解答,并根據測試時的選擇策略提交了 50 次解答。提交選擇基于 IOI 公開測 試案例、模型生成的測試案例以及學習到的評分函數。如果 OpenAI 隨機提交解答,平 均分數僅為 156 分,這表明該策略在比賽條件下貢獻了近 60 分的提升。當放寬提交次 數限制時,模型的表現顯著提升。在每題允許提交 10000 次的情況下,o1-ioi 的得分達 到 362.14 分,超過了金牌門檻,且不需要任何測試時的選擇策略。 最后,OpenAI 模擬了 Codeforces 平臺上舉辦的競爭性編程比賽,以展示 o1-ioi 的 編程能力。OpenAI 的評估嚴格遵循比賽規則,并允許 10 次提交。GPT-4o 的 Elo 評分 為 808,位于人類競爭者的第 11 百分位。而 o1-ioi 遠遠超越了 GPT-4o 和 o1,達到了 1807 的 Elo 評分,表現超過了 93%的參賽者。
除了考試和學術基準測試外,OpenAI 還評估了在各種領域中 o1-preview 與 GPT-4o 在應對復雜、開放式問題上的人類偏好。在此評估中,人類訓練師們會看到來自 o1-preview 和 GPT-4o 的匿名響應,并投票選擇他們更喜歡的回答。結果顯示,在推理 密集型的任務類別中,如數據分析、編程和數學,o1-preview 相較于 GPT-4o 有顯著優 勢。然而,在某些自然語言任務中,o1-preview 的表現不如 GPT-4o,這表明它并不適 合所有應用場景。不同領域的偏好差異表明,o1-preview 雖然在推理和計算密集型任務 上表現優異,但在某些自然語言任務中仍未超越 GPT-4o。
o1 在 AI 推理方面取得了顯著的突破,推動了技術的前沿發展。OpenAI 計劃隨著持 續優化,發布該模型的改進版本。OpenAI 預期,這些新的推理能力將提升 OpenAI 將模 型與人類價值觀和原則對齊的能力。OpenAI 相信,o1 及其后續版本將為科學、編程、 數學及相關領域的 AI 應用開啟許多新的應用場景。
在模型的安全性方面,OpenAI 也做出了相當程度的提升。 在將新模型部署到 ChatGPT 或 API 中之前,OpenAI 會徹底評估新模型是否存在 潛在風險,并建立適當的保護措施。OpenAI 發布了 OpenAI o1 系統卡和準備框架評分 表,以對 o1 進行嚴格的安全評估。 作為開發這些新模型的一部分,OpenAI 提出了一種全新的安全培訓方法,充分利 用這些模型的推理能力,使其遵循安全和對齊的準則。通過能夠在具體語境中推理 OpenAI 的安全規則,模型可以更有效地應用這些規則。 OpenAI 評估安全性的一種方式是測試模型在用戶嘗試繞過這些規則時(俗稱為“越 獄”)能否繼續遵循其安全規則。在 OpenAI 最難的越獄測試之一中,GPT-4o 的得分 為 22(滿分 100),而 o1-preview 模型得分為 84。
在基于過去模型的安全評估和緩解措施基礎上,OpenAI 加大了對 o1 高級推理能力 的關注。OpenAI 通過公開和內部評估,衡量了諸如不允許的內容、人口公平性、幻覺 傾向和危險能力等風險?;谶@些評估結果,OpenAI 在模型和系統層面都實施了相應 的安全防護措施,例如黑名單和安全分類器,以有效緩解這些風險。 OpenAI 的研究表明,o1 的高級推理能力通過使模型能夠更好地推理安全規則并在 上下文中應用它們,增強了生成有害內容的抗風險能力。在“準備框架”體系下,o1 的總體風險等級為“中等”,且被評估為安全可部署,因為它并未使現有資源之外的風 險變得更為可能。其網絡安全和模型自主性風險等級為“低”,而化學、生物、放射和 核(CBRN)風險及說服性風險等級為“中等”。 o1 系列模型通過大規模強化學習進行訓練,采用鏈式推理來提升推理能力。這些 先進的推理能力為提高模型的安全性和穩健性提供了新的途徑。尤其是在回應潛在不安 全提示時,模型可以在上下文中推理 OpenAI 的安全政策,從而在生成非法建議、選擇 刻板印象化回應以及抵御已知的越獄攻擊等風險基準測試中達到業內領先的表現。訓練 模型在回答之前進行鏈式推理不僅能夠帶來顯著的好處,還可能因更高的智能性而增加 潛在風險。OpenAI 的研究結果強調了構建穩健的對齊方法、廣泛測試其有效性以及保 持嚴謹風險管理協議的必要性。
此外,o1 使用的“思維鏈條(CoT,Chain of Thought)”推理為模型的對齊和安 全性帶來了新的契機。OpenAI 發現,將模型行為的政策融入推理模型的思維鏈中,是一種有效且穩健的方式,可以傳授人類的價值觀和原則。通過教導模型在具體情境中推 理并遵循 OpenAI 的安全規則,OpenAI 的研究表明,推理能力直接提升了模型的穩健 性:o1-preview 在關鍵的繞過安全限制評估和我們最嚴格的內部安全邊界測試中表現顯 著提升。OpenAI 認為,使用鏈式思維推理能夠為安全性和對齊帶來重大進展,因為它 一方面使 OpenAI 能夠以可解釋的方式觀察模型的思維過程,另一方面使模型對安全規 則的推理在處理分布外情況時更加穩健。
我們認為,OpenAI o1 的發布代表了 AI 大模型的發展進入了新紀元,其整體推理水 平相比較 GPT-4o 模型有了跨越式的提升,在復雜推理和科學計算等方面,o1 模型表現 出了廣闊的潛力,此外,o1 在推理準確性和安全性上有顯著提升,有望推動 AI 技術的 進一步發展。