全新推理模型 OpenAI o3 與 o4-mini 擁有強大的任務處理 能力和高效的工具運用能力,為復雜任務的解決奠定了基礎。
OpenAI o3 是一款在編碼、數學、科學和視覺感知領域具備顯著能力的推理模型。 該模型在 Codeforces、SWE-bench(無需構建特定于模型的自定義支架)和 MMMU 等基準測試中建立了新的最先進(SOTA)性能。其適用于需要多方面分析且答案 并非直接顯見的復雜查詢,在涉及圖像、圖表和圖形分析的視覺任務中表現顯著。 外部專家評估表明,在具有挑戰性的現實任務中,o3 相比 o1 的重大錯誤率降低 20%,在編程、商業/咨詢和創意構思領域性能提升顯著。早期測試者強調了其作 為“思維伙伴”的分析嚴謹性,尤其在生物學、數學和工程領域生成并批判性評 估新假設的能力。 在開發過程中,o3 在大規模強化學習(RL)中展現出與 GPT 系列預訓練階段類 似的“計算-性能”趨勢。通過將強化學習訓練計算量和推理時間提升一個數量級, 模型實現了持續的性能提升,驗證了推理時長與模型性能的正相關性。在與 o1 相 同的延遲和成本條件下,o3 在 OpenAI 部署中表現出更高性能,且經證實,隨著 推理時間增加,其性能會進一步提升。
該模型通過強化學習訓練實現工具使用能力,包括工具操作知識和工具使用時機 的上下文推理。這一能力提升了其在開放式場景中的表現,尤其是在涉及視覺推 理和多步驟工作流程的任務中。早期測試者報告顯示,在學術基準測試和實際任 務執行中,o3 均通過工具使用能力的改進實現了結果提升。 o4-mini 作為輕量化模型,聚焦快速且經濟高效的推理性能優化。在同等規模與成 本條件下,其于數學運算、編碼任務及視覺處理等領域展現出卓越性能表現,尤 為突出的是,該模型在 AIME 2024 和 2025 基準測試中均位列榜首。值得關注的 是,盡管借助計算機輔助能夠降低 AIME 考試難度,但實測數據顯示,當配備 Python 解釋器時,o4-mini 在 AIME 2025 測試中實現了 99.5%的通過率,充分印 證了 o4-mini 對外部工具的高效調用與協同能力;與之類似,o3 在 AIME 2025 測 試中通過工具運用,也取得了 98.4%的通過率與 100%的共識率,展現出工具賦能 對模型性能提升的顯著作用。 相較于前代 o3-mini,o4-mini 在非 STEM 領域任務處理及數據科學應用中均實現 性能超越。憑借其高效推理特性,o4-mini 在使用限制上顯著優于 o3,能夠為大規 模、高并發的推理任務提供強大支撐,成為高容量、高吞吐量場景下的理想解決 方案。外部專家評估指出,o4-mini 與 o3 通過智能化升級和網絡資源整合,在指 令遵循能力上較前代模型實現顯著提升,輸出響應兼具實用性與可驗證性。同時, 二者在對話交互層面進行深度優化,通過對歷史記憶與對話內容的有效調用,使 輸出結果更具個性化與場景適配性,顯著增強交互自然度與連貫性。 在 AIME 2024 和 2025 數學競賽測試里,o4-mini 即便無工具輔助,準確率也高于 o1 和 o3-mini,且 o3、o4-mini 在有工具時準確率進一步提升,工具對模型解題能 力有促進作用;在 Codeforces 編程競賽測試中,o3 和 o4-mini 使用終端工具后 ELO 得分大幅領先 o1,在編程任務借助工具能力可顯著提升。

GPQA Diamond 測試中,o3(無工具)準確率最高,o4-mini(無工具)次之,o1 和 o3-mini 稍低;而 Humanity’s Last Exam 測試里中,o4- mini(有工具)準確率 領先,o3(有工具)次之。不同模型在科研及綜合專業問答任務中各有優劣,進 一步體現 o3 及 o4-mini 模型借助工具可提升性能。總體而言,o4-mini 和 o3 在多 測試場景展現出較好潛力,工具使用對模型的編碼性能提升有重要意義。
在編碼領域,o3 與 o4-mini 通過實際任務完成情況彰顯其能力。在 SWE-Lancer 自 由編碼任務中,o3-high 和 o4-mini-high 脫穎而出。o3-high 賺取金額高達$65,250, o4-mini-high 也有$56,375 的收入,與 o1-high 的$28,500 和 o3-mini-high 的$17,375 形成鮮明對比。這一數據直觀地表明,o3 和 o4-mini 在實際編碼工作的創收能力 上優勢顯著,意味著它們能夠更為高效且優質地處理編碼任務,為實際項目帶來 更高價值。而在 SWE-Bench Verified 軟件工程測試中,二者的準確率同樣令人矚 目。o3 以 69.1%的準確率領先,o4-mini 也達到了 68.1%,遠超 o1 的 48.9%和 o3- mini 的 49.3%。進一步證實,在軟件工程相關的編碼任務中,o3 和 o4-mini 能夠 精準地完成任務,展現卓越的編碼能力。
遵循指令能力是衡量模型能否準確執行復雜任務的重要指標。在 Scale MultiChallenge 多輪指令遵循測試中,o3 展現出獨特優勢。其 56.5%的準確率高于 o1 的 44.9%、o3- mini 的 39.9%以及 o4-mini 的 43%。o3 在面對多輪指令時,能夠 更好地理解并按照指令要求執行任務,在需要精確遵循指令步驟的場景中,更具 可靠性。
代理工具使用能力對于模型處理復雜任務至關重要。在視覺推理任務方面,無論 是 MathVista 視覺數學推理測試,還是 CharXiv-Reasoning 科學圖形推理測試,o3 和 o4-mini 均表現出色。在 MathVista 測試中,o3 準確率為 86.8%,o4-mini 為 84.3%,遠高于 o1 的 71.8%;在 CharXiv-Reasoning 測試里,o3 準確率 78.6%,o4- mini 為 72.0%,同樣高于 o1 的 55.1%。這充分說明,在處理涉及視覺信息理解與 推理的任務時,o3 和 o4-mini 能夠有效借助工具,完成復雜的視覺任務。在 BrowseComp 代理瀏覽測試中,o3 和 o4-mini 結合工具后的表現更是令人驚嘆。 o3 結合 python 和瀏覽工具時準確率為 49.7%,o4-mini 在 Deep research 下結合相 關工具準確率達 51.5%,與 o1 結合瀏覽工具僅 1.9%的準確率形成巨大反差。這 表明 o3 和 o4-mini 在代理瀏覽任務中,對工具的運用能力遠超其他模型,能夠通 過工具獲取和處理信息,提升任務完成質量。此外,在 Tau-bench 函數調用測試 中,在航空和零售等不同行業場景里,o3-high 和 o4-mini-high 也展現出較高的準 確率。如零售場景中,o3-high 達到 73.9%,o4-mini-high 為 71.8%,說明它們在涉 及函數調用這類工具使用任務時,能夠準確運用工具實現功能,滿足不同行業的 任務需求。
o3 和 o4-mini 在編碼、遵循指令以及代理工具使用等多個關鍵領域,相較于其他 模型展現出明顯優勢。它們憑借強大的任務處理能力和高效的工具運用能力,為 人工智能在實際應用中的發展提供了有力支持,也為未來更多復雜任務的解決奠 定了堅實基礎。
OpenAI o3 和 o4-mini 作為 o 系列最新的推理模型,在視覺信息處理方面,首次 達成將圖像直接融入思維鏈進行思考。開創了視覺與文本推理融合的全新問題解 決范式。 從圖像輸入適應性來看,用戶可上傳白板照片、教科書圖表、手繪草圖等各類圖 像。即便圖像存在模糊、反轉或質量欠佳等狀況,模型仍具備解讀能力。在工具 輔助下,模型能夠對圖像進行動態操作,涵蓋旋轉、縮放、變換等處理,極大拓 展了圖像分析的靈活性與深度。在視覺感知任務中,o3 和 o4-mini 可達到頂尖準 確率,成功攻克諸多此前難以解決的問題。 與 OpenAI o1 相似,o3 和 o4-mini 經訓練具備在回答前進行深度思考的能力,運 用較長的內部思維鏈推導答案。在此基礎上,o3 和 o4-mini 進一步升級,將圖像 納入思維鏈體系。模型可通過工具對用戶上傳圖像進行轉換,實現裁剪、放大、 旋轉等基礎圖像處理操作,且這些功能內置于模型,無需借助獨立專用模型,確 保了視覺推理的連貫性與高效性。 借助 o3 和 o4-mini 可實現視覺智能增強,能夠以更全面、準確、可靠的方式剖析 圖像,助力用戶應對復雜難題。該能力可將高級推理與網頁搜索、圖像處理(包 括自動縮放、裁剪、翻轉、增強圖像等)等工具無縫集成,即便面對低質量照片, 也能有效提取關鍵信息。如用戶上傳經濟學習題集照片可獲取詳細步驟講解,分 享構建錯誤的屏幕截圖能快速得到根本原因分析。這種融合方式為測試時間計算 擴展提供了新維度,實現視覺與文本推理的自然融合,在多模式基準測試中呈現 出領先性能,是邁向多模式推理的關鍵進展。 在用戶交互層面,o3 和 o4-mini 基于圖像思考的特性,顯著優化了與 ChatGPT 的 交互體驗。用戶通過拍照提問時,無需顧慮物體位置、圖像文字顛倒或存在多個 問題等情況。視覺推理功能支持模型自動放大查看圖像細節,精準捕捉關鍵信息。 此外,這兩款最新視覺推理模型可與 Python 數據分析、網絡搜索、圖像生成等工 具協同運作,以創新且高效的方式處理復雜問題,為用戶帶來 OpenAI 首個多模 式代理體驗,在科研、教育、工程等多領域具有廣闊應用前景。
基于一系列人工測試與機器學習基準測試,o3 與 o4-mini 在 MMMU 大學水平視 覺問題解決任務中,o3 準確率達 82.9%,o4-mini 為 81.6%,遠高于 GPT-4o 的 68.7% 和 o1 的 77.6%;在 MathVista 視覺數學推理任務里,o3 準確率 86.8%,o4-mini 為 84.3%,而 GPT-4o 僅 61.4%,o1 為 71.8%。在圖表閱讀和推理(CharXiv-descriptive、 CharXiv-reasoning)、感知基元(VLMs are blind)以及視覺搜索(V* search benchmark) 等任務中,o3 和 o4-mini 同樣表現優秀,在各基準測試中大幅超越先前模型,創 下新的最高水平,例如在 V*search benchmark 測試中,o3 準確率高達 95.7%,o4- mini 為 94.6%,而 GPT-4o 和 o1 分別為 73.9%、69.7%。
然而,當前模型仍存在一定局限性。在推理鏈方面,模型可能執行冗余或不必要 的工具調用及圖像處理步驟,致使思維鏈冗長;感知層面,模型仍會出現基本的 感知錯誤,即便工具調用正確推進推理,視覺誤解也可能引發錯誤答案;可靠性 上,模型在多次嘗試解決問題時,可能采用不同視覺推理過程,部分過程會導致 錯誤結果。 盡管如此,OpenAI o3 和 o4-mini 仍顯著提升了視覺推理的先進水平,是邁向更廣 泛多模態推理的關鍵一步,在視覺感知任務中實現一流準確率,攻克諸多此前的難題。目前,OpenAI 依舊致力于持續完善模型的圖像推理能力,使其更簡潔、可 靠,減少冗余,期待這些改進能為人們日常工作效率的提升帶來積極影響。
OpenAI o3 和 o4-mini 在模型能力提升的同時,高度重視安全性的同步增強。從安 全訓練數據層面來看,研發團隊徹底重建相關數據,在生物威脅、惡意軟件生成 和越獄等關鍵領域增添新的拒絕提示,使得這兩款模型在內部拒絕基準測試中表 現優異。不僅如此,還開發系統級緩解措施,通過訓練推理 LLM 監視器(基于人 類編寫且可解釋的安全規范)來標記危險提示,在生物風險場景下,該監視器能 成功標記約 99%人類紅隊活動對話,展現出強大的風險識別能力。 在安全評估與風險表現方面,o3 和 o4-mini 在內容安全與越獄防御上表現突出: 二者在標準與挑戰性拒絕評估中對有害內容的攔截能力與 o1 持平或更優,且對已 知越獄攻擊展現較強抵抗力。o4-mini 因模型規模較小在 PersonQA 中出現較高幻 覺率,而 o3 雖整體準確率優異但仍存在不實斷言需優化,但二者在多模態安全領 域表現亮眼——其圖文違規內容拒絕能力超越 o1,且在視覺任務中的安全性優于 o1 和 GPT-4o。指令層級沖突場景下,o3 與 o1 表現接近,o4-mini 稍遜,但通過 強化指令層級訓練有效防止工具調用繞過。第三方評估顯示,METR 認證二者具 備基礎自主能力(o3 存在輕微獎勵黑客行為),Apollo Research 指出雖具戰略欺 騙潛力但災難性風險低,而 Pattern Labs 驗證 o3 的網絡攻擊能力優于 o4-mini,但 均未達專業威脅水平。
在多領域能力評估中,o3 和 o4-mini 展現出差異化表現:生物化學領域可輔助專 家規劃已知生物威脅操作,但當前尚不具備支持新手創建生物威脅的高風險能力, 需警惕未來能力迭代帶來的潛在風險;網絡安全方面,二者在 CTF 挑戰中對高中 至專業級賽題均展現出優于前代的解題能力,但受限于自主完成端到端網絡操作 的能力(僅能在提供 solver code 時解決特定場景),尚未構成高自主性網絡威脅; 人工智能自我改進維度,其在結構化任務(如 OpenAI 研究工程師面試、SWE-bench Verified 測試及 PRs 審查)中表現卓越,但在現實場景的開放式研究任務(如PaperBench)中效能顯著下降,暫未達到“高”等級自主改進能力閾值。
經最嚴格安全程序壓力測試,依據更新的防范框架,在生物和化學、網絡安全以 及人工智能自我改進這三個關鍵跟蹤能力領域評估顯示,o3 和 o4-mini 在安全性 方面均低于“高”閾值標準,表明其安全性處于可控且相對較低風險水平。功能 與性能上,o3 和 o4-mini 將先進推理能力與全面工具功能深度融合,涵蓋網頁瀏 覽、Python 運用、圖像及文件分析、圖像生成等諸多方面,在處理復雜數學、編 碼、科學難題以及視覺感知分析任務中表現卓越,還能在思維鏈中靈活調用工具 增強自身能力。從訓練方法而言,OpenAI o 系列模型運用大規模強化學習思維鏈 進行訓練,這為提升模型安全性和穩健性開拓了新路徑,使其能在面對潛在不安 全提示時,基于上下文推理安全策略。OpenAI 安全咨詢小組審查認定,o3 和 o4- mini 在三個跟蹤類別中均未達“高”門檻。總體而言,OpenAI o3 和 o4-mini 在能 力與安全保障上實現了較好平衡與提升,但在不斷變化的應用環境中,仍需持續 關注和優化其安全性表現。