OpenAI 率先發布Operator智能體,AI進入Agent時代。
OpenAI推出Operator智能體,模擬人類在電腦上的操作行為。2025年1月OpenAI上線了其首個AI Agent Operator,Operator能夠模擬人類在電腦上的動作,如通過點擊、滾動、輸入等與電腦交互,并完成相關任務。Operator可以瀏覽網頁、填寫表格、訂購商品、預定餐廳等,如輸入餐廳預訂要求后,Operator 會在分析需求后直接打開一個云端瀏覽器并執行搜索、查找、預定等相關操作。
Operator仍處于研究預覽階段。Agent是AI產業當前進步重要方向之一,應用準確率仍待持續提升。為了確保安全和迭代進度,目前Operator處于研究預覽階段,僅面向美國的 ChatGPT Pro(200 美元/月)用戶,Plus 用戶也不能體驗,未來將進一步擴展用戶。
Operator代表OpenAI拉開L3級Agent時代序幕。OpenAI內部將AI發展階段定義為5個階段:聊天機器人(具備對話能力)、推理者(具備人類問題解決能力)、Agent(具備執行任務能力)、創新者(具備創造發明能力)、組織者(具備組織工作能力)。Operator實現了AI與數字系統的交互,將自動執行桌面任務成為可能,而非調用固定API,Agent成為AI發展的新階段。

CUA是Operator工作的主要Agent。Computer-Using Agent(CUA)是一個計算機使用代理,其通過強化學習實現了GPT-4o的視覺能力與高級推理相結合,可以像人類一樣完成與圖形用戶界面 (GUI)的交互。CUA將高級 GUI 感知與結構化問題解決相結合,將任務分解為多步驟計劃,且會在出現問題時自動糾錯。
Operator測試數據優于前期SOTA,但與人類差距仍較大。OSWorld是一個用于評估多模態Agent的測試集,WebArena是用于評估Agent瀏覽器使用性能的測試集。測評結果顯示,Operator在 OSWorld上實現了成功率38.1%;WebArena 上實現了58.1%的成功率;在 WebVoyager 上實現了 87% 的基于 Web 的任務的成功率,但是 WebVoyager大多數任務都相對簡單。目前Operator超過了前期最優水平,但相比人類72%以上的成功率仍有較大差距。
Operator仍在持續進步中。目前Operator仍不完美,并且可能會犯錯誤。在內部測試數據,Operator在創建PPT和日歷等復雜界面時會遇到挑戰,在復雜的文本編輯方面表現較差 (成功率為 40%)。
OpenAI 的基礎模型(包括支持 ChatGPT 的模型)是使用三個主要信息源開發的:(1)互聯網上公開的信息,(2)與第三方合作訪問的信息,以及(3)用戶或人類培訓師和研究人員提供或生成的信息。
第三方公司:DoorDash、Instacart、OpenTable、Priceline、StubHub、Thumbtack、Uber 等。
數據來源:僅采集互聯網上免費公開的信息,不主動搜索付費墻后或暗網中的數據。同時,采用過濾機制剔除仇恨言論、成人內容、以個人信息為主的網站和垃圾郵件等不希望模型學習或輸出的信息,這些數據用于訓練模型。
個人信息使用:雖然訓練數據中可能包含個人信息,但OpenAI 不會主動搜集此類信息,也不會利用它們建立個人檔案、聯系用戶、進行廣告投放或推廣產品。所有數據僅用于提升模型在預測、推理和解決問題方面的能力。
美國關于OpenAI的數據訪問的法律法規涉及多個層面,包括隱私保護、數據安全、版權、特定領域數據保護等。這些規定要求其保護用戶隱私、確保數據安全、實施數據最小化及敏感數據保護,同時禁止未經授權的數據訪問和電子通信攔截,并嚴格遵守版權保護措施,同時還需確保人工智能決策過程的透明、公平并定期接受審計。 Operator必須遵守的數據使用規則:數據最小化、敏感數據保護、用戶權力。
OpenAI Operator 的一些典型應用場景包括:旅行預訂、購物、餐廳預訂、行政任務、市場營銷、與各行業合作。此外,OpenAI正與 DoorDash、Instacart、OpenTable 和 Priceline 等公司合作,以改進 Operator 在現實世界中的應用。這意味著Operator 的功能將不斷完善,并更好地滿足不同行業用戶的需求。
案例1:使用Operator預訂餐廳。 實現步驟:1)直接幫你找餐廳、看評分、訂位置;2)遇到時間沖突會智能推薦其他時段;3)基本實現全自動化操作,只有在遇到登錄、支付等操作時,Operator會將操作權交還給用戶。
案例2:使用Operator網購下單。 實現步驟:1)上傳購物要求或者購物清單照片 ;2)自動采購多平臺比價,確保性價比最高 ;3)按需求加入購物車。
案例3:使用Operator訂機票酒店 。實現步驟:1)一鍵搜索比價;2)推薦最佳方案;3)提交客戶個人信息,完成訂票。 以上操作基本由AI完成,只有在遇到登錄、支付等操作時,Operator會將操作權交還給用戶。
以上的案例中,Operator表現出強大的性能,仿佛是一個24小時的個人助理。該助理的最強技能是可以支持多任務并行處理,能同時接受指令,完成訂餐、網購、搜集資料、做研究看新聞、做總結等操作。
案例4:Operator的多任務操作,根據用戶想吃的食物,將所有食材都加入購物車。 實現步驟:1)搜集食物圖片,解析食材;2)根據食材列好購物清單;3)登錄購物網站進行比價,最后列出性價比最高的方案。以上操作中,Operator的邏輯和人類一樣,看到實物圖片、點擊對應的按鈕。這和其他使用API或者基于編程接口的Agent不同,它是基于文本的思維鏈進行推理。