OpenAI o3

OpenAI新一代旗艦推理模型,o系列迄今最智慧的模型

深度報告

  • OpenAI o3 是 OpenAI 於 2025 年 4 月 17 日釋出的新一代旗艦推理模型,屬於 o 系列模型,旨在提升 ChatGPT 的問題解決能力。o3 是 o 系列迄今最智慧的模型,在程式設計、數學、科學和視覺感知領域創下新紀錄,首次將影象直接融入思維鏈,開啟融合視覺與文字推理的全新問題解決方式。與輕量版 o4-mini 相比,o3 更適合複雜查詢,能夠生成並批判性評估新穎假設。定價方面,o3 輸入費用為每百萬 tokens 10 美元,輸出費用為每百萬 tokens 40 美元。

  • OpenAI 是美國人工智慧研究機構,由埃隆·馬斯克等人於 2015 年創立,總部位於舊金山。公司的核心使命是通用人工智慧(AGI),先後釋出了 GPT 系列大型語言模型和 o 系列推理模型。2024 年 12 月 21 日,OpenAI 在第 12 天釋出會上首次公佈 o3 和 o4-mini 的訊息,引發全球科技圈關注。2025 年 4 月 17 日,兩款模型正式釋出,標誌著 OpenAI 在推理能力、多模態互動及成本最佳化上的重大突破。

  • o3 模型的核心功能主要體現在以下幾個方面。首先是推理能力的顯著提升,o3 是 o 系列迄今最智慧的模型,推理能力大幅提升,思考時間越長效果越好。其次是多模態推理能力,首次將影象直接融入思維鏈,開啟融合視覺與文字推理的全新問題解決方式。第三是工具呼叫能力,首次全面支援網頁搜尋、檔案分析、Python 程式碼執行、視覺輸入深度推理和影象生成,能以正確格式快速生成可靠答案,通常耗時不到一分鐘。第四是影象理解能力,可直接呼叫工具處理圖片,裁剪、旋轉、縮放等操作都不在話下即便影象模糊、反轉或質量不佳,模型也能準確解讀。第五是個性化記憶功能,支援記憶功能,能夠了解使用者興趣愛好並個性化回答。第六是搜尋驗證能力,可多次呼叫搜尋引擎,交叉驗證結果。 在效能表現方面,o3 在多個基準測試中創下新紀錄。視覺任務準確率達 87.5%,MathVista 測試得分 75.4%。外部專家評估顯示,程式設計、商業諮詢和創意構思的重大錯誤率比 o1 低 20%,特別適合複雜查詢,能夠生成並批判性評估新穎假設。 o4-mini 作為輕量版進行了專門最佳化,更適合需要快速響應的場景。AIME 2024 數學測試準確率 92.7%,AIME 2025 數學測試準確率 93.4%。在非 STEM 和資料科學任務中優於 o3-mini,效率更高。

  • o3 模型的定價採用了分層策略,具體價格如下:o3 輸入費用為每百萬 tokens 10 美元,輸出費用為每百萬 tokens 40 美元。o4-mini 輸入費用為每百萬 tokens 1.10 美元,輸出費用為每百萬 tokens 4.40 美元。約 75 萬個 tokens 的處理長度超過《指環王》系列。 2025 年 6 月,OpenAI 宣佈 o3 API 價格暴降 80%,進一步降低開發者使用門檻。o3-Pro 專注深度推理,效能領先,在 STEM 領域優勢明顯。降價後的 o3 衝擊市場,針對不同需求提供差異化服務。 在可用性方面,ChatGPT Plus、Pro、Team 使用者可立即使用。企業及教育使用者一週後獲得訪問許可權。免費使用者可透過 Think 模式使用 o4-mini,速率限制不變。開發者可透過 Chat Completions API 和 Responses API 訪問。

  • 從搜尋到的使用者反饋來看,o3 的釋出引發了廣泛關注和討論。正面評價方面,使用者普遍認可 o3 在推理能力和多模態處理上的突破,特別是影象思考功能被視為一項創新。多數使用者認為 o3 在數學和程式設計任務上的表現優於前代產品。降價後的價效比得到了部分使用者的認可。 負面反饋主要集中在定價方面。儘管有降價動作,但 o3 的使用成本仍然較高,對於個人開發者和小型團隊來說負擔不輕。有使用者指出,使用 o3-PRO 的成本顯著高於標準版。API 訪問的穩定性也是使用者關注的問題,在中國地區的訪問體驗有待最佳化。 使用場景方面,o3 特別適合需要深度推理的複雜查詢場景,如程式設計開發、數學研究、科學計算等。對於需要快速響應的輕度任務,o4-mini 是更具價效比的選擇。

  • 從行業角度來看,o3 的釋出被視為 AI 技術發展的重要里程碑。業界普遍認為 o3 在推理能力上實現了顯著提升,特別是在 STEM 領域的表現領先。影象思考功能的引入被認為是多模態 AI 的重要突破。o3-PRO 的釋出標誌著 AI 技術又向前邁出了一步。 然而,高昂的使用成本限制了其普及速度。部分觀點認為 o3-PRO 既帶來了更強大的功能和更精準的回答,也暴露出一些有待完善的地方。對於廣大使用者和開發者來說,o3 既是一個充滿機遇的工具,也存在成本控制的挑戰。

  • 技術層面,深度 AI 推理的可解釋性仍然有限,在關鍵應用場景中的可靠性需要進一步驗證。高推理成本帶來的碳足跡問題也引發了一些環保人士的關注。 商業層面,持續的高階定價策略可能影響使用者普及速度。部分使用者對 API 價格波動表示擔憂。競爭加劇的市場格局對 OpenAI 的定價權形成潛在挑戰。

  • o3 特別適合以下人群使用:專業開發者和研究人員,需要複雜推理能力的使用者,企業級應用場景,對多模態處理有需求的使用者。 對於普通使用者和對成本敏感的使用者,o4-mini 是更具價效比的選擇。ChatGPT Plus 訂閱也提供了訪問 o3 的渠道,適合常規使用場景。

  • OpenAI o3 是目前 o 系列最智慧的模型,在推理能力、多模態理解和複雜任務處理上實現了顯著突破。首次引入的影象思考功能開啟了 AI 推理的新正規化。高昂的使用成本仍是主要障礙,降價後有所改善建議根據實際需求選擇合適的模型版本。

使用者評論

  • 頭像
    Logan_Adams369
    影象思考功能太香了,直接把截圖丟進去就能分析,效率直接拉滿。

  • 頭像
    NFsa_n
    o3 的推理能力確實強,特別是複雜數學題,思考過程比 o1 詳細太多了。

  • 頭像
    Amanda_Collins_88
    價格還是太貴了,API 呼叫一次的成本夠我用 Claude 好幾次。

  • 頭像
    PaulBell_66
    實測程式設計能力確實強,程式碼生成的質量比前代高一個檔次。

  • 頭像
    Judy_Johnson_X
    視覺任務 87.5% 準確率不是吹的,親測有效。

  • 頭像
    whitesnake738
    思維鏈視覺化這個功能對學生黨太友好了,可以學習 AI 的推理過程。

  • 頭像
    SharonFloresJr
    降價 80% 後價效比高多了,之前嫌貴的可以再試試。

  • 頭像
    Bobby_Hall_8839
    o3-pro 出來後果斷訂閱,深度推理確實香。

  • 頭像
    PatriciaMendoza_77
    國內訪問不穩定,經常超時,體驗一般。

  • 頭像
    LiamGray
    比 Google Gemini 和 Claude 都強,推理能力獨一檔。

  • 頭像
    smallbird262
    MathVista 測試 75.4% 這分數太頂了,視覺理解目前最強。

  • 頭像
    EvelynRivera_20231
    程式設計錯誤率比 o1 低 20%,實測寫程式碼確實更穩了。

  • 頭像
    DAOthinker29
    免費版使用者體驗閹割太多,不如加錢上 Plus。

  • 頭像
    Evelyn.RogersX88
    企業使用者一週後才能用,等得好焦慮。

  • 頭像
    7EXK6NT8MN
    75 萬 tokens 處理量,約等於《指環王》三部曲,這上下文太離譜。

  • 頭像
    Rita816
    ChatGPT Plus 訂閱就能用,比單獨買 API 划算。

  • 頭像
    任博然
    o4-mini 價效比更高,普通任務完全夠用。

  • 頭像
    Matthew_Patel_71
    多模態融合是最大亮點,影象和文字一起推理的體驗很新鮮。

  • 頭像
    organicfrog247
    OpenAI 史上最強推理模型實至名歸,雖然貴但確實強。