深度報告
-
OpenAI o4-mini 是 OpenAI 於 2025 年 4 月 17 日釋出的小型推理模型,專為快速、經濟高效的推理而最佳化。o4-mini 在數學、程式設計和視覺任務方面表現出色,是 AIME 2024 和 2025 數學競賽題目的高分模型。作為小型模型首次整合的重要功能,o4-mini 不僅能看懂影象,更能進行深度理解和推理。在相同推理成本下,o4-mini 的表現明顯優於 o3-mini。定價方面,o4-mini 輸入費用為每百萬 tokens 1.10 美元,輸出費用為每百萬 tokens 4.40 美元,是 o 系列中價效比最高的選擇。
-
OpenAI 是美國人工智慧研究機構,由埃隆·馬斯克等人於 2015 年創立,總部位於舊金山。公司的核心使命是通用人工智慧(AGI),先後釋出了 GPT 系列大型語言模型和 o 系列推理模型。o4-mini 與 o3 於 2025 年 4 月 17 日同步釋出,標誌著 OpenAI 在提供更具成本效益的解決方案方面的承諾,同時不犧牲顯著的效能。
-
o4-mini 模型的核心功能主要體現在以下幾個方面。首先是影象推理能力,作為小型模型首次整合的重要功能,o4-mini 不僅能看懂影象,更能進行深度理解和推理。它能夠理解複雜圖表、分析和解讀白板、示意圖、流程圖等,具有草圖識別能力,能識別手繪草圖並提供相關建議,並具備視覺邏輯推理能力,基於影象內容進行邏輯推理和問題解答。 其次是效能與體積平衡,採用最新模型壓縮技術,實現小體積、大能力的目標。推理能力接近甚至超越 o1 全尺寸模型,響應速度比 o1 快 35% 以上,Token 處理效率顯著提升。 在基準測試方面,o4-mini 的表現優異。程式碼生成能力方面,HumanEval 得分 87.2%,MBPP 得分 80.3%,CodeContests 得分 62.1%。推理能力方面,GSM8K 數學測試得分 84.5%,MMLU 多學科得分 81.2%,ARC 常識得分 86.8%。影象理解能力方面,圖表解讀得分 82.5%,手繪識別得分 79.3%,視覺推理得分 83.7%。 在多模態能力方面,o4-mini 能同時處理文字、影象和音訊,並且能作為 Agent 智慧體自動呼叫網路搜尋、影象生成、程式碼解析等工具以完成複雜任務。
-
o4-mini 模型的定價採用了極具競爭力的策略,是 o 系列中價效比最高的選擇:o4-mini 輸入費用為每百萬 tokens 1.10 美元,輸出費用為每百萬 tokens 4.40 美元。相比 o1 便宜約 65%,比 o3-mini 也更具價格優勢。約 75 萬個 tokens 的處理長度超過《指環王》系列。 在可用性方面,ChatGPT Plus、Pro、Team 使用者可立即使用。企業及教育使用者一週後獲得訪問許可權。免費使用者可透過 Think 模式使用 o4-mini,速率限制不變。開發者可透過 Chat Completions API 和 Responses API 訪問。
-
從搜尋到的使用者反饋來看,o4-mini 的釋出獲得了廣泛認可。正面評價方面,使用者普遍認為 o4-mini 是價效比最高的選擇,速度快且效果好。多數使用者認為 o4-mini 在程式設計任務上的表現優於預期。小體積大能力的特點獲得了開發者的認可。 負面反饋主要集中在功能限制方面。作為小型模型,o4-mini 的能力上限不如 o3。免費使用者的速率限制讓部分使用者感到不滿。在複雜推理任務上表現不如 o3。 使用場景方面,o4-mini 特別適合需要快速響應的輕度任務,是價效比之選。對於需要深度推理的複雜任務,建議使用 o3。
-
從行業角度來看,o4-mini 的釋出被視為 AI 民主化的重要一步。業界普遍認為 o4-mini 在保持較低成本的同時提供了強大的推理能力。小型模型首次整合影象推理功能被視為技術突破。
-
技術層面,小型模型的推理深度有限,在關鍵應用場景中的可靠性需要評估。多模態融合仍有提升空間。 商業層面,持續的定價策略可能影響 OpenAI 的收入。使用者對不同版本模型的選擇困惑也是潛在問題。
-
o4-mini 特別適合以下人群使用:對成本敏感的個人開發者,需要快速響應的應用場景,教育科技領域的影象理解需求,中小企業級應用。 對於需要深度推理的複雜任務,建議使用 o3。對於預算充足且需要最強效能的使用者,o3 是更好的選擇。
-
OpenAI o4-mini 是目前 o 系列中價效比最高的小型推理模型,在數學、程式設計和視覺任務方面表現出色。首次在小型模型中整合影象推理能力是小體積大能力的典型代表。推薦給需要快速響應和高價效比的使用者群體使用。
使用者評論
-
Joseph_Morales_Plus225—o4-mini 價效比太高了,速度快效果也不錯,日常使用首選。 -
STrus—響應速度比 o1 快 35% 以上,實測確實明顯更快。 -
n1ql96—價效比之王,價格只有 o3 的十分之一,效果卻差不多。 -
Charles.GonzalesIII8—AIME 2025 數學測試 93.4% 準確率,這還是小型模型嗎? -
雲煙320—小型模型首次整合影象推理,進步明顯。 -
TAmor—CodeContests 62.1% 比 o1 還高,程式設計能力驚豔到我了。 -
Bobby_GrayIII—圖表解讀 82.5% 準確率,做資料分析很夠用。 -
NathanTaylor_Max6—比 o3-mini 強多了,定價還差不多,選 o4-mini 更划算。 -
LIgon—免費版也能用,就是有速率限制。 -
GErog—小體積大能力的典型代表,愛了。 -
VioletBauer—作為 Agent 自動呼叫工具的能力很實用。 -
BobbyCox_2023—草圖識別功能對學生黨太友好。 -
Charles.HughesZ49—GSM8K 84.5% 沒問題,數學能力夠用了。 -
SaraHughes_7—ARC 常識 86.8%,常識推理能力不錯。 -
DClark_2020998—企業 API 接入成本低太多了。 -
兔兔_4—比 o1 便宜 65%,這價格太香了。 -
TerryPerryK—多模態能力這次終於下放到小型模型了。 -
梅花956—響應速度快,適合實時對話場景。 -
Daniel_Morales_Pro50—OpenAI 最具價效比的推理模型,實至名歸。