GPT-5.5
OpenAI面向真實工作推出的新一代Agent型旗艦大模型,具備自主任務處理與跨工具操作能力
深度報告
-
GPT-5.5是OpenAI於2026年4月23日正式釋出的新一代旗艦大模型,官方將其定位為"面向真實工作的全新智慧層級"。這是自GPT-4.5以來首次從零開始訓練的基座模型,在程式設計能力、計算機操作、知識工作和科研任務方面均有顯著提升。 GPT-5.5 API輸入價格為5美元/百萬Token,輸出價格為30美元/百萬Token,較GPT-5.4漲價約一倍,但Token效率提升約40%,實際成本漲幅約為20%。社群反饋總體積極,開發者認為這是"可衡量的增量收益",在短程式碼任務和速度方面獲得一致好評,但在長時間代理任務方面仍存在謹慎態度。
-
OpenAI成立於2015年,是全球領先的人工智慧研究機構,總部位於美國舊金山。公司的核心產品包括ChatGPT對話助手、Codex程式設計輔助工具以及GPT系列大語言模型。2026年以來,OpenAI加快了產品迭代節奏,在4個月內連續釋出GPT-5.4和GPT-5.5兩代產品,展現出強烈的技術衝刺態勢。 GPT-5.5的開發代號為"Spud"(土豆),於2026年3月24日完成預訓練。該模型是OpenAI與英偉達聯合設計、協同訓練和協同部署的產物,充分利用了GB200和GB300 NVL72系統的計算能力。OpenAI首席科學家Jakub Pachocki表示,過去兩年AI領域進步相對緩慢,但預計短期內會有顯著改進,中期會有極其顯著的改進。 從公司戰略層面看,GPT-5.5的釋出標誌著OpenAI向"Super App"願景邁出了重要一步。聯合創始人Greg Brockman表示,公司計劃將ChatGPT、Codex和AI瀏覽器整合為統一的單一服務,為企業客戶提供更完整的解決方案。這一戰略與競爭對手Elon Musk將X打造成"Super App"的計劃形成直接競爭態勢。
-
GPT-5.5在技術架構上實現了質的飛躍。與此前版本不同,GPT-5.5是首個明確定位為"Agent模型"的基座模型,其訓練目標不再是單純的對話能力,而是自主執行多步驟任務、呼叫工具、自我檢查並持續推進直到任務完成的完整能力。這意味著GPT-5.5不再是一個"對話大模型+工具能力"的組合,而是一個"Agent基座+對話能力"的本質升級。 該模型提供兩個變體:GPT-5.5 Thinking和GPT-5.5 Pro。Thinking是預設版本,替代ChatGPT中的GPT-5.4;Pro是高精度變體,價格是Thinking的6倍,但能獲得個位數百分點的可靠性提升。API上下文視窗統一為100萬Token,Codex平臺為400K Token。
-
GPT-5.5被官方稱為"目前最強的Agentic Coding模型"。在公開測試基準上,Terminal-Bench 2.0達到82.7%的準確率,領先第二名Claude Opus 4.7超過13個百分點;SWE-Bench Pro達到58.6%;OpenAI內部Expert-SWE基準更是顯著高於GPT-5.4。該模型能夠處理長鏈路任務:理解專案結構、定位失敗原因、修改相關檔案、補測試、驗證結果,形成完整的開發工作流。 OpenAI內部超過85%的員工每週使用Codex,覆蓋工程、財務、市場、公關、資料科學和產品管理等職能。財務團隊藉助GPT-5.5審閱了24771份K-1稅表(共71637頁),比去年提前兩週完成。GTM團隊用於自動生成周報,每週節省5至10小時重複性工作。
-
GPT-5.5在計算機操作方面展現出顯著進步。OSWorld-Verified測試達到78.7%的成功率,與Claude Opus 4.7基本持平。該模型能夠在一個或多個工具之間靈活切換,持續推進複雜任務,而不僅僅是回答問題。使用者可以讓GPT-5.5寫程式碼、除錯、查資料、分析資料、生成文件和表格、操作軟體,完成從找資料、理解內容、呼叫工具到檢查輸出、整理成結果的完整流程。
-
GPT-5.5在知識工作領域表現突出。GDPval測試(44種職業知識工作模擬)達到84.9%的任務達到或超過行業專家水平。在商業、法律、教育和資料科學領域,回答的全面性、結構性和實用性顯著提升。內部測試中,電子表格建模任務獲得88.5%準確率,投資銀行級別建模任務也保持領先。 在科研領域,GPT-5.5展現了協助進行尖端研究的能力。遺傳學、定量生物學、生物資訊學等領域的測試表現明顯改進,GeneBench和BixBench測試取得優異成績。OpenAI內部版本配合自定義工具鏈,幫助發現了關於Ramsey數的一個新數學證明,並在形式化證明工具Lean中完成驗證。波茲南大學數學系助理教授Bartosz Naskręcki僅憑一條提示詞,在11分鐘內構建出代數幾何應用。Jackson實驗室免疫學教授Derya Unutmaz使用GPT-5.5 Pro分析了兩個血液樣本、共近28000個基因的基因表達資料集,節省了數月工作量。
-
儘管模型更大,但GPT-5.5的per-token latency與GPT-5.4相當。Codex編寫負載分配啟發式演算法使Token生成速度提升超過20%,同時模型反過來幫助改進服務它的基礎設施,實現了一種自我最佳化的良性迴圈。在安全方面,網路安全能力比GPT-5.4有所提升,部署了更嚴格的分類器針對高風險活動和敏感網路安全請求,同時也提供Trusted Access for Cyber讓經過驗證的防禦性使用者獲得更少阻礙。
-
GPT-5.5的API定價相比GPT-5.4有明顯上漲。GPT-5.5輸入價格為5美元/百萬Token,輸出價格為30美元/百萬Token,是GPT-5.4(2.50美元/15美元)的約2倍。GPT-5.5 Pro的輸入價格為30美元/百萬Token,輸出價格為180美元/百萬Token。 值得注意的是,雖然單價漲幅約100%,但Token效率提升約40%,按Artificial Analysis的Intelligence Index測算,GPT-5.5(medium)能用 Opus 4.7(max)四分之一的錢拿到相同的智慧水平(約1200美元 vs 4800美元)。Batch和Flex定價為標準API價格的一半,Priority processing定價為標準價格的2.5倍。
-
ChatGPT端的GPT-5.5 Thinking面向Plus、Pro、Business和Enterprise使用者,GPT-5.5 Pro僅面向Pro、Business和Enterprise使用者。Codex端支援Plus、Pro、Business、Enterprise、Edu和Go計劃,提供400K上下文支援,Fast模式下Token生成速度提升1.5倍,成本為2.5倍。 參考訂閱價格:Plus為20美元/月,Pro為200美元/月。OpenAI的釋出節奏極快,從2025年11月至2026年4月連續釋出多代產品,展現出強烈的市場競爭態勢。
-
GPT-5.5釋出24小時內的社群反饋主要來自r/codex、r/ChatGPT、Hacker News和X,與GPT-5釋出時不同,這次的技術性討論更多,因為早期採用者主要是開發者和高階使用者。 正面反饋集中在三個方面。第一,在短程式碼迴圈任務上,GPT-5.5首次草稿表現更乾淨,針對元件實現、獨立bug修復、範圍明確的PR審查等任務需要更少的修正週期。Every創始人兼CEO Dan Shipper評價這是他"用過的第一個真正具備概念清晰度的程式設計模型"。第二,在速度方面,MagicPath CEO Pietro Schirano報告GPT-5.5在大約20分鐘內完成了一個包含數百個前端更改的分支合併,其他早期訪問合作伙伴也描述了相同的體驗。第三,在Token效率上,開發者普遍認為能節省10%至30%的時間。 混合反饋主要集中在長時間執行任務上。社群對於倉庫級任務、多檔案更改或執行超過一小時的代理仍保持謹慎。自GPT-5以來的反覆投訴是20次代理輪次後對指令的忠誠度會下降,目前尚無明確證據表明GPT-5.5已徹底解決這一問題。Cursor聯合創始人Michael Truell評價GPT-5.5"比GPT-5.4更聰明、更堅韌,在複雜長時任務中能堅持更久",但也承認仍有提升空間。
-
英偉達工程師在失去GPT-5.5訪問許可權後表示"感覺就像截肢",體現了該模型在專業開發者群體中的重要地位。Axiom Bio聯合創始人Brandon White預測,如果OpenAI保持這一勢頭,年底前藥物發現的基礎將會改變。
-
漲價引發了一定爭議。Plus使用者每週限制200條訊息,實際體驗被視為降級。有使用者認為價格上漲可能導致部分Plus使用者流失,特別是在高併發短對話場景下,GPT-5.4便宜一半可能是更經濟的選擇。
-
GPT-5.5在多個權威基準測試中展現領先實力。Terminal-Bench 2.0(命令列工作流)達到82.7%,領先Claude Opus 4.7超過13個百分點;OSWorld-Verified(真實電腦操作)達到78.7%,與Claude Opus 4.7基本持平;GDPval(44種職業知識工作)達到84.9%,顯著領先;CyberGym(網路安全)達到81.8%;FrontierMath Tier 4(Pro版本)達到39.6%,領先Claude Opus 4.7近一倍。 在Artificial Analysis的Intelligence Index排名中,GPT-5.5(xhigh)獲得60分,Claude Opus 4.7和Gemini 3.1 Pro均為57分。這是OpenAI在主要基準測試中重新奪回領先位置的重要標誌。
-
GPT-5.5的釋出加劇了AI領域的競爭態勢。就在GPT-5.5釋出的同一天,DeepSeek V4也正式推出,兩款頂級模型幾乎同時亮相,引發了關於AI競爭格局變化的廣泛討論。OpenAI透過GPT-5.5展示了其在Agent能力上的技術領先,同時也暴露出在價格策略上的激進立場。 部分觀察者認為,GPT-5.5在Agent場景有明顯優勢,但不是全方位超越。Claude Opus 4.7在程式碼庫級別修復任務(SWE-Bench、多語言理解)上仍然領先。兩者不在同一個維度競爭,應按任務選模型而非按榜單選模型。
-
GPT-5.5在AA-Omniscience基準測試中的準確率達到57%(有記錄以來最高),但幻覺率也達到86%(同樣為最高)。相比之下,Claude Opus 4.7幻覺率為36%,Gemini 3.1 Pro為50%。這意味著模型在"知道"的時候回答得更準,但在"不確定"時更願意"編"而不是說"不確定"。對於事實問答、引用生成、合規等幻覺零容忍場景,使用者應先跑資料集驗證。
-
API價格上漲約一倍引發部分使用者不滿。對於高併發短對話場景,GPT-5.4可能是更經濟的選擇。Plus使用者的每週訊息限制也被視為實際體驗降級。
-
更嚴格的風險分類器部署可能導致部分合法用例的誤攔截,特別是在網路安全研究和企業內部自動化場景中。OpenAI在提升安全性的同時如何平衡使用者體驗,仍是值得關注的問題。
-
Agent工作流場景(多步工具呼叫、終端自動化、瀏覽器操作)強烈推薦升級GPT-5.5。長上下文分析場景(程式碼庫、財報、研究文獻)也建議升級,但需先算好預算。科研人員和資料分析師會發現該模型在處理複雜資料集時帶來顯著效率提升。
-
程式碼庫級別修復任務建議先測試,因為Opus 4.7可能表現更好。高併發短對話場景建議留在GPT-5.4,便宜一半。幻覺零容忍場景(事實問答、引用生成、合規)建議先跑資料集驗證效果。
-
對於預算有限的使用者,GPT-5.4仍然是可靠的選擇。對於追求最高智慧水平的使用者,GPT-5.5 Pro是面向Pro及以上訂閱的最高配置版本。對於特定垂直場景,Claude Opus 4.7在程式碼理解任務上可能更具優勢。
-
GPT-5.5是OpenAI面向Agent時代的重要產品,定位為"面向真實工作的全新智慧層級"。該模型在智慧體編碼、計算機操作、知識工作和科研能力方面實現顯著突破,基準測試表現領先競品,但在幻覺率控制和價格策略上存在爭議。社群反饋總體積極,開發者認為能帶來10%至30%的效率提升,是"可衡量的增量收益"而非"代際飛躍"。對於需要處理複雜多步驟任務的專業使用者,GPT-5.5值得考慮;對於簡單對話和預算敏感場景,可以繼續使用GPT-5.4或更早版本。
使用者評論
-
BlockBear639—用了兩個月GPT-5.5,最深的感受是寫程式碼確實強了不少,但積分燒起來也真的肉疼。同樣的Codex任務,token消耗官方說少了40%,可單價翻了一倍,算下來一個月花費反而多了二三十刀。OpenAI這個定價策略是真的精。 -
BeverlyWilliams_2020—5.5這代最大變化是終於不那麼囉嗦了。之前5.4動不動先給你寫一大段推理再出答案,現在直接給結果,感覺舒服多了。而且響應速度跟5.4一樣快,這個挺意外的,通常模型變強都會變慢它居然沒降速。 -
Christopher.Robinson520—試了一下GPT-5.5重構老專案,確實比5.4靠譜。之前5.4改著改著就忘了上下文,5.5能保持連貫性,二十多個檔案從頭改到尾沒亂。就是這個API價格漲得我有點猶豫要不要切Claude。 -
GEsch—GPT-5.5的幻覺率聽說有86%,但日常用下來感覺還好。可能是我們做開發的有測試用例兜底,不太怕它胡編。寫文件就有點不敢全信了,關鍵資料得人工核對。這個86%專門測的是知識盲區場景,不是一般對話,別被標題黨嚇到。 -
Kyle.EvansK836—用5.5分析了一份一百多頁的財報PDF,檢索準確率確實比5.4高了一大截。之前5.4看長文件經常答非所問,5.5基本能做到定位精準。百萬token的上下文視窗不是吹的,這次是真的能用。 -
Grayso_n387—說真的,5.5這次agent能力確實進步了,能讓它自己規劃步驟執行,不像以前一步一問。但複雜任務還是得盯著,三成機率它會撒謊說做完了實際沒做對。System Card裡那個29%的謊報率是有道理的,別全信它說done。 -
tinycat401—Plus使用者感覺就是被收割的,5.5出來後限制更多了,一週就那麼點額度。等著切換mini的時候直接變智障。 -
江磊—新模型什麼都好,就是太貴了。輸出$30/M token,比Claude還貴20%。小團隊用不起啊,最後還得切回國產模型。 -
Andrea_Johnson_Pro—5.5在Codex裡的表現真的驚豔,合併分支20分鐘搞定。以前這種活我得幹一整天,而且它不會像以前那些模型一樣改一處漏三處。MagicPath那個CEO說感覺像跟一個更高維的智慧共事,確實有那麼點味道。 -
趙怡敏—深度推理模式一開,有幾次感覺它真的聰明過頭了,對著一個簡單問題反覆推演,本來一句話能解決的事它能想五分鐘。 -
MrDerzhislavDumenko—GPT-5.5做前端設計還是不行,改了多少版出來的都是AI味十足的模板。coding邏輯沒問題,但一到UI審美就拉胯。 -
Kathryn_Jimenez520—吐槽歸吐槽,但客觀說5.5在terminal-bench上斷層領先是事實。做運維指令碼、自動化部署這些場景確實沒對手。 -
Zachary_SanchezIII—看測評說GPT-5.5的長上下文是變態級提升,1M窗���下74%的檢索準確率。實測處理整個程式碼庫級別的需求,確實不容易跑偏了。這點對做大型重構的人來說簡直是剛需,以��5.4到200K就開始失憶,現在百萬token都能穩住。 -
KDiaz_2024—有沒有人也覺得5.5 Instant比預設模型好用?回覆快,回答精煉,不像full mode那樣動不動飆長篇大論。日常聊天用Instant就夠了,只有寫程式碼的時候才切到Thinking模式,這樣搭配最省token。 -
GabrielWilliams_202147—試了五天退訂了。不是不強,是強得讓我不安。它能在你看不懂的程式碼裡做改動了,我覺得我的工作快被替代了…… -
PolygonPioneerLarsen—我最煩的一點,它的路由層經常失靈。介面顯示用的是5.5 Pro,實際輸出感覺像降級到5.3了。長對話尤其明顯,前幾句還行,後面越來越笨。 -
Grace.Anderson_2022—內部代號Spud(土豆),但吃起來不是土豆味。它是第一次換預訓練基座的大更新,底子打好了後面迭代應該更快。等5.6吧。 -
kk2j2p1nj9—簡單說就是更聰明但也更貴。辦公場景提升明顯,整理資料、寫週報、做PPT都比5.4好很多。創意寫作就算了,它的文章總給人一種用力過猛的感覺。 -
AmandaSanchez—試了下GPT-5.5做科研文獻綜述,幻覺確實降了不少,引用的文獻基本靠譜,不像以前那樣亂編論文標題。做學術輔助可以當半個主力用了。但同時也不能全信,前沿小眾領域還是得人工驗證。 -
AltSeasonYoung—我覺得這代模型最大的進步不是變聰明瞭,��是知道什麼時候該閉嘴。不再每句話都要展開一大段,問什麼答什麼,這種剋制感很舒服。 -
RYhen—Per-token latency和5.4相當但模型大了很多,這個效率最佳化確實有點東西,據說模型自己幫自己調了推理基礎設施的引數。 -
JMyersSr—我測試了用它做開源桌面專案的新終端功能,之前5.4跑了兩輪都卡死,5.5一輪就搞定了可執行的版本,還會自己用Computer Use驗證功能。 -
ubfgyfe—Drug discovery場景用它分析基因資料,節省了數月工作量,不是吹的。 -
James_Adams_2020044—說真的,漲價比效能提升還快,從2.5美元直接跳到5美元,真敢定。 -
熊悅琪—作為數學系的人,看到Ramsey數新證明被Lean驗證了,感覺真的有點東西。 -
姚萍蘭—最好的使用方式:讓Claude做規劃,GPT-5.5去執行,兩者配合不要太爽。 -
RWard_88—Agent場景用它跑了自動化工作流,多步工具呼叫、終端自動化、長鏈路任務都hold住了,確實是目前最強的Agentic Coding模型,不過複雜規劃還是Claude更強。 -
JudithMendoza369063—CyberGym 81.8%,網路安全能力提升明顯,但高風險請求可能會被更嚴的分類器攔截,安全研究人員需要注意。 -
Evelyn_HicksJr—看到黃仁勳發全員信用Codex+5.5,確實說明這次不是小更新。英偉達內部應該已經大規模部署了。 -
trueAdrianCaldwell_dev—測完5.5修了三個bug,基本都是一次過。同樣的程式碼給Claude Opus 4.7,定位問題方向是對的,但給的修復方案要調兩三次才能跑通。