OpenAI三線齊崩17天連續異常,Agent時代的宕機賬單誰來買單

111分鐘斷了什麼

2026-07-27 02:38

7月25日傍晚,OpenAI的API、ChatGPT、Codex三條核心產品線同時報錯,31個服務元件效能下降,111分鐘後才陸續恢復。單次故障本身不算罕見,但把它放到更大的時間視窗裡看,整件事就沒那麼簡單了——從7月9日算起,OpenAI已經連續17天沒有過一天「完全正常」的日子。

7月25日17時17分,OpenAI官方狀態頁掛出「Investigating」告警,多項服務錯誤率飆升。18時02分進入「Monitoring」階段,緩解措施開始生效。到19時08分,官方宣佈全部恢復。這111分鐘裡,API有12個元件出問題,ChatGPT涉及15個元件,Codex也有4個元件中招。第三方監測站Bifrost的記錄顯示,從7月9日至今,OpenAI沒有一天處於「完全正常」的狀態——其中7月12日和16日發生兩次Major Outage,其餘日子則在Degraded Performance和Partial Outage之間來回切換。

另一個監測站incidenthub的資料同樣密集:僅7月23日一天,OpenAI就掛出四起獨立事故,涉及ChatGPT錯誤率和延遲;24日Codex Review報錯;25日輪到三線齊崩。官方對這些事故的原因保持沉默,合理推測是兩條線疊加的結果——夏季推理負載持續爬坡,疊加新模型與新功能的密集釋出節奏,基礎設施長期處於壓線執行狀態。

但真正值得關注的,不是這次故障本身持續了多久,而是2026年的宕機和2024年的宕機,性質已經完全不一樣了

兩年前ChatGPT崩了,使用者損失的是一次聊天體驗。可在2026年的今天,API背後是客服機器人、程式碼流水線、自動化審計、Agent工作流。服務中斷111分鐘,斷的是生產線。監測頁面下方那句廣告語本身就是最直接的市場訊號——「OpenAI掛了?自動把請求路由到健康的替代模型」。多模型容災,已經成了一門明碼標價的生意。

對企業選型來說,過去衡量AI供應商主要看模型能力表現。可這17天的連續異常記錄,把另一個指標推到了臺前:SLA。模型能力榜周更易主,可靠性卻按天計分。能力差距按百分比算,宕機損失按100%算。這個賬,企業算得比誰都清楚。

兩條合理推演:第一,多雲多模型路由將從加分項變成企業AI架構的標配,單家依賴的風險敞口會被重新定價。客戶不會把雞蛋放在一個籃子裡,這是最樸素的風險管理邏輯。第二,每次海外旗艦故障,都是國產模型承接溢位需求的視窗——前提是自家的穩定性先扛住同樣的負載曲線。OpenAI這17天的表現,等於給所有競爭對手送了一份「挖牆腳指南」。

回到最根本的問題:當AI Agent開始接管企業的生產流程,供應商的可靠性就不再是「可選最佳化項」,而是基礎設施級的剛需。OpenAI的工程團隊大機率會在接下來幾天給出技術覆盤,但17天連續異常這個事實已經擺在那裡。市場要聽的解釋,恐怕比「錯誤率升高」這五個字複雜得多。