OpenAI三线齐崩17天连续异常,Agent时代的宕机账单谁来买单

111分钟断了什么

2026-07-27 02:38

7月25日傍晚,OpenAI的API、ChatGPT、Codex三条核心产品线同时报错,31个服务组件性能下降,111分钟后才陆续恢复。单次故障本身不算罕见,但把它放到更大的时间窗口里看,整件事就没那么简单了——从7月9日算起,OpenAI已经连续17天没有过一天「完全正常」的日子。

7月25日17时17分,OpenAI官方状态页挂出「Investigating」告警,多项服务错误率飙升。18时02分进入「Monitoring」阶段,缓解措施开始生效。到19时08分,官方宣布全部恢复。这111分钟里,API有12个组件出问题,ChatGPT涉及15个组件,Codex也有4个组件中招。第三方监测站Bifrost的记录显示,从7月9日至今,OpenAI没有一天处于「完全正常」的状态——其中7月12日和16日发生两次Major Outage,其余日子则在Degraded Performance和Partial Outage之间来回切换。

另一个监测站incidenthub的数据同样密集:仅7月23日一天,OpenAI就挂出四起独立事故,涉及ChatGPT错误率和延迟;24日Codex Review报错;25日轮到三线齐崩。官方对这些事故的原因保持沉默,合理推测是两条线叠加的结果——夏季推理负载持续爬坡,叠加新模型与新功能的密集发布节奏,基础设施长期处于压线运行状态。

但真正值得关注的,不是这次故障本身持续了多久,而是2026年的宕机和2024年的宕机,性质已经完全不一样了

两年前ChatGPT崩了,用户损失的是一次聊天体验。可在2026年的今天,API背后是客服机器人、代码流水线、自动化审计、Agent工作流。服务中断111分钟,断的是生产线。监测页面下方那句广告语本身就是最直接的市场信号——「OpenAI挂了?自动把请求路由到健康的替代模型」。多模型容灾,已经成了一门明码标价的生意。

对企业选型来说,过去衡量AI供应商主要看模型能力表现。可这17天的连续异常记录,把另一个指标推到了台前:SLA。模型能力榜周更易主,可靠性却按天计分。能力差距按百分比算,宕机损失按100%算。这个账,企业算得比谁都清楚。

两条合理推演:第一,多云多模型路由将从加分项变成企业AI架构的标配,单家依赖的风险敞口会被重新定价。客户不会把鸡蛋放在一个篮子里,这是最朴素的风险管理逻辑。第二,每次海外旗舰故障,都是国产模型承接溢出需求的窗口——前提是自家的稳定性先扛住同样的负载曲线。OpenAI这17天的表现,等于给所有竞争对手送了一份「挖墙脚指南」。

回到最根本的问题:当AI Agent开始接管企业的生产流程,供应商的可靠性就不再是「可选优化项」,而是基础设施级的刚需。OpenAI的工程团队大概率会在接下来几天给出技术复盘,但17天连续异常这个事实已经摆在那里。市场要听的解释,恐怕比「错误率升高」这五个字复杂得多。