全球多项AI服务突发宕机

2026年7月25日,OpenAI旗下多项核心服务出现大规模故障,影响范围涵盖ChatGPT、Codex以及API v4.2和企业级Assistant Pro。此次事件被描述为一场横跨北美、欧洲和亚太三大时区的服务“雪崩”。根据OpenAI官方状态页显示,此次事故共涉及15项ChatGPT组件、12项API组件和4项Codex组件,合计31项服务组件出现性能下降。

网络监控平台DownDetector记录显示,全球OpenAI宕机报告大幅飙升。其告警量峰值冲破127万次/小时,创下该平台2026年度单日最高纪录,该数值比今年4月微软Azure大规模中断高出3.2倍。

故障影响与用户反馈

此次故障导致全球大量用户无法正常使用服务,具体表现为登录失败、认证错误、历史记录无法载入、会话无故中断或响应异常。受影响群体包括免费用户与付费Plus用户。

由于大量科技公司将ChatGPT集成至CRM、HRIS和自动化审计系统,且教育领域有2.8万所中小学覆盖“AI助教计划”,此次宕机对工作和学习造成了实际影响。用户反馈包括无法撰写邮件、代码调试受阻及论文写作中断等。

故障原因分析

OpenAI于美国太平洋时间7月25日凌晨2时17分发布公告确认故障并展开调查。据多位匿名OpenAI基础设施工程师透露,故障起因于7月24日晚间的一次“非预期级联扩容”。为了支撑即将上线的多模态推理引擎“Orion-7”,团队在旧有Kubernetes集群中部署了新型异构计算调度模块,导致新调度器与存量GPU拓扑识别逻辑发生“语义冲突”。

此外,行业观察与用户推测认为,可能原因还包括用户增长与算力扩容不匹配、软件更新问题(如7月23日曾发生过一次持续近24小时的故障)、外部攻击或模型架构复杂性导致的负载分配短板。

恢复情况与后续

OpenAI表示,相关服务已于美国太平洋时间7月25日凌晨4时08分全部恢复,此次故障总计持续约1小时51分钟。

针对AI服务稳定性挑战,业内目前正在探索弹性扩容、优先队列及分级付费等解决方案,以应对算力基础设施与用户爆发式增长之间的矛盾。