美东时间9月3日早晨,开发者们刚到工位,就撞上了罕见的集体故障。Claude的对话框停在原地转圈,ChatGPT的请求反复报错,Grok的页面只剩一片空白。三款彼此竞争的产品,在同一个早晨同时失灵。

故障监测平台Downdetector上,OpenAI收到的用户报告超过1.2万份,Claude约1200份,Grok约1000份,三家合计超过1.4万份。从Claude率先报告异常算起,三家在92分钟内相继宣布服务中断,网页端、App与API全部无法访问。谷歌Gemini与微软Copilot的中断报告数量同步上升,其中Gemini大体维持可用,成了少数还能正常工作的主流大模型。

这一天原本是GPT-6的日子。宕机平息几小时后,OpenAI正式发布旗舰模型GPT-6 Astra,宣称“人类来到AGI时代”。舆论把这两件事放在一起,给9月3日打上了“LLM史上最黑暗一天”的标签。

92分钟内,三家相继失联

- 美东时间9月3日早晨9点半,Claude率先报告异常
- 随后Grok、ChatGPT相继出现大规模中断
- 网页端、App与API全部无法访问,请求大面积失败
- 各家状态页确认问题并启动修复,未发布正式故障通报
- 北京时间9月4日凌晨1点10分前后,服务陆续恢复,中断持续近4小时

受影响的不止聊天窗口,OpenAI的编程工具Codex一同失联,AI编程工具Cursor也承认,部分服务因依赖的Claude、ChatGPT和Grok故障而受损。对把自动化任务交给API的开发者而言,宕机窗口内的每一分钟,都直接折算成停摆的流水线。

故障源头至今没有统一说法。坊间推测指向底层云基础设施,有分析点名AWS,也有观点认为三家共享Azure的计算资源,“多因素叠加”的说法同时存在。OpenAI与Anthropic未公布具体原因,仅在状态页标注故障已解决。

唯一给出明确解释的是xAI。SpaceXAI发布简短声明,就孟菲斯数据中心的故障向Grok用户及受影响的“计算合作伙伴”致歉:“对于今晨孟菲斯计算中心发生宕机、可能导致您在Grok上遇到的问题,我们深表歉意。”

“计算合作伙伴”这个说法,承认了一个公开的秘密。头部AI公司共用同一批底层算力,模型层面的竞争再激烈,地基是共享的。

单点依赖的代价

宕机正酣时,ChatGPT官方账号发来一句预告:“The stars are almost aligned(星星几乎排列好了)。”Astra在拉丁语中意为星辰、群星,OpenAI把它定义为“新一代智能”,称其是“当今世界智能水平最高、对齐表现最好的模型”。初期仅向部分机构开放,包括参与Daybreak Access网络安全项目的组织。

“星星几乎排列好了”与三大服务集体熄火,在同一天先后抵达。AGI宣言的第一天,以一场集体宕机开场。

宕机进行时,Hugging Face联合创始人Thomas Wolf转发了汇总三家宕机消息的推文,附上一句提问,这种情况下你会用哪个AI。

几小时后,他更正了自己的说法,称宕机的是所有闭源AI服务。

一次补正,把讨论从“选哪个”拉到“还剩什么”。结合他此前“发起第一次自主AI攻击的是闭源模型,完成防御的却是开源模型”的判断,这次宕机被不少人读作又一个论据。闭源阵营的集中性风险,正在以各种形式暴露。问题不在于哪家模型更强,而在于它们站在同一片地基上,一个上游节点的故障,就能让头部产品同时倒下。

这次事件真正值得审视的,不是某一家公司的修复速度,而是AI行业对底层基础设施的集体依赖。头部模型厂商把大量算力集中托管在少数云厂商的数据中心,可靠性因此悬于一条供应链之上。OpenAI过去一年已多次出现服务中断,7月更一度连续多日未能保持稳定服务,基础设施承压并非偶发事件。

宕机的直接损失可以量化,信任的折损难以估量。企业客户正把越来越多的工作流迁到AI产品上,一次集体失联就足以打断整条生产链。“你会用哪个AI”背后真正的问题是,用户敢把多少关键业务交给它,而它会不会在某天早晨与对手一起倒下。

当天下午,三家公司的状态页先后转绿,GPT-6 Astra按计划向首批机构开放,“星星即将排列好”的预告照常生效。但这次宕机真正留下的,不是几小时的中断记录,而是一个需要重新估值的风险项。头部AI服务共享同一片底层算力,模型能力的比拼之外,可靠性的竞争才刚刚开始。(本文首发钛媒体APP,作者 | 硅谷Tech-news,编辑 | 秦聪慧)