No.0372
Science Partner
Bring you to the side of
导 读
9月3日的北美上午,人工智能突然变得有些安静。
美东部时间上午9时26分,Anthropic开始调查Claude多个模型请求错误率上升;十几分钟后,马斯克旗下SpaceXAI的Grok多个客户端和美国部分API出现故障;到上午10时43分,OpenAI也开始调查ChatGPT和Codex的大面积错误。
不到一个半小时,Claude、Grok和ChatGPT先后出问题。
伙伴们都知道,这三家+Gemini可是美国人工智能产业最顶流的扛把子。无论是比较谁更聪明,开发者争论谁的代码能力更强,个人也好企业也罢,几乎都逃不出向这四家公司买单付费。
但就在刚刚,原谅伙伴君用“刚刚体”,因为确实就在刚刚,它们在用户面前集体宕机了:要么是一个打不开的页面,要么是一次失败的请求,反正就是无法继续的工作了。
The Verge很快把这件事概括为:ChatGPT、Grok和Claude“同时宕机”。截至目前,没有证据显示三起事故由同一个原因造成。Anthropic后来表示已经找到自身故障原因,但没有公开具体基础设施细节;OpenAI和SpaceXAI同样没有证明彼此存在关联。
这一点非常重要。
把三场事故直接解释为“美国AI共同基础设施崩了”虽然刺激,但却成了假新闻,毕竟美国各大媒体、社交网站、Github等等还没爆料确凿的事实依据。
但是,即使三场事故彼此毫无关系,它们同时发生仍然让我们第一次如此直观地看到,今天看上去高度竞争的人工智能产业,底层可能已经没有想象中那么分散。
这是什么意思?
走,跟伙伴君来!
今日主笔|旻宏
突发:ChatGPT、Claude、Grok同时宕机
01. AI正在从“网站”变成基础设施
几年前,ChatGPT宕机最多是一条互联网新闻。
今天,它越来越接近一场生产事故。
人们已经不只是用AI问“北京明天天气怎么样”,而是在让它写代码、查资料、修改合同、分析财报、生成设计图、调用企业数据库,甚至让智能体连续工作数小时。
AI正在进入过去由搜索引擎、Office、云计算和数据库占据的位置。区别在于,以前一个网站坏掉,用户往往可以换一个网站。 今天越来越多企业已经把整条工作流搭建在某个模型API之上。模型不工作,停下来的可就不再只是聊天窗口那么简单。它可能是一段代码没有完成、一次客户服务没有响应、一场投资分析中断,或者一个正在调用几十个工具的Agent突然失去“大脑”。
刚刚这场故障可能不会成为人工智能史上的大事件,却很像一次无意中发生的压力测试,大部分媒体都在写“这让我们反思,究竟已经多大程度上,把工作交给了AI?”而科学伙伴想问的真问题是: 这些AI又把自己交给了谁?
02. AI大战,已经打到了地基
答案比想象中复杂。
今年5月,马斯克旗下SpaceXAI宣布,把Colossus 1超级计算集群的算力提供给Anthropic。
颇具戏剧性的合作有没有。
Colossus最正宗的身份是训练Grok的超级计算机。SpaceXAI披露,Colossus 1拥有超过22万块英伟达GPU,包括H100、H200和GB200。Anthropic则准备利用这部分计算能力提高Claude Pro和Claude Max的服务能力。换句话说,在产品层面,Claude和Grok互相争夺用户;到了机房里,Grok背后的公司却开始向Claude出售算力。
你以为完了?事情还不止于此呐。
Anthropic今年披露,公司已经与亚马逊达成最高5吉瓦新增算力协议,与Google和Broadcom达成另外5吉瓦下一代TPU容量协议,同时获得Colossus 1和Colossus 2的GPU容量。Claude也是目前同时进入AWS、Google Cloud和Microsoft Azure三大云平台的前沿模型。AWS仍然是Anthropic最主要的云服务和训练合作伙伴。
路透社9月2日进一步披露,Anthropic为了争夺算力,已经签下包括微软、英伟达、Nscale以及SpaceX在内的一系列大型基础设施协议。仅SpaceX相关协议据报道就达到每月12.5亿美元的规模。
OpenAI走的则是另一条同样惊人的道路。
2025年,它与Oracle、SoftBank等启动Stargate。OpenAI最初承诺四年投资5000亿美元,建设10吉瓦人工智能基础设施。仅与Oracle新增的合作,就包括4.5吉瓦数据中心容量,加上得克萨斯州阿比林项目,当时已有超过5吉瓦容量处于开发之中,对应超过200万块芯片。此后Stargate继续扩张。
这就是2026年的美国人工智能。
我们习惯于把它理解成一场模型竞赛:OpenAI对Anthropic,Claude对Grok,GPT对Gemini,或者干脆说大混战吧。但产业真正发生的变化是, 它越来越像一场重工业竞赛。决定AI能力的不再只是论文、算法和天才工程师。还有GPU、变电站、电网、土地、冷却系统、光纤、融资能力,以及谁能够一次签下几吉瓦的电。
03. 微观冗余,宏观集中
从任何一家AI公司的角度看,这些动作都非常合理。
OpenAI不能永远只依赖微软,于是寻找Oracle、SoftBank和CoreWeave;Anthropic不能只依赖AWS,于是同时拿Google TPU、Azure以及SpaceXAI的GPU。
这是经典的风险分散。
如果一座数据中心出问题,就把计算任务转到另一座;如果一家云服务商容量不足,就换另一家。但问题在于,当所有公司都这样做时,一个奇怪的结果可能出现:
每家公司都变得更加分散,整个产业却未必因此更加分散。因为大家最后选择的,仍然是同一小批供应商。芯片大量来自英伟达,云主要集中于AWS、微软和Google,前沿模型运行所需要的大型数据中心也越来越依赖少数具备资本、土地、电力和工程能力的企业。
路透社日前指出,英伟达目前仍占据80%以上的AI芯片市场。金融市场甚至开始尝试推出GPU租赁价格期货: GPU正在从一种科技产品,变成一种越来越接近标准化大宗生产资料的东西。当然金融业对这种结构并不陌生。一家银行把风险分散到十种资产上,看起来比只持有一种资产安全。但如果全球所有银行最后都持有同样十种资产,那么对单家银行而言是“分散”,对整个系统而言却可能形成新的共同风险。
国际货币基金组织今年讨论AI金融风险时,已经给这种现象用了一个很准确的词: 第三方集中风险(third-party concentration risk)。当大量机构依赖同一家云服务商、同一种软件或者同一批AI模型,一个关键供应商出现故障,影响就可能沿着整个系统扩散。IMF因此警告,很多企业在自身层面根本看不到这些依赖,但它们最终可能形成系统性脆弱点。
04. “主权AI”的真正归属问题是什么
这件事对全球科技安全的意义,比一次宕机更大。
过去两年,从欧洲、中东到东南亚,“主权AI”已经成为一个热门概念。很多国家开始建设自己的数据中心,希望训练本国模型、保存本国数据,减少对美国科技公司的依赖。但这里存在一个容易被忽略的问题, 一座数据中心建在本国,并不意味着它真正属于一个独立的技术体系:GPU可能来自美国公司、云管理软件可能来自美国、模型可能来自美国,高速网络、开发工具和软件生态仍然可能围绕CUDA以及美国云服务体系运行。
英国《金融时报》近期在分析全球“主权数据中心”浪潮时就指出,一个颇为反常的结果正在出现:一些国家表面上正在建设自己的AI基础设施,实际上却可能进一步巩固美国在全球AI产业链中的核心位置。
所以真正的“主权AI”,最终恐怕不能只问:“服务器放在哪里?”还必须问:芯片从哪里来?、模型能不能迁移?数据能不能带走?一个云平台宕机后能不能切换?供应商被制裁以后还能不能运行?电网发生问题以后有没有备用能力?诸如此类等等。
这其实已经不是一个单纯的人工智能问题。它越来越接近能源安全、金融安全和供应链安全。
05. 下一场AI危机,未必来自模型失控
过去几年,关于人工智能风险的讨论始终有一种强烈的未来感。
模型会不会获得自主意识?
超级智能会不会失控?
Agent会不会欺骗人类?
这些问题当然重要,但9月3日这三场故障提示了我们还有一种更加普通、也更加现实的风险: AI根本不用“觉醒”,它只需要停摆。一座核心数据中心出现故障、一条骨干网络断开、一个云平台配置错误、一个软件依赖发生事故......现代社会最危险的系统性风险,很多时候并不来自电影式灾难。它来自那些平时几乎没人注意、却被所有人共同依赖的东西。支付清算如此、全球航运如此、GPS如此、云计算如此,如今人工智能正在加入这个名单。
当然,也许最终调查会证明,Claude、Grok和ChatGPT发生的只是三件完全无关的技术事故。但如果真是这样,那其实反而更值得思考:当几个最重要的AI服务在相近时间分别出问题时,越来越多人的工作竟然会同时失去替代方案。这说明我们真正需要关心的,已经不只是某一家模型稳不稳定,而是整个AI体系到底有没有足够多彼此独立的路径。
几年前,人们讨论AI竞争,最关心的是:谁拥有最聪明的模型?但几年以后,更重要的问题可能会变成:当越来越多的知识、工作和决策都开始依赖AI时,我们手里究竟还有没有第二条路?还是说条条大路的起点其实不过都是一个罗马而已。
我是旻宏,咱们下期见~




京公网安备 11011402013531号