当前位置: 首页 » 资讯 » 新科技 » 正文

GitHub通报本月大规模宕机原因

IP属地 中国·北京 编辑:周伟 IT之家 时间:2026-08-22 02:05:53

IT之家 8 月 21 日消息,GitHub 现已公布 8 月 17 日平台大规模宕机事件的调查结果,确认此次事故并非由程序代码或配置变更引起,而是“基础设施容量未能跟上平台使用量的快速增长”。本次大规模宕机合计造成 GitHub 网站、身份验证、GitHub Actions、API、Pull Request、Issues 等多项服务中断 7 小时 47 分钟。

GitHub 表示,当日平台流量创下历史新高后,导致美国中部数据中心的一项关键基础设施组件容量不足,进而令压力扩散至其他系统,导致身份验证失败以及多项服务异常。在恢复过程中,部分服务又因为错误触发客户端重试机制,进一步增加系统流量,因此最终技术人员花费了较长时间才完全恢复平台服务。

IT之家注意到,这已经是 GitHub 本月发生的第二起重大服务事故。此前,GitHub Actions 已经在 8 月 6 日发生服务故障。GitHub 表示,两起事故的核心问题都是基础设施容量不足,而不是程序代码或配置变更导致的故障。

GitHub 近期平台使用量增长迅速。今年 4 月至今,每月提交(commit)次数已经从 14 亿次增加至 29 亿次,合并 Pull Request 以及新建代码仓库的数量也持续增长。

为了应对平台使用量持续增长,GitHub 今年已经增加超过 300 万个 CPU 核心、120PB 高速存储空间以及网络容量,并加快将工作负载迁移至微软 Azure。目前约 58% 的 GitHub 平台负载已经由 Azure 承载,远高于今年 5 月的 12%;此外,约一半的 Git 操作也已经由 Azure 负责处理。然而尽管微软进行了如此优化措施,还是遇到了“用户量挤垮平台服务”的情况。

GitHub 声称,接下来技术人员将进一步隔离平台关键系统,减少不同服务之间的共同依赖,同时统一设置服务间的重试次数上限和超时机制,避免系统出现异常时,大量客户端或服务自动重复请求进一步增加负载,最终形成连锁故障。

标签: github azure 平台 容量 微软 使用量 基础设施 故障

免责声明:本网信息来自于互联网,目的在于传递更多信息,并不代表本网赞同其观点。其内容真实性、完整性不作任何保证或承诺。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。