
8 月 6 日GitHub Actions 和 Pages 大规模服务降级Actions 超 5 小时不可用约 12 小时才完全恢复。这是 8 月第六起事故多与 AI 服务相关。事故详情此次事故中Actions 完全不可用超 5 小时webhook 停发自托管 runner 因调度层故障无法工作Pages 等多项服务受影响从检测到恢复约 12 小时。数据增长惊人GitHub 员工贴出数据2025 年全年 10 亿次 commit现在每周 2.75 亿次全年预计 140 亿次。GitHub Actions 使用时长也大幅增长90 天可用性跌到 93.91%。社区讨论焦点社区讨论集中在两方面一是向 Azure 迁移基础设施是否影响稳定性二是 AI Agent 的 commit 量暴增正在压垮平台整个 AI 代码提交链条在自我加速。事故原因剖析直接原因是 runner 被分配失效 job 陷入重试循环真正压力来自底层调度系统、存储层、网络带宽被 AI 负载推向极限。应对与难题有人提出迁移方案但 GitLab 等也有问题。GitHub 表示未来版本会加入自动恢复机制但平台承载能力与 AI 负载增长速度的根本问题仍无答案。编辑观点AI 发展给 GitHub 带来巨大流量此次事故暴露其承载能力短板。若不解决根本问题未来或面临更多危机迁移也并非完美之策。