C
发布于 2026/09/03 · 阅读 2

GitHub Actions 近期故障回顾

  • #GitHub Actions
  • #故障分析
  • #CI/CD
  • #Hacker News
  • #githubstatus.com
GitHub Actions 近期故障回顾

近期故障回顾

以下为 GitHub 近期影响 Actions 及其他服务的主要故障时间线及根因分析。

2026年5月26日

  • 部分服务中断(已解决):影响 Copilot 等服务的性能降级。已缓解,正在监控。
  • Actions 与 Pages 故障(已解决):认证问题导致大部分 Actions 运行失败。已识别原因为认证问题,正在积极缓解。

2026年5月23日

  • 应用安装令牌认证间歇性错误(已解决):约 1% 的应用安装令牌出现认证失败。已缓解并持续监控。

2026年5月20日

  • Actions 故障(已解决):16:00-17:45 UTC 期间,GitHub Actions 客户遇到运行启动延迟超过 5 分钟的问题。约 4.5% 的所有运行受到影响,其中规模集作业受影响尤为严重:30% 的规模集作业延迟,4% 完全无法启动。
    • 根因:负责将作业分配给运行器的内部服务的健康检查配置错误。上游依赖的短暂延迟尖峰触发了多个 Pod 的健康检查失败,导致这些 Pod 被移出服务,负载集中到剩余容量上。增加的负载导致内存压力,并在一个区域集群中升级为级联故障,使其无法自我恢复。
    • 缓解措施:通过扩容健康区域的集群容量并将流量从受损区域排出,运行延迟得以恢复。
    • 预防措施:加强健康检查配置以避免级联故障场景,并评估在区域降级时自动重新平衡流量的缓解方案。

2026年5月15日

  • Actions 性能降级(已解决):07:43-08:48 UTC 期间,部分客户的工作流运行失败或启动延迟。峰值时 42% 的 Actions 运行失败。受影响的下游服务包括 GitHub Pages 和 Copilot 云服务。
    • 根因:由支撑基础设施的计划内故障转移触发。故障转移过程中,自动服务发现更新未正确传播,导致流量路由错误,并在工作流编排的核心依赖中增加了请求超时。
    • 缓解措施:08:12 UTC,响应者手动纠正了服务发现路由问题,超时和失败率迅速恢复。
    • 预防措施:在完成故障转移操作前实施故障转移防护栏以验证服务发现状态;加强飞行前和飞行后验证检查;改进依赖的韧性以减少基础设施事件期间的超时级联。
  • GitHub.com 故障(追溯解决):02:49-03:04 UTC 期间,部分客户无法访问 GitHub.com。原因为流量突发尖峰。已识别并阻止了进一步的干扰。

2026年5月13日

  • CodeQL 故障(已解决):14:31-16:03 UTC 期间,代码扫描服务处理延迟,12% 的检查运行耗时超过 15 分钟。
    • 根因:内部数据库迁移导致复制延迟,造成工作池容量不足。
    • 缓解措施:将处理工作者扩容 34%。

2026年5月12日

  • CodeQL、Webhooks、通知和 Slack 集成故障(已解决):13:41-17:43 UTC 期间,多个服务处理延迟。代码扫描服务 53% 的检查运行耗时超过 15 分钟;通知平均延迟 22 分钟;Slack 集成 Webhooks 平均延迟 20 分钟。
    • 根因:与 5 月 13 日相同,内部数据库迁移导致复制延迟。
    • 缓解措施:扩容处理工作者。

总结:近期的多次故障表明,内部数据库迁移、服务发现配置错误以及健康检查的级联效应是常见根因。GitHub 团队正在通过加强配置验证、自动化容灾和增加工作池容量等措施提升系统韧性。

2 阅读0 评论0 点赞

评论

登录 / 注册即可发布评论!
暂无评论,成为第一个发表评论的用户吧。