
2026/08/21 4:22
8 月 17 日の障害と今後の作業
RSS: https://news.ycombinator.com/rss
要約▶
Japanese Translation:
GitHub は、インフラストラクチャのスケーリング失敗により発生した直近の深刻なサービス障害を修正することを表明しました。これは急激なユーザー成長に伴いシステム信頼性を高める方向への決定的な転換です。以前はコードエラーが起因だった問題とは異なり、8 月 17 日のこの事象は、キーコンポーネントがトラフィックのピーク時にスケーリングできなかったことに起因し、月間コミット数が 14 億回から 29 億回へと倍増したという要因が悪化を招きました。これを解決するため、GitHub は CPU コアを 300 万超を追加する等インフラへの大幅な投資を行っており、特に GitHub Actions の高負荷に対処するために Azure へのワークロードのオフローディングを実施しています。CEO(CTO)Vladimir Fedorov が発表したこれらのアーキテクチャ変更には、大規模なコードベースに対して読み込み操作を無制限に許可する機能の導入や、カスケード故障を引き起こした従来の共有依存関係を排除するため重要システムを分離する措置も含まれます。今後、Copilot や API 等のサービスを利用する開発者を保護するために、一貫したリトライ上限と安全なデプロイ戦略の実施が強化されます。結果として、これらの対策は将来の障害発生確率を大幅に低減させ、一貫した可用性を確保することで、プラットフォームを活用して協調的なソフトウェア開発を行う数百万人のユーザーの生産性を safeguard(守り)ます。
本文
GitHub 大規模障害:8 月 17 日のインシデント報告と対応策
障害の概要と影響範囲
- 発生日時: 8 月 17 日、約 7 時間 47 分 の間にシステム利用不能となりました。
- 影響サービス:
- GitHub.com(認証機能を含む)
- GitHub Actions
- API
- プルリクエストおよび Issue
- Copilot など
- 被害状況: 世界中の開発者や組織に対し、開発・リリース業務に重大な支障を及ぼしました。
根本原因の特定
調査の結果、以下の要因が重なって障害が発生したことが判明しました。
- 容量不足によるシステム崩壊
- トラフィックが新たなピークに達した際、中央米国のデータセンター内の重要なインフラ構成要素が拡張できずに対応できませんでした。
- その結果生じた容量不足の圧力がシステム全体へ伝播し、認証失敗や複数のサービス運用妨害を引き起こしました。
- 復旧プロセスと課題
- 各チームでトラフィック迂回、影響インフラの分離、段階的なサービス復旧を実施し、早い段階で大部分のサービスを回復させました。
- しかし、Copilot 関連サービスは復旧に時間がかかり、エラーによるクライアント側の再試行ループがトラフィック増大を招く二重の悪循環を生み出しました。
- 注意点:
- このインシデントはコード変更や設定変更によるものではありません。
- 容量不足が主因であり、コミット数の増加(14 億→29 億)自体はシステム負荷増大の説明にはなりますが、直接的な原因とは断定できません。
今後の取り組みと改善計画
信頼性向上に向けた具体的なアクションと将来のロードマップです。
1. インフラ拡張と移行加速
- 容量追加実績: CPU コア 300 万コア以上、高速ストレージ 120 ペタバイト以上、重要ネットワーク容量を追加済み。
- Azure への移行拡大:
- GitHub プラットフォーム全体の負荷の約 58%(すべての Git オペレーションの半分)を Azure が担うようになっています。
- これは 5 月の 12% から大幅な増加です。
- モノレポ対応: 最大規模のモノレポのスケーリングを加速し、リーダー数に比例して読み取り容量を拡張可能なアーキテクチャ開発中です。
2. 運用プラクティスの強化
- チームとリソースを可用性向上に再配置し、以下の強化を進めています。
- より堅牢なテスト
- 安全なロールアウト手法
- 改善された観測性(Observability)
- 効果的なアラート機構
3. システムアーキテクチャの見直し
- 共有依存関係の解消: 重要なシステム間の結合を切り離し、障害時の影響範囲を限定する分離作業を進めています。
- 再試行制御の導入: サービス間インタラクションに対し、一貫した再試行制限・予算・可変タイムアウトを適用し、「再試行嵐」を防ぐ仕組みを導入しました。
- アラート設定の見直し: 優先度の低い CPU およびメモリ関連アラートをレビューし、トラフィック急増時に故障する構成要素を特定・対策しています。
CTO メッセージ
私たちの高可用性へのコミットメントは単なる技術的な約束ではありません。開発者コミュニティは GitHub に依存しており、それは信頼が前提です。8 月 17 日には残念ながらその期待に応えられませんでした。これを是正する責務が私たちにあります。プラットフォームのスケーラビリティと信頼性を通じて、再びあなたの信頼を得てまいります。
執筆者:Vladimir Fedorov(GitHub CTO)
- エンジニアリングリーダーシップおよびイノベーション分野で数十年の経験を持つ。
- **「開発者第一」**の考え方を基盤に、開発者ツールの未来を築く。
- 経歴:
- UserClouds(データガバナンス特化スタートアップ)創設
- Facebook(Meta)にて 12 年間シニアバイスプレジデントを務め、プライバシー・広告部門などを統括。
- Microsoft で勤務、Caltech で CS 学士・修士号取得。
- 趣味: ベイエリア在住で、家族と共に屋外や水面での時間を過ごすのが好き。
関連コンテンツ
- GitHub のその他のコンテンツをチェックしてください