今週も、ありえないことが起こりました。デジタル経済の根幹であり世界最大のクラウドプロバイダーであるアマゾン ウェブ サービスが大規模な障害に見舞われた。 IT 業界で働いているか、クラウド サービスに依存している場合、何か問題があることを知るためにニュース アラートは必要ありません。生産性は停止し、Web サイトは読み込めなくなり、ビジネス システムは停止し、世界的な商取引の騒音はたとえ数時間であっても沈黙しました。その影響は即座に深刻なものとなり、電子商取引大手から新興企業に至るまで、私自身のコンサルティング事業を含むあらゆるものに影響を及ぼしました。
AWS のステータス ページをざっと確認したところ、米国とヨーロッパの各地域でサービスの低下が報告されていることが確認されました。最新情報を切望するクライアントからの電話が殺到しました。処理できない請求書、デジタルの塵と化したスケジュールなどがありました。私の中小企業だけでも、生産性の損失は 3,000 ドルを超えると見積もっていましたが、これはフォーチュン 500 企業の一部がおそらく直面しているものに比べれば微々たるものではありません。世界中の企業にとっての実際のコストは数百万ドルに上る可能性があります。
どうして、そしてなぜこれが起こったのか
画面がフリーズし、アラートが殺到し始めたとき、私が最初に考えたのは、「これは事故なのか、それとも攻撃なのか?」ということでした。 AWS エンジニアリングは現在も根本原因を積極的に調査しています。初期の兆候は、日常的なインフラストラクチャ拡張プロセス中にネットワーク管理システムの構成ミスを示唆しています。エンタープライズ向け SaaS 導入の拡大から生成 AI トレーニング ワークロードに至るまで、あらゆるものによってクラウド リソースの需要が高まり続ける中、クラウド プロバイダーは物理インフラストラクチャを継続的に拡張および改善する必要があります。この特定のインシデントでは、日常的であるはずの変更により重要なルーティング ハードウェアに障害が発生し、複数の AWS アベイラビリティ ゾーンに波及効果が生じました。
#雲が暗くなった日