ほとんどのチームは依然として復元力を設計時のチェックリストとして扱っている: マルチゾーン、フェイルオーバー有効、リトライ実装済み、完了。その考え方は時代遅れである。本番インシデントはアーキテクチャ図の予測通りにはめったに失敗せず、Azure の新しい Chaos Studio Workspaces はその現実への直接的な応答である。
オリジナルソース: https://azure.microsoft.com/en-us/blog/proving-application-resilience-on-azure-with-chaos-studio/
最も重要なシフトは「より多くの障害注入」ではない。それはシナリオファーストの検証である。ランダムな障害を手動で構成する代わりに、Workspaces はチームが実際に目にする障害パターンから始める: ゾーン喪失、DNS 障害、データベースフェイルオーバー、ID 混乱、キャッシュスタンピード、メッセージング中断。これははるかに優れたモデルである。なぜなら、運用リスクは孤立した障害ではなく、組み合わせに存在するからだ。
私の見解は単純である: 定期的な訓練なしの復元力は復元力の劇場である。サービスが現実的でクロスレイヤーな障害シーケンスを経験したことがなければ、自分の復旧動作を知っているのではなく、仮定しているだけである。Workspaces は、スコープを自動検出し、実際のリソースに対してシナリオを推奨することでその障壁を下げ、「どこから始めればいいかわからない」という一般的な言い訳を除去する。
開発者とプラットフォームチームが今やるべきこと
- 最小限の復元力パイプラインを定義する。 重要なワークロードにつき少なくともひとつのシナリオを、リリース頻度で、復旧目標に紐づいた合否ゲートとともに設定する。
- シナリオレポートを変更管理のファーストクラスアーティファクトとして扱う。 セキュリティスキャンと同様に、リリース承認とインシデント後レビューに添付するべきである。
- インフラの成功だけでなく、アプリケーションレベルのアサーションを含める。 データベースは正しくフェイルオーバーできても、アプリが古い読み取りを提供したりデッドロックしたりする可能性がある。
Microsoft のもうひとつの強力な動きは、これを Copilot スキルと MCP ツールを通じて公開していることである。これは戦略的に賢い。エンジニアはますますアシスタントワークフローを通じて運用しており、復元力テストは、一人の信頼性スペシャリストによる四半期の儀式ではなく、その日常ループの一部であるべきである。
Azure 上で AI ワークロードを実行している場合、これはさらに重要である。エージェントと検索パイプラインは依然として通常のクラウドプリミティブに依存している: ネットワーク、キャッシュ、ID、ストレージ、データベース。それらの基盤がストレス下でテストされていなければ、プラットフォームは信頼性を主張できない。
結論: Chaos Studio Workspaces は、「証明せよ」を復元力の新しいデフォルトにする。早期に採用するチームは自信を持って出荷できる。遅らせるチームは、すべてのテストが高コストで公になる本番環境で復元力バグを発見し続けることになる。
