Production Debugging & Incident Response Playbook
本番環境がダウンすると、その損失は分単位で計測されます。インシデント対応は、プレッシャー下で障害を診断し、ステークホルダーと明確に通信して、サービスを素早く復旧させる規律であり、その後、再発を防ぐために十分な学習が必要です。このトラックは全ライフサイクルをカバーします。ライブシステムのログとトレースの読み方から、重大なインシデントコールのリード、厳密なポストモーテムの作成、ユーザーに検出される前に弱点を見つけるためのカオスエンジニアリング実験の実施まで。
What You Will Learn
インシデントの全段階にわたって実践的なスキルを構築します。構造化ログ、監視、アラート設定によるノイズなしの信号検出、分散システムを通じたリクエストのトレースによるサービス境界を越えた障害の特定、明確なインシデント通信とポストモーテムの作成による継続的な改善、プレイブックと自動化による標準化された対応手順の実装、本番環境における実際のツールを使用したプロファイリングとパフォーマンスデバッグ、高度な監視によるアノマリー検出、Security Incidentsの処理と基本的なデジタルフォレンジックスの適用、そしてインシデントが実際に発生する前にシステムの耐性をストレステストするカオスエンジニアリングの活用。
The Learning Path
12のコースが A2 から C2 までをカバーしています。このトラックは A2 レベルのIntroduction to Production Debugging Essentialsから始まり、インシデントライフサイクル、ログ記録、監視、アラート設定をカバーする B1 基礎へと進みます。B2 コースでは分散トレーシング、インシデント通信、ポストモーテム分析、プレイブック設計を紹介します。最後の 6 つの C1 コースは高度なデバッグ、プロファイリング、アノマリー検出、本番環境でのエキスパートパフォーマンスデバッグを強化し、その後Security Incidents and Basic Digital ForensicsとLeading Major Incidents and Crisis Managementが続きます。トラックは C2 レベルのMastering Chaos Engineering for System Resilienceで締めくくられます。
How It Works
各コースは短く焦点を絞ったレッスンとインタラクティブな演習、リアルタイムフィードバックに分割されています。困ったときはいつでも AI チューターが利用でき、馴染みのないツールや難しいデバッグシナリオを自分のペースで進めながら勢いを失わずに進めることができます。