🎯 レッスンの目的__HTMLTAG_68___
- ✅ マイクロサービス向けの Grafana 統合ダッシュボード デザイン
- ✅ SLI/SLO/エラーバジェットの概念と実装
- ✅ ConfigMap/Grafonnet を使用したコードとしてのダッシュボード
- ✅ アラート ワークフローとオンコール ルーティング
- ✅ 本番環境の可観測性チェックリスト
パート 1: SLI / SLO / エラー予算
| コンセプト | 定義 | _例 |
|---|---|---|
| SLI (サービス レベル インジケーター) | サービス品質を測定する指標 | 99.2% のリクエスト__HTMLTAG_103___ |
| SLO (サービス レベル目標) | SLI の目標値_ | 99.9%/月の可用性_ |
| エラー予算 | 許容ダウンタイム = 1 - SLO_ | 99.9% → 43.2 分/月 |
| SLA (サービス レベル アグリーメント) | 結果を伴う契約_ | 99.9% または返金クレジット |
コードブロック_0
パート 2: PROMETHEUS による SLO の実装
コードブロック_1
パート 3: GRAFANA ダッシュボードのデザイン
コードブロック_2
コードブロック_3
パート 4: ワークフローのアラート
コードブロック_4
パート 5: 本番環境の監視可能性チェックリスト
| カテゴリ | アイテム | ツール |
|---|---|---|
| メトリクス_ | サービスごとのREDメソッド | _Prometheus |
| メトリクス_ | ノードごとのUSEメソッド | ノードエクスポーター |
| メトリクス_ | SLO/エラーバジェット | 記録ルール |
| ログ | 一元化された構造化ログ | Loki + Promtail_ |
| ログ | ログベースのアラート_ | Loki ルーラー |
| トレース | 分散トレース | テンポ + OTel |
| トレース | トレースログメトリック相関 | Grafana |
| アラート_ | マルチバーンレートSLOアラート_ | アラートマネージャー_ |
| _アラート_ | オンコールルーティング | _PagerDuty |
| ダッシュボード | 3 レベルのドリルダウン | Grafana |
💡 重要なポイント
- SLO: エラー バジェットを定義し、バーン レートに関するアラート (しきい値だけでなく)
- RED メソッド: サービスごとのレート、エラー、期間
- ダッシュボード階層: プラットフォーム → サービス → リクエストの詳細
- コードとしてのダッシュボード: ConfigMap + サイドカー自動プロビジョニング
- アラートルーティング: 重大→PagerDuty、警告→Slack
- 相関: メトリック → トレース → ログ = 全体像
🎯 演習
演習 1: SLO の設定
- サンプル サービスの SLI を定義する (可用性 + 遅延)
- 録画ルール + 書き込み率アラートを作成
- ビルド エラー予算ダッシュボード
演習 2: 統合ダッシュボード
- 3 レベルのダッシュボード階層を作成
- トレース ログ メトリックのリンクを構成する__HTMLTAG_288___
- インシデントをシミュレートし、可観測性スタックを使用して根本原因を見つける
📚 次の投稿
__HTMLTAG_296___レッスン 36: RBAC とポッドのセキュリティ標準 では、セクション 9 — K8s クラスターのセキュリティ強化を開始します。