Chuyển đến nội dung chính

レッスン 35: GRAFANA ダッシュボードと SLO モニタリング

Grafana 統合ダッシュボード、SLI/SLO/エラー バジェット モニタリング、Grafonnet を使用したコードとしてのダッシュボード、アラート ワークフロー、運用グレードの可観測性スタックを構築します。

🔒 DevSecOps — レッスン 35 レッスン 35: GRAFANA ダッシュボードとSLO モニタリング_

Kubernetes HA を使用してマイクロサービスをオンプレミスにデプロイ

パート 8: 可観測性 — プロメテウス、ロキ、テンポ

xdev.asia

🎯 レッスンの目的__HTMLTAG_68___
  • ✅ マイクロサービス向けの Grafana 統合ダッシュボード デザイン
  • ✅ SLI/SLO/エラーバジェットの概念と実装
  • ✅ ConfigMap/Grafonnet を使用したコードとしてのダッシュボード
  • ✅ アラート ワークフローとオンコール ルーティング
  • ✅ 本番環境の可観測性チェックリスト

パート 1: SLI / SLO / エラー予算

コンセプト定義_例
SLI (サービス レベル インジケーター)サービス品質を測定する指標99.2% のリクエスト__HTMLTAG_103___
SLO (サービス レベル目標)SLI の目標値_99.9%/月の可用性_
エラー予算許容ダウンタイム = 1 - SLO_99.9% → 43.2 分/月
SLA (サービス レベル アグリーメント)結果を伴う契約_99.9% または返金クレジット

コードブロック_0


パート 2: PROMETHEUS による SLO の実装

コードブロック_1


パート 3: GRAFANA ダッシュボードのデザイン

コードブロック_2

コードブロック_3


パート 4: ワークフローのアラート

コードブロック_4


パート 5: 本番環境の監視可能性チェックリスト

カテゴリアイテムツール
メトリクス_サービスごとのREDメソッド_Prometheus
メトリクス_ノードごとのUSEメソッドノードエクスポーター
メトリクス_SLO/エラーバジェット記録ルール
ログ一元化された構造化ログLoki + Promtail_
ログログベースのアラート_Loki ルーラー
トレース分散トレーステンポ + OTel
トレーストレースログメトリック相関Grafana
アラート_マルチバーンレートSLOアラート_アラートマネージャー_
_アラート_オンコールルーティング_PagerDuty
ダッシュボード3 レベルのドリルダウンGrafana

💡 重要なポイント

  1. SLO: エラー バジェットを定義し、バーン レートに関するアラート (しきい値だけでなく)
  2. RED メソッド: サービスごとのレート、エラー、期間
  3. ダッシュボード階層: プラットフォーム → サービス → リクエストの詳細
  4. コードとしてのダッシュボード: ConfigMap + サイドカー自動プロビジョニング
  5. アラートルーティング: 重大→PagerDuty、警告→Slack
  6. 相関: メトリック → トレース → ログ = 全体像

🎯 演習

演習 1: SLO の設定

  • サンプル サービスの SLI を定義する (可用性 + 遅延)
  • 録画ルール + 書き込み率アラートを作成
  • ビルド エラー予算ダッシュボード

演習 2: 統合ダッシュボード

  • 3 レベルのダッシュボード階層を作成
  • トレース ログ メトリックのリンクを構成する__HTMLTAG_288___
  • インシデントをシミュレートし、可観測性スタックを使用して根本原因を見つける

📚 次の投稿

__HTMLTAG_296___レッスン 36: RBAC とポッドのセキュリティ標準 では、セクション 9 — K8s クラスターのセキュリティ強化を開始します。