🎯 レッスンの目的__HTMLTAG_68___
このレッスンを完了すると、次のことができるようになります:
- ✅ Ceph の Prometheus モニタリングをセットアップ
- ✅ Ceph 用 Grafana ダッシュボードをインポート
- ✅ OSD パフォーマンス パラメータの調整
- ✅ スクラブとリカバリの管理
- ✅ HEALTH_WARN および一般的な問題のトラブルシューティング__HTMLTAG_81___
パート 1: プロメテウスの指標
1.1. Ceph Prometheus モジュール
___コードブロック_0___1.2。 ServiceMonitor (Prometheus Operator 用)
___コードブロック_1___1.3。監視すべき主要な指標
| メートル法 | 意味__HTMLTAG_99___ | アラートしきい値 |
|---|---|---|
| ceph_health_status | 0=OK、1=警告、2=エラー | > 5 分間は 0 |
| ceph_osd_up | OSD アップステータス | != 1 |
| ceph_osd_in | クラスター内の OSD | != 1 |
| ceph_cluster_total_used_raw_bytes | 実際の使用法 | > 容量の 80%__HTMLTAG_135___ |
| ceph_osd_op_r_latency_sum | 読み取り遅延__HTMLTAG_141___ | > 50ms p99 |
| ceph_osd_op_w_latency_sum | 書き込み遅延 | > 100ms p99 |
| ceph_pg_degraded | 劣化した PG | > 5 分間は 0 |
| ceph_pool_stored_raw | プールの生の使用量 | ほぼ満席 |
パート 2: GRAFANA ダッシュボード__HTMLTAG_174___
コードブロック_2
パート 3: パフォーマンス チューニング
3.1. OSD チューニング
___コードブロック_3___3.2.プールの調整
___コードブロック_4___パート 4: トラブルシューティング
4.1.共通の HEALTH_WARN
___コードブロック_5___4.2.失敗した OSD を置換
___コードブロック_6___4.3.プールが満杯の緊急
___コードブロック_7___パート 5: ストレージのベンチマーク__HTMLTAG_193___
コードブロック_8
💡 重要なポイント
- Prometheus + Grafana: Ceph の健全性、レイテンシ、IOPS、容量を監視
- スクラブ スケジュール: 影響を最小限に抑えるため、オフピーク時間 (午前 2 ~ 6 時)
- _回復調整: osd_recovery_max_active、osd_max_backfills
- PG オートスケーラー: PG 数を自動的に調整
- OSD 置換: マークアウト→回復を待つ→パージ→ディスクを置換
- _展開前のベンチマーク: ベースラインの rados ベンチ
🎯 演習
演習 1: モニタリング
- Prometheus による Ceph メトリクスのスクレイピングを確認__HTMLTAG_230___
- __HTMLTAG_232___ceph の健康状態の詳細 を確認し、警告を解決
_演習 2: ベンチマーク
- rados ベンチの書き込み/読み取りを実行
- ceph-block PVC を使用してポッドに fio をデプロイ
- IOPS と遅延の比較__HTMLTAG_244___
_演習 3: OSD 障害のシミュレーション__HTMLTAG_247___
- 1 OSD アウトをマークし、回復を観察
- OSD 印刷をマークし、再バランスを観察
📚 次の投稿
__HTMLTAG_258___レッスン 16: Patroni と CloudNativePG を使用した PostgreSQL HA アーキテクチャ では、パート 4 — マイクロサービスのデータベース HA を開始します。