Chuyển đến nội dung chính

第 15 課:CEPH 監控、調優與故障排除

適用於 Ceph、Grafana 儀表板的 Prometheus 指標、效能調整參數、OSD 調整、清理、復原設定以及常見問題故障排除。

🔒 DevSecOps — 第 15 課 第 15 課:CEPH 監控、調整與 故障排除

使用 Kubernetes HA 在本地部署微服務

第 3 部分:分散式儲存 — Rook-Ceph

xdev.asia

🎯 課程目標__HTMLTAG_68___

完成本課程後,您將:

  • ✅ 為 Ceph 設定 Prometheus 監控
  • ✅ 導入適用於 Ceph 的 Grafana 儀表板
  • ✅ 調整 OSD 效能參數
  • ✅ 管理清理與復原
  • ✅ 追蹤 HEALTH_WARN 和常見問題__HTMLTAG_81___

第 1 部分:普羅米修斯指標

1.1。 Ceph Prometheus 模組

___程式碼區塊_0___

1.2。 ServiceMonitor(適用於 Prometheus Operator)

___程式碼區塊_1___

1.3。監控的關鍵指標

公制 意義__HTMLTAG_99___ 警報閾值
ceph_health_status 0=正常,1=警告,2=錯誤 > 0 表示 5m
ceph_osd_up OSD 啟動狀態 ! = 1
ceph_osd_in 叢集中的 OSD ! = 1
ceph_cluster_total_used_raw_bytes 原始用法 > 80% 容量__HTMLTAG_135___
ceph_osd_op_r_latency_sum 讀取延遲__HTMLTAG_141___ > 50 毫秒 p99
ceph_osd_op_w_latency_sum 寫入延遲 > 100 毫秒 p99
ceph_pg_degraded 降級 PG > 0 表示 5m
ceph_pool_stored_raw 池原始使用量 接近滿

第 2 部分:GRAFANA 儀表板__HTMLTAG_174___

程式碼區塊_2


第 3 部分:效能調整

3.1。 OSD 調整

___程式碼區塊_3___

3.2。池調整

___程式碼區塊_4___

第 4 部分:故障排除

4.1。常見 HEALTH_WARN

___程式碼區塊_5___

4.2。替換失敗的 OSD

___程式碼區塊_6___

4.3。池已滿緊急情況

___程式碼區塊_7___

第 5 部分:儲存基準__HTMLTAG_193___

程式碼區塊_8


💡 重點

    ___HTMLTAG_198__HTMLTAG_199___Prometheus + Grafana:監控 Ceph 運作狀況、延遲、IOPS、容量 ___HTMLTAG_202__HTMLTAG_203___調整時間安排:非尖峰時段(凌晨 2 點至 6 點)以盡量減少影響 ___HTMLTAG_206__HTMLTAG_207___恢復限制:osd_recovery_max_active、osd_max_backfills ___HTMLTAG_210__HTMLTAG_211___PG 自動縮放器:自動調整 PG 計數 ___HTMLTAG_214__HTMLTAG_215___OSD 替換:標記→等待復原→清除→更換磁碟 ___HTMLTAG_218__HTMLTAG_219___部署前的基準:rados 基準基準

🎯 練習

練習 1:監控

  • 驗證 Prometheus 抓取 Ceph 指標__HTMLTAG_230___
  • 檢查 ceph 運作狀況詳細資訊 並解決警告

練習 2:基準

  • 執行 rados 工作台寫入/讀取
  • 使用 ceph-block PVC 在 pod 中部署 fio
  • 比較 IOPS 和延遲__HTMLTAG_244___

練習 3:OSD 故障模擬__HTMLTAG_247___
  • 將 1 OSD 標記為退出,觀察恢復情況
  • 標記 OSD 列印,觀察重新平衡

📚 下一篇文章

在 第 16 課:使用 Patroni 和 CloudNativePG 的 PostgreSQL HA 架構,我們將開始第 4 部分 — 微服務的資料庫 HA。