🎯 課程目標__HTMLTAG_68___
完成本課程後,您將:
- ✅ 為 Ceph 設定 Prometheus 監控
- ✅ 導入適用於 Ceph 的 Grafana 儀表板
- ✅ 調整 OSD 效能參數
- ✅ 管理清理與復原
- ✅ 追蹤 HEALTH_WARN 和常見問題__HTMLTAG_81___
第 1 部分:普羅米修斯指標
1.1。 Ceph Prometheus 模組
___程式碼區塊_0___1.2。 ServiceMonitor(適用於 Prometheus Operator)
___程式碼區塊_1___1.3。監控的關鍵指標
| 公制 | 意義__HTMLTAG_99___ | 警報閾值 |
|---|---|---|
| ceph_health_status | 0=正常,1=警告,2=錯誤 | > 0 表示 5m |
| ceph_osd_up | OSD 啟動狀態 | ! = 1 |
| ceph_osd_in | 叢集中的 OSD | ! = 1 |
| ceph_cluster_total_used_raw_bytes | 原始用法 | > 80% 容量__HTMLTAG_135___ |
| ceph_osd_op_r_latency_sum | 讀取延遲__HTMLTAG_141___ | > 50 毫秒 p99 |
| ceph_osd_op_w_latency_sum | 寫入延遲 | > 100 毫秒 p99 |
| ceph_pg_degraded | 降級 PG | > 0 表示 5m |
| ceph_pool_stored_raw | 池原始使用量 | 接近滿 |
第 2 部分:GRAFANA 儀表板__HTMLTAG_174___
程式碼區塊_2
第 3 部分:效能調整
3.1。 OSD 調整
___程式碼區塊_3___3.2。池調整
___程式碼區塊_4___第 4 部分:故障排除
4.1。常見 HEALTH_WARN
___程式碼區塊_5___4.2。替換失敗的 OSD
___程式碼區塊_6___4.3。池已滿緊急情況
___程式碼區塊_7___第 5 部分:儲存基準__HTMLTAG_193___
程式碼區塊_8
💡 重點
-
___HTMLTAG_198__HTMLTAG_199___Prometheus + Grafana:監控 Ceph 運作狀況、延遲、IOPS、容量
___HTMLTAG_202__HTMLTAG_203___調整時間安排:非尖峰時段(凌晨 2 點至 6 點)以盡量減少影響
___HTMLTAG_206__HTMLTAG_207___恢復限制:osd_recovery_max_active、osd_max_backfills
___HTMLTAG_210__HTMLTAG_211___PG 自動縮放器:自動調整 PG 計數
___HTMLTAG_214__HTMLTAG_215___OSD 替換:標記→等待復原→清除→更換磁碟
___HTMLTAG_218__HTMLTAG_219___部署前的基準:rados 基準基準
🎯 練習
練習 1:監控
- 驗證 Prometheus 抓取 Ceph 指標__HTMLTAG_230___
- 檢查
ceph 運作狀況詳細資訊並解決警告
練習 2:基準
- 執行 rados 工作台寫入/讀取
- 使用 ceph-block PVC 在 pod 中部署 fio
- 比較 IOPS 和延遲__HTMLTAG_244___
練習 3:OSD 故障模擬__HTMLTAG_247___
- 將 1 OSD 標記為退出,觀察恢復情況
- 標記 OSD 列印,觀察重新平衡
📚 下一篇文章
在 第 16 課:使用 Patroni 和 CloudNativePG 的 PostgreSQL HA 架構,我們將開始第 4 部分 — 微服務的資料庫 HA。