Chuyển đến nội dung chính

第 32 課:Prometheus Stack — 監控基礎設施

部署 kube-prometheus-stack(Prometheus、Grafana、Alertmanager)、ServiceMonitor、記錄規則、警報規則、使用 Thanos 進行長期儲存以及自訂指標。

🔒 DevSecOps — 第 32 課 第 32 課:PROMETHEUS 堆疊 — 監控 基礎設施

使用 Kubernetes HA 在本地部署微服務

第 8 部分:可觀察性 — Prometheus、Loki、Tempo

xdev.asia

🎯 課程目標__HTMLTAG_68___
  • ✅ 部署 kube-prometheus-stack (Prometheus + Grafana + Alertmanager)
  • ✅ 用於服務發現的 ServiceMonitor 和 PodMonitor
  • ✅ 預先計算指標的記錄規則__HTMLTAG_75___
  • ✅ 警報規則和 Alertmanager 路由__HTMLTAG_77___
  • ✅ 用於長期儲存的 Thanos__HTMLTAG_79___
  • ✅ 自訂應用程式指標__HTMLTAG_81___

第 1 部分:可觀測性架構

程式碼區塊_0


第 2 部分:安裝 KUBE-POMETHEUS-STACK

程式碼區塊_1

程式碼區塊_2

程式碼區塊_3


第 3 部分:SERVICEMONITOR 和 PODMONITOR

程式碼區塊_4


第 4 部分:警報規則

程式碼區塊_5


第 5 部分:GRAFANA 儀表板

程式碼區塊_6

程式碼區塊_7


第 6 部分:薩諾斯(長期儲存)

程式碼區塊_8


💡 重點

    ___HTMLTAG_105__HTMLTAG_106___kube-prometheus-stack:在一張 Helm 圖表中完成監控 ___HTMLTAG_109__HTMLTAG_110___ServiceMonitor:自動發現目標,無需手動抓取設定 ___HTMLTAG_113__HTMLTAG_114___RED 方法:所有服務的速率、錯誤、持續時間 ___HTMLTAG_117__HTMLTAG_118___Alertmanager:以嚴重性將警報路由到 Slack/PagerDuty ___HTMLTAG_121__HTMLTAG_122___記錄規則:預先計算昂貴的查詢 ___HTMLTAG_125__HTMLTAG_126___Thanos:物件儲存上的長期儲存(月/年)

🎯 練習__HTMLTAG_132___

練習 1:監控設定__HTMLTAG_134___
  • 部署 kube-prometheus-stack
  • 為應用程式建立 ServiceMonitor
  • 建構 RED 方法 Grafana 儀表板__HTMLTAG_141___

練習 2:警報

  • 建立警報規則(錯誤速率、延遲、Pod 重新啟動)
  • 配置 Alertmanager → Slack
  • 觸發警報,驗證通知

📚 下一篇文章

在 第 33 課:Loki — 集中式日誌記錄中,我們將使用 Grafana Loki 設定集中式日誌聚合。