🎯 課程目標__HTMLTAG_68___
- ✅ 部署 kube-prometheus-stack (Prometheus + Grafana + Alertmanager)
- ✅ 用於服務發現的 ServiceMonitor 和 PodMonitor
- ✅ 預先計算指標的記錄規則__HTMLTAG_75___
- ✅ 警報規則和 Alertmanager 路由__HTMLTAG_77___
- ✅ 用於長期儲存的 Thanos__HTMLTAG_79___
- ✅ 自訂應用程式指標__HTMLTAG_81___
第 1 部分:可觀測性架構
程式碼區塊_0
第 2 部分:安裝 KUBE-POMETHEUS-STACK
程式碼區塊_1
程式碼區塊_2
程式碼區塊_3
第 3 部分:SERVICEMONITOR 和 PODMONITOR
程式碼區塊_4
第 4 部分:警報規則
程式碼區塊_5
第 5 部分:GRAFANA 儀表板
程式碼區塊_6
程式碼區塊_7
第 6 部分:薩諾斯(長期儲存)
程式碼區塊_8
💡 重點
-
___HTMLTAG_105__HTMLTAG_106___kube-prometheus-stack:在一張 Helm 圖表中完成監控
___HTMLTAG_109__HTMLTAG_110___ServiceMonitor:自動發現目標,無需手動抓取設定
___HTMLTAG_113__HTMLTAG_114___RED 方法:所有服務的速率、錯誤、持續時間
___HTMLTAG_117__HTMLTAG_118___Alertmanager:以嚴重性將警報路由到 Slack/PagerDuty
___HTMLTAG_121__HTMLTAG_122___記錄規則:預先計算昂貴的查詢
___HTMLTAG_125__HTMLTAG_126___Thanos:物件儲存上的長期儲存(月/年)
🎯 練習__HTMLTAG_132___
練習 1:監控設定__HTMLTAG_134___
- 部署 kube-prometheus-stack
- 為應用程式建立 ServiceMonitor
- 建構 RED 方法 Grafana 儀表板__HTMLTAG_141___
練習 2:警報
- 建立警報規則(錯誤速率、延遲、Pod 重新啟動)
- 配置 Alertmanager → Slack
- 觸發警報,驗證通知
📚 下一篇文章
在 第 33 課:Loki — 集中式日誌記錄中,我們將使用 Grafana Loki 設定集中式日誌聚合。