🎯 課程目標
了解Loki是一個比Elasticsearch更輕的日誌聚合系統,Grafana Alloy如何收集日誌,用於分散式追蹤的Tempo,OpenTelemetry自動檢測,以及如何在Grafana中組合Logs + Metrics + Traces。
1. Loki——日誌聚合
1.1 Loki 與 Elasticsearch
- 洛基:基於標籤的索引(只索引標籤,不索引日誌內容)→更輕,更便宜,適合Kubernetes日誌
- 彈性搜尋:全文索引→消耗大量記憶體/CPU,適合需要全文檢索的情況
對於 Kubernetes 日誌(結構化、標記),Loki 是 2026 年更好的選擇。
1.2 Loki架構
- 經銷商:從代理接收日誌,驗證並扇出
- 攝取者:緩衝日誌在記憶體中,刷新到物件存儲
- 查詢者:執行查詢,合併 inester + 儲存的結果
- 壓實機:緊湊塊,保留管理
1.3 LogQL——查詢語言
# Cơ bản: filter theo labels {app="nginx", namespace="production"}Filter log content
{app="nginx"} |= "error" {app="nginx"} != "health"
JSON parsing
{app="myapp"} | json | level="error"
Regex filter
{app="nginx"} |~ "HTTP/1\.1 [45][0-9]{2}"
Metrics từ logs
rate({app="nginx"} |= "error" [5m]) count_over_time({app="myapp"} | json | level="error" [1h])
Top N errors
topk(10, sum by (message) ( count_over_time({namespace="production"} | json | level="error" [1h]) ) )
2. Grafana Alloy-統一收集器
Grafana Alloy 取代了所有個體代理:Promtail、OTel Collector、Prometheus 代理模式。
# Alloy config (River DSL) # /etc/alloy/config.alloyThu thập logs từ Kubernetes pods
discovery.kubernetes "pods" { role = "pod" }
discovery.relabel "pod_logs" { targets = discovery.kubernetes.pods.targets rule { source_labels = ["__meta_kubernetes_pod_label_app"] target_label = "app" } rule { source_labels = ["__meta_kubernetes_namespace"] target_label = "namespace" } rule { source_labels = ["__meta_kubernetes_pod_container_name"] target_label = "container" } }
loki.source.kubernetes "pods" { targets = discovery.relabel.pod_logs.output forward_to = [loki.write.default.receiver] }
Forward đến Loki
loki.write "default" { endpoint { url = "http://loki:3100/loki/api/v1/push" } }
Thu thập Prometheus metrics
prometheus.scrape "kubernetes" { targets = discovery.kubernetes.pods.targets forward_to = [prometheus.remote_write.grafana_cloud.receiver] }
prometheus.remote_write "grafana_cloud" { endpoint { url = "http://prometheus:9090/api/v1/write" } }
3. Tempo——分散式追蹤
Tempo 是 Grafana 的分散式追蹤後端,與 Loki 和 Prometheus 整合良好。
3.1 概念
- 蹤跡:請求的端到端旅程(例如,從瀏覽器到資料庫)
- 跨距:追蹤中的操作(例如 HTTP 處理程序、資料庫查詢)
- 追蹤ID:連結追蹤的所有跨度的唯一 ID
- 跨度ID:單一跨度的ID
3.2 速度設定
apiVersion: apps/v1
kind: Deployment
metadata:
name: tempo
namespace: monitoring
spec:
replicas: 1
selector:
matchLabels:
app: tempo
template:
metadata:
labels:
app: tempo
spec:
containers:
- name: tempo
image: grafana/tempo:2.7.0
args: ["-config.file=/etc/tempo.yaml"]
ports:
- containerPort: 3200 # Tempo HTTP API
- containerPort: 4317 # OTLP gRPC
- containerPort: 4318 # OTLP HTTP
volumeMounts:
- name: config
mountPath: /etc
- name: data
mountPath: /tmp/tempo
volumes:
- name: config
configMap:
name: tempo-config
- name: data
emptyDir: {}
4. OpenTelemetry自動檢測
OpenTelemetry Operator 無需更改程式碼即可自動偵測應用程式。
4.1 安裝OTel運營商
kubectl apply -f https://github.com/open-telemetry/opentelemetry-operator/releases/latest/download/opentelemetry-operator.yaml
4.2 儀表CRD
apiVersion: opentelemetry.io/v1alpha1
kind: Instrumentation
metadata:
name: my-instrumentation
namespace: production
spec:
exporter:
endpoint: http://otel-collector:4317
propagators:
- tracecontext
- baggage
sampler:
type: parentbased_traceidratio
argument: "0.1" # sample 10% requests
java:
image: ghcr.io/open-telemetry/opentelemetry-operator/autoinstrumentation-java:latest
nodejs:
image: ghcr.io/open-telemetry/opentelemetry-operator/autoinstrumentation-nodejs:latest
python:
image: ghcr.io/open-telemetry/opentelemetry-operator/autoinstrumentation-python:latest
4.3 為自動儀表註解 Pod
apiVersion: apps/v1
kind: Deployment
metadata:
name: java-app
namespace: production
spec:
template:
metadata:
annotations:
# Bật auto-instrumentation cho Java
instrumentation.opentelemetry.io/inject-java: "true"
# Cho Node.js
# instrumentation.opentelemetry.io/inject-nodejs: "true"
# Cho Python
# instrumentation.opentelemetry.io/inject-python: "true"
spec:
containers:
- name: java-app
image: myapp:v1.2.3
# OTel Operator tự động inject JAVA_TOOL_OPTIONS, OTEL_SERVICE_NAME, etc.
5. Grafana 中的相關可觀察性
真正的力量在於您可以在 Grafana 中從警報 → 指標 → 日誌 → 追蹤。
5.1 Loki 中的派生字段
// Grafana Data Source Loki config
{
"derivedFields": [
{
"name": "TraceID",
"matcherRegex": "traceID=(\\w+)",
"url": "${__value.raw}",
"datasourceUid": "tempo-uid" // link sang Tempo
}
]
}
// Khi log line có "traceID=abc123" → click link → mở trace trong Tempo
5.2 範例-從指標到軌跡的鏈接
# Prometheus config để enable exemplars global: scrape_interval: 15s evaluation_interval: 15sApplication phải expose exemplars trong metrics
http_request_duration_seconds_bucket{le="0.1"} 24054 # {trace_id="abc123"} 0.092
5.3 Grafana Explore——相關視圖
# Workflow debug:
# 1. Xem alert → metric spike ở 15:32
# 2. Grafana Explore → chuyển sang Loki → lọc logs 15:30-15:35
# Query: {namespace="production", app="api"} |= "error" | json
# 3. Click traceID trong log line → mở Tempo
# 4. Xem trace → span nào chậm? → DB query 3.2s
6. Loki 與 EFK Stack — 何時使用什麼?
- 使用洛基:Kubernetes日誌,結構化日誌(JSON),不需要全文檢索,想要低成本
- 使用 Elasticsearch (EFK):需要透過日誌內容進行全文搜索,合規日誌需要長期保留,而且已經有現有的ELK基礎設施
總結
- Loki:基於標籤的、輕量級的、適合Kubernetes日誌-LogQL查詢語言
- Grafana Alloy:統一收集器(指標+日誌+追蹤)
- Tempo:分散式追踪,與 Grafana 生態系統完美集成
- OTel 操作員:自動偵測,無需更改程式碼
- 相關可觀測性:從 Grafana 中的警報 → 指標 → 日誌 → 跟踪