Chuyển đến nội dung chính

第 30 課:LOKI、TEMPO 和分散式追蹤

使用 LogQL 查詢進行 Loki 日誌聚合。 Grafana Alloy 從容器中收集日誌。 Tempo 分散式追蹤。 OpenTelemetry 自動檢測。相關的可觀察性:在 Grafana 中一起查看日誌、指標、追蹤。

🔒 DevSecOps — 第 30 課 第 30 課:LOKI、TEMPO 和分散式追蹤

Kubernetes:從基礎到高級

Module 7: Observability & Monitoring

xdev.asia

🎯 課程目標

了解Loki是一個比Elasticsearch更輕的日誌聚合系統,Grafana Alloy如何收集日誌,用於分散式追蹤的Tempo,OpenTelemetry自動檢測,以及如何在Grafana中組合Logs + Metrics + Traces。

1. Loki——日誌聚合

1.1 Loki 與 Elasticsearch

  • 洛基:基於標籤的索引(只索引標籤,不索引日誌內容)→更輕,更便宜,適合Kubernetes日誌
  • 彈性搜尋:全文索引→消耗大量記憶體/CPU,適合需要全文檢索的情況

對於 Kubernetes 日誌(結構化、標記),Loki 是 2026 年更好的選擇。

1.2 Loki架構

  • 經銷商:從代理接收日誌,驗證並扇出
  • 攝取者:緩衝日誌在記憶體中,刷新到物件存儲
  • 查詢者:執行查詢,合併 inester + 儲存的結果
  • 壓實機:緊湊塊,保留管理

1.3 LogQL——查詢語言

# Cơ bản: filter theo labels
{app="nginx", namespace="production"}

Filter log content

{app="nginx"} |= "error" {app="nginx"} != "health"

JSON parsing

{app="myapp"} | json | level="error"

Regex filter

{app="nginx"} |~ "HTTP/1\.1 [45][0-9]{2}"

Metrics từ logs

rate({app="nginx"} |= "error" [5m]) count_over_time({app="myapp"} | json | level="error" [1h])

Top N errors

topk(10, sum by (message) ( count_over_time({namespace="production"} | json | level="error" [1h]) ) )

2. Grafana Alloy-統一收集器

Grafana Alloy 取代了所有個體代理:Promtail、OTel Collector、Prometheus 代理模式。

# Alloy config (River DSL)
# /etc/alloy/config.alloy

Thu thập logs từ Kubernetes pods

discovery.kubernetes "pods" { role = "pod" }

discovery.relabel "pod_logs" { targets = discovery.kubernetes.pods.targets rule { source_labels = ["__meta_kubernetes_pod_label_app"] target_label = "app" } rule { source_labels = ["__meta_kubernetes_namespace"] target_label = "namespace" } rule { source_labels = ["__meta_kubernetes_pod_container_name"] target_label = "container" } }

loki.source.kubernetes "pods" { targets = discovery.relabel.pod_logs.output forward_to = [loki.write.default.receiver] }

Forward đến Loki

loki.write "default" { endpoint { url = "http://loki:3100/loki/api/v1/push" } }

Thu thập Prometheus metrics

prometheus.scrape "kubernetes" { targets = discovery.kubernetes.pods.targets forward_to = [prometheus.remote_write.grafana_cloud.receiver] }

prometheus.remote_write "grafana_cloud" { endpoint { url = "http://prometheus:9090/api/v1/write" } }

3. Tempo——分散式追蹤

Tempo 是 Grafana 的分散式追蹤後端,與 Loki 和 Prometheus 整合良好。

3.1 概念

  • 蹤跡:請求的端到端旅程(例如,從瀏覽器到資料庫)
  • 跨距:追蹤中的操作(例如 HTTP 處理程序、資料庫查詢)
  • 追蹤ID:連結追蹤的所有跨度的唯一 ID
  • 跨度ID:單一跨度的ID

3.2 速度設定

apiVersion: apps/v1
kind: Deployment
metadata:
  name: tempo
  namespace: monitoring
spec:
  replicas: 1
  selector:
    matchLabels:
      app: tempo
  template:
    metadata:
      labels:
        app: tempo
    spec:
      containers:
      - name: tempo
        image: grafana/tempo:2.7.0
        args: ["-config.file=/etc/tempo.yaml"]
        ports:
        - containerPort: 3200   # Tempo HTTP API
        - containerPort: 4317   # OTLP gRPC
        - containerPort: 4318   # OTLP HTTP
        volumeMounts:
        - name: config
          mountPath: /etc
        - name: data
          mountPath: /tmp/tempo
      volumes:
      - name: config
        configMap:
          name: tempo-config
      - name: data
        emptyDir: {}

4. OpenTelemetry自動檢測

OpenTelemetry Operator 無需更改程式碼即可自動偵測應用程式。

4.1 安裝OTel運營商

kubectl apply -f https://github.com/open-telemetry/opentelemetry-operator/releases/latest/download/opentelemetry-operator.yaml

4.2 儀表CRD

apiVersion: opentelemetry.io/v1alpha1
kind: Instrumentation
metadata:
  name: my-instrumentation
  namespace: production
spec:
  exporter:
    endpoint: http://otel-collector:4317
  propagators:
    - tracecontext
    - baggage
  sampler:
    type: parentbased_traceidratio
    argument: "0.1"   # sample 10% requests
  java:
    image: ghcr.io/open-telemetry/opentelemetry-operator/autoinstrumentation-java:latest
  nodejs:
    image: ghcr.io/open-telemetry/opentelemetry-operator/autoinstrumentation-nodejs:latest
  python:
    image: ghcr.io/open-telemetry/opentelemetry-operator/autoinstrumentation-python:latest

4.3 為自動儀表註解 Pod

apiVersion: apps/v1
kind: Deployment
metadata:
  name: java-app
  namespace: production
spec:
  template:
    metadata:
      annotations:
        # Bật auto-instrumentation cho Java
        instrumentation.opentelemetry.io/inject-java: "true"
        # Cho Node.js
        # instrumentation.opentelemetry.io/inject-nodejs: "true"
        # Cho Python
        # instrumentation.opentelemetry.io/inject-python: "true"
    spec:
      containers:
      - name: java-app
        image: myapp:v1.2.3
        # OTel Operator tự động inject JAVA_TOOL_OPTIONS, OTEL_SERVICE_NAME, etc.

5. Grafana 中的相關可觀察性

真正的力量在於您可以在 Grafana 中從警報 → 指標 → 日誌 → 追蹤。

5.1 Loki 中的派生字段

// Grafana Data Source Loki config
{
  "derivedFields": [
    {
      "name": "TraceID",
      "matcherRegex": "traceID=(\\w+)",
      "url": "${__value.raw}",
      "datasourceUid": "tempo-uid"   // link sang Tempo
    }
  ]
}
// Khi log line có "traceID=abc123" → click link → mở trace trong Tempo

5.2 範例-從指標到軌跡的鏈接

# Prometheus config để enable exemplars
global:
  scrape_interval: 15s
  evaluation_interval: 15s

Application phải expose exemplars trong metrics

http_request_duration_seconds_bucket{le="0.1"} 24054 # {trace_id="abc123"} 0.092

5.3 Grafana Explore——相關視圖

# Workflow debug:
# 1. Xem alert → metric spike ở 15:32
# 2. Grafana Explore → chuyển sang Loki → lọc logs 15:30-15:35
#    Query: {namespace="production", app="api"} |= "error" | json
# 3. Click traceID trong log line → mở Tempo
# 4. Xem trace → span nào chậm? → DB query 3.2s

6. Loki 與 EFK Stack — 何時使用什麼?

  • 使用洛基:Kubernetes日誌,結構化日誌(JSON),不需要全文檢索,想要低成本
  • 使用 Elasticsearch (EFK):需要透過日誌內容進行全文搜索,合規日誌需要長期保留,而且已經有現有的ELK基礎設施

總結

  • Loki:基於標籤的、輕量級的、適合Kubernetes日誌-LogQL查詢語言
  • Grafana Alloy:統一收集器(指標+日誌+追蹤)
  • Tempo:分散式追踪,與 Grafana 生態系統完美集成
  • OTel 操作員:自動偵測,無需更改程式碼
  • 相關可觀測性:從 Grafana 中的警報 → 指標 → 日誌 → 跟踪