Chuyển đến nội dung chính

第 16 課:可觀察性與評估-監控智能體的“想法”

使用 LangSmith、Langfuse 追蹤代理決策。日誌記錄、指標、成本追蹤。評估:法學碩士作為法官、黃金測試集、人工評估。 A/B 測試代理程式提示。

🧠 人工智慧與機器學習 — 第 15 課 第 16 課:可觀察性與評估 — 根據 觀察特工“怎麼想”

建構 AI 代理:從零到生產

第 6 部分:生產與實際部署

亞洲開發網

簡介

對於生產代理來說,「它可以在我的筆記型電腦上運行」是不夠的。您需要了解代理在想什麼,為什麼選擇該工具,並以系統的方式衡量輸出品質。


1. 可觀測性堆疊

1.1 追踪

from langsmith import traceable

@traceable(name="research_agent")
def run_agent(query):
    # Mọi LLM call, tool call đều được trace
    ...

1.2 關鍵指標

  • 延遲:第一個令牌的時間,總回應時間
  • 成本:每個請求的成本、每日預算使用情況
  • 成功率:成功完成的任務百分比
  • 工具使用:哪些工具呼叫最多,失敗率

2. 評估

2.1 法學碩士法官

def evaluate_output(task, agent_output, reference_output):
    judge_prompt = f"""
    Evaluate agent output on a scale of 1-5:
    Task: {task}
    Agent output: {agent_output}
    Reference: {reference_output}
    
    Score: [1-5]
    Reasoning: [why]
    """
    return call_llm(judge_prompt)

總結

  • 可觀察性 = 追蹤 + 日誌記錄 + 指標 + 成本追蹤
  • LangSmith / Langfuse 用於代理追蹤
  • 評估:法學碩士作為法官、黃金套裝、人類評估
  • A/B 測試提示/最佳化工具

練習

  1. 為代理設定 LangSmith 跟踪
  2. 建立自訂儀表板:成本、延遲、成功率
  3. 建立黃金測試集(20個案例)並執行評估
  4. A/B測試2個不同的系統提示