簡介
對於生產代理來說,「它可以在我的筆記型電腦上運行」是不夠的。您需要了解代理在想什麼,為什麼選擇該工具,並以系統的方式衡量輸出品質。
1. 可觀測性堆疊
1.1 追踪
from langsmith import traceable
@traceable(name="research_agent")
def run_agent(query):
# Mọi LLM call, tool call đều được trace
...
1.2 關鍵指標
- 延遲:第一個令牌的時間,總回應時間
- 成本:每個請求的成本、每日預算使用情況
- 成功率:成功完成的任務百分比
- 工具使用:哪些工具呼叫最多,失敗率
2. 評估
2.1 法學碩士法官
def evaluate_output(task, agent_output, reference_output):
judge_prompt = f"""
Evaluate agent output on a scale of 1-5:
Task: {task}
Agent output: {agent_output}
Reference: {reference_output}
Score: [1-5]
Reasoning: [why]
"""
return call_llm(judge_prompt)
總結
- 可觀察性 = 追蹤 + 日誌記錄 + 指標 + 成本追蹤
- LangSmith / Langfuse 用於代理追蹤
- 評估:法學碩士作為法官、黃金套裝、人類評估
- A/B 測試提示/最佳化工具
練習
- 為代理設定 LangSmith 跟踪
- 建立自訂儀表板:成本、延遲、成功率
- 建立黃金測試集(20個案例)並執行評估
- A/B測試2個不同的系統提示