はじめに
「私のラップトップで動作します」というだけでは、制作エージェントにとっては十分ではありません。エージェントが何を考えているのか、なぜそのツールを選択したのかを確認し、体系的な方法で出力品質を測定**する必要があります。
1. 可観測性スタック
1.1 トレース
from langsmith import traceable
@traceable(name="research_agent")
def run_agent(query):
# Mọi LLM call, tool call đều được trace
...
1.2 主要な指標
- 待ち時間: 最初のトークンまでの時間、合計応答時間
- コスト: リクエストごとのコスト、1 日の予算の使用量
- 成功率: 正常に完了したタスクの割合(%)
- ツールの使用法: 最も多く呼び出されたツール、失敗率
2. 評価
2.1 裁判官としての LLM
def evaluate_output(task, agent_output, reference_output):
judge_prompt = f"""
Evaluate agent output on a scale of 1-5:
Task: {task}
Agent output: {agent_output}
Reference: {reference_output}
Score: [1-5]
Reasoning: [why]
"""
return call_llm(judge_prompt)
概要
- 可観測性 = トレース + ロギング + メトリクス + コスト追跡
- エージェント追跡用の LangSmith / Langfuse
- 評価: LLM-as-Judge、ゴールデンセット、人間評価
- 最適化のための A/B テスト プロンプト/ツール
演習
- エージェントの LangSmith トレースをセットアップする
- カスタム ダッシュボードの構築: コスト、レイテンシ、成功率
- ゴールデン テスト セット (20 ケース) を作成し、評価を実行します
- 2 つの異なるシステム プロンプトの A/B テスト