Chuyển đến nội dung chính

レッスン 16: 可観測性と評価 — エージェントが「考えている」ことを監視する

LangSmith、Langfuse を使用してエージェントの決定を追跡します。ロギング、メトリクス、コスト追跡。評価: LLM-as-a-Judge、ゴールデン テスト セット、人間による評価。 A/B テスト エージェントのプロンプト。

🧠 AI と ML — レッスン 15 レッスン 16: 可観測性と評価 — による エージェントが「考えている」ことを観察する

AI エージェントの構築: ゼロから本番環境まで

パート 6: 本番環境と実際のデプロイメント

xdev.asia

はじめに

「私のラップトップで動作します」というだけでは、制作エージェントにとっては十分ではありません。エージェントが何を考えているのか、なぜそのツールを選択したのかを確認し、体系的な方法で出力品質を測定**する必要があります。


1. 可観測性スタック

1.1 トレース

from langsmith import traceable

@traceable(name="research_agent")
def run_agent(query):
    # Mọi LLM call, tool call đều được trace
    ...

1.2 主要な指標

  • 待ち時間: 最初のトークンまでの時間、合計応答時間
  • コスト: リクエストごとのコスト、1 日の予算の使用量
  • 成功率: 正常に完了したタスクの割合(%)
  • ツールの使用法: 最も多く呼び出されたツール、失敗率

2. 評価

2.1 裁判官としての LLM

def evaluate_output(task, agent_output, reference_output):
    judge_prompt = f"""
    Evaluate agent output on a scale of 1-5:
    Task: {task}
    Agent output: {agent_output}
    Reference: {reference_output}
    
    Score: [1-5]
    Reasoning: [why]
    """
    return call_llm(judge_prompt)

概要

  • 可観測性 = トレース + ロギング + メトリクス + コスト追跡
  • エージェント追跡用の LangSmith / Langfuse
  • 評価: LLM-as-Judge、ゴールデンセット、人間評価
  • 最適化のための A/B テスト プロンプト/ツール

演習

  1. エージェントの LangSmith トレースをセットアップする
  2. カスタム ダッシュボードの構築: コスト、レイテンシ、成功率
  3. ゴールデン テスト セット (20 ケース) を作成し、評価を実行します
  4. 2 つの異なるシステム プロンプトの A/B テスト