Chuyển đến nội dung chính

レッスン7:GenAI向けEvalフレームワーク、オブザーバビリティ&SLO

ゴールデンセット、オンラインフィードバックループ、レイテンシ/グラウンデッドネス/コストメトリクスを設計し、 AI機能のSLOを定義する。

🧠 AI & ML — L0 レッスン7:GenAI向けEvalフレームワーク、 オブザーバビリティ&SLO Gemma 4 ローカルAIエンジニアリング on Mac パート4:信頼性、コスト&本番ハードニング xdev.asia

はじめに

ローカルAIスタックが動作するだけでは不十分です。品質を測定し、低下を検出し、チームにSLOで保証を提供する必要があります。

1. コアメトリクス

GenAIシステムに必要な4つのコアメトリクス:

  • レイテンシ(p50/p95/p99)
  • グラウンデッドネス(引用の正確性)
  • トークンコスト(リクエストあたりの推定)
  • エラーレート(スキーマ失敗、タイムアウト)

2. ゴールデンセットの構築

ゴールデンセットとは:

  • 20〜50の標準的な質問
  • 各質問に期待される回答の要素
  • 自動化されたスコアリングスクリプト

定期的に実行して品質トレンドを追跡します。

3. オンラインフィードバックループ

ユーザーからのシグナル:

  • 👍/👎ボタン
  • 「回答が間違っている」レポート
  • 再生成リクエスト

これらのシグナルをダッシュボードに集約し、品質低下を早期に検出します。

4. SLOの定義

AI機能のSLO例:

メトリクスターゲット測定期間
レイテンシ p95< 5秒7日間
グラウンデッドネス> 85%7日間
可用性> 99%30日間
エラーレート< 5%7日間

SLOを達成できない場合のエスカレーション手順も定義してください。

5. ダッシュボード設計

最低限含めるべきパネル:

  • リクエスト量(時系列)
  • レイテンシ分布
  • モデル別エラーレート
  • フィードバックスコアトレンド
  • アクティブモデルバージョン

デモコード

Evalフレームワーク実行結果 — スコアサマリー:

Evalスコア

ソースコード:06-eval-framework

まとめ