はじめに
ローカルAIスタックが動作するだけでは不十分です。品質を測定し、低下を検出し、チームにSLOで保証を提供する必要があります。
1. コアメトリクス
GenAIシステムに必要な4つのコアメトリクス:
- レイテンシ(p50/p95/p99)
- グラウンデッドネス(引用の正確性)
- トークンコスト(リクエストあたりの推定)
- エラーレート(スキーマ失敗、タイムアウト)
2. ゴールデンセットの構築
ゴールデンセットとは:
- 20〜50の標準的な質問
- 各質問に期待される回答の要素
- 自動化されたスコアリングスクリプト
定期的に実行して品質トレンドを追跡します。
3. オンラインフィードバックループ
ユーザーからのシグナル:
- 👍/👎ボタン
- 「回答が間違っている」レポート
- 再生成リクエスト
これらのシグナルをダッシュボードに集約し、品質低下を早期に検出します。
4. SLOの定義
AI機能のSLO例:
| メトリクス | ターゲット | 測定期間 |
|---|---|---|
| レイテンシ p95 | < 5秒 | 7日間 |
| グラウンデッドネス | > 85% | 7日間 |
| 可用性 | > 99% | 30日間 |
| エラーレート | < 5% | 7日間 |
SLOを達成できない場合のエスカレーション手順も定義してください。
5. ダッシュボード設計
最低限含めるべきパネル:
- リクエスト量(時系列)
- レイテンシ分布
- モデル別エラーレート
- フィードバックスコアトレンド
- アクティブモデルバージョン
デモコード
Evalフレームワーク実行結果 — スコアサマリー:

ソースコード:06-eval-framework