はじめに
モデルが優れているかどうかは、選択した指標に大きく依存します。同じモデルでも、精度の点では非常に優れているように見えても、再現性の点では非常に悪い場合があります。この記事は、習慣ではなく適切な問題に従ってメトリクスを選択するのに役立ちます。
レッスンの目標
- 回帰と分類のための区別するメトリクス。
- 精度、精度、リコール、F1、ROC-AUC、およびそれらをいつ使用するかを理解します。
- 指標が製品目標に沿ったものでなければならない理由を理解します。
回帰メトリクス
- MAE: わかりやすく、平均絶対誤差を測定します。
- RMSE: 重大なエラーに対するペナルティは MAE よりも大きくなります。
- R 二乗: 説明された分散の量を測定しますが、それを神聖化するものではありません。
分類メトリック
- 精度: 全体的な正確な予測率。
- 精度: 陽性と予測されたサンプルのうち、実際に陽性であるサンプルの数。
- 思い出してください: 真陽性サンプルのうち、モデルはいくつをキャプチャできるでしょうか?
- F1 スコア: 精度と再現率のバランス。
- ROC-AUC: 2 つのクラス間の確率をランク付けする能力を測定します。
コンテキストに応じたメトリクスの選択例
- 不正行為を検出: 高い再現率を優先して、見逃さないようにします。
- スパムメール: 通常のメールを誤ってブロックしないように、十分正確である必要があります。
- 顧客離れ: 多くの場合、リコールと維持アクションのビジネス価値を気にします。
サンプルコード
sklearn.metrics からインポート activity_score、precision_score、recall_score、f1_score、roc_auc_score
print('精度:', precision_score(y_test, preds))
print('精度:', precision_score(y_test, preds))
print('Recall:', remember_score(y_test, preds))
print('F1:', f1_score(y_test, preds))
print('ROC-AUC:', roc_auc_score(y_test, proba))
よくある間違い
- 非常に不均衡なデータには精度を使用します。
- テスト間で異なるメトリックを使用してモデルを比較します。
- 技術的な指標を最適化しますが、ビジネスコストは忘れてください。
練習問題を練習する
- 不均衡な分類問題を取り上げます。
- 混同行列と 5 つの主要な指標を計算します。
- 短い段落を書きます。もしあなたが PM だったら、どの指標を主要 KPI として選択しますか?
完了基準
- 少なくとも 3 つの異なる問題に対して適切なメトリックを選択します。
- 実際の例を用いて精度と再現率を説明します。
- 混乱せずに混同行列を読むことができます。
段階的に練習する (上級)
- クラスの不均衡を伴うチャーンまたは詐欺の問題を選択します。
- 5 つの指標を測定します: 精度、精度、再現率、F1、ROC-AUC。
- クラス差データの比較のために PR-AUC を追加します。
- FP/FN コストをシミュレーションし、予想コストを計算します。
- 週次レポートに使用される主要な指標。
アーティファクトを送信する必要があります
- メトリクステーブル + PR 曲線および ROC 曲線グラフ。
- シンプルなコスト マトリックス モデル。
- モニタリングのための主要な指標と二次的な指標の結論。
セルフテストの質問
- クラス外のデータの精度が誤解を招くのはなぜですか?
- PR-AUC と ROC-AUC の意味の違いは何ですか?
- 複数のメトリクスを同時に監視する必要があるのはどのような場合ですか?