はじめに
多くのモデルは良好なスコアを持っていますが、データ漏洩という非常に基本的な理由により、実際の環境では存続できません。この記事は非常に重要です。ここを間違えると、これまでのすべての美しい指標がほぼ無価値になってしまうからです。
レッスンの目標
- 一般的な漏洩の種類を特定します。
- モデルのどこが間違っているかを理解するためにエラー分析を行う方法を知っています。
- スコアを信じる前にモデルを確認するという考え方を養います。
データ漏洩とは何ですか?
リークは、たとえば分割前のデータの正規化や、ターゲット時間後のデータを使用したフィーチャの作成など、予測時に実際には知ることを許可されていない情報をモデルが誤って認識したときに発生します。
漏れの疑いのある兆候
・プロの勘と比べて異常に美しすぎる結果。
- 検証スコアは非常に高いですが、実際の実装は不十分です。
- 一部の機能は見慣れたものに聞こえます。
エラー分析
モデルをトレーニングした後、どのパターンが最も誤って予測されているか、どのユーザー グループに誤差が集中しているか、パターンが欠損データ、外れ値、または特別なセグメントに関連しているかどうかを確認します。
クイックチェックインプロセス
- 対象イベントの後にのみ表示されるフィーチャを確認します。
- すべての前処理がパイプライン内にあるかどうかを確認します。
- 上位の最悪のエラーと繰り返し発生するエラー グループを表示します。
- データ分割がタイムロジックまたはユーザーロジックで正しいか確認します。
よくある間違い
- 美しいリーダーボードを見て、すぐに信じてください。 ・数十行の実エラーデータは読み込まないでください。
- 予測問題では時間要因を無視します。
練習問題を練習する
- 独自の小さな漏れの例を作成し、スコアが異常に増加することを観察します。
- 戻ってパイプラインを適切に修正します。
- 20 個の間違った予測サンプルの誤差分析表を作成します。
完了基準
- 少なくとも 3 種類の一般的な漏れを検出します。
- スコアだけを見るのではなく、実際のエラー サンプルを見る習慣をつけましょう。
- 良いスコアを持つモデルが使用できない理由を理解します。
段階的に練習する (上級)
- フィーチャがいつ作成されたかを示すデータ タイムラインを作成します。
- すべての特徴が予測時間に違反しているかどうかを確認します。
- 漏れの疑いのある特徴を除去した後、モデルを再トレーニングします。
- 漏洩の影響を定量化するために、前後のメトリクスを比較します。
- 最も不正確な予測の上位 30 件についてエラー分析を実行します。
アーティファクトを送信する必要があります
- タイムラインごとの機能監査テーブル。
- 漏洩の発見と是正措置を報告します。
- 改善提案を含む主なエラー グループの表。
セルフテストの質問
- 前処理型リークとターゲット型リークはどのように異なりますか?
- 美しすぎるモデルはなぜ危険信号になり得るのでしょうか?
- エラー分析は改善の方向性を選択するのにどのように役立ちますか?