簡介
許多模型取得了不錯的成績,但無法在現實環境中生存,原因有一個很基本的原因:資料外洩。這篇文章非常重要,因為如果你在這裡弄錯了,之前所有漂亮的指標幾乎都毫無價值。
課程目標
- 識別常見的洩漏類型。
- 知道如何進行錯誤分析以了解模型的錯誤所在。
- 培養一種在相信分數之前先檢查模型的心態。
什麼是資料外洩?
當模型在預測時意外看到實際上不允許知道的資訊時,就會發生洩漏,例如,在分割之前對資料進行歸一化或使用目標時間之後的資料建立特徵。
疑似洩漏跡象
- 與專業直覺相比,結果過於美麗。
- 驗證分數非常高,但實際實施卻很差。
- 有些功能聽起來太熟悉了。
錯誤分析
訓練模型後,查看哪些模式預測錯誤最多,錯誤集中在哪些使用者群組,以及是否有任何模式與缺失資料、異常值或特殊細分相關。
快速入住流程
- 檢查哪些功能僅在目標事件之後出現。
- 檢查所有預處理是否都在進行中。
- 查看最嚴重的錯誤和重複出現的錯誤群組。
- 確認資料劃分在時間邏輯或使用者邏輯上是否正確。
常見錯誤
- 只要看看美麗的排行榜,就立刻相信它。
- 不要讀取幾十行實際錯誤資料。
- 忽略預測問題中的時間因素。
練習練習
- 建立自己的小洩漏範例並觀察分數異常增加。
- 返回並正確修復管道。
- 製作20個錯誤預測樣本的誤差分析表。
完成標準
- 偵測至少 3 種常見的洩漏類型。
- 養成查看真實錯誤樣本而不僅僅是查看分數的習慣。
- 知道為什麼分數好的模型可能不可用。
逐步練習(進階)
- 建立資料時間軸來標記要素的建立時間。
- 檢查所有特徵是否違反預測時間。
- 消除可疑洩漏特徵後重新訓練模型。
- 比較之前/之後的指標以量化洩漏影響。
- 對前 30 個最錯誤的預測進行錯誤分析。
應提交工件
- 依時間軸排列的功能審核表。
- 報告洩漏發現和糾正措施。
- 主要錯誤組表及改進建議。
自測題
- 預處理型洩漏與洩漏目標型洩漏有何不同?
- 為什麼太漂亮的模特兒會成為危險訊號?
- 錯誤分析如何幫助選擇改進方向?