Chuyển đến nội dung chính

第 14 課:資料外洩與錯誤分析(必修)

識別常見的洩漏,調查錯誤預測模式,並根據實際錯誤而不是猜測來計劃改進。

🧠 人工智慧與機器學習 — 第 13 課 第14課:資料外洩&錯誤分析(catch 被迫)

機器學習:從基礎到高級

第 2 部分:業界標準工作流程

亞洲開發網

簡介

許多模型取得了不錯的成績,但無法在現實環境中生存,原因有一個很基本的原因:資料外洩。這篇文章非常重要,因為如果你在這裡弄錯了,之前所有漂亮的指標幾乎都毫無價值。

課程目標

  • 識別常見的洩漏類型。
  • 知道如何進行錯誤分析以了解模型的錯誤所在。
  • 培養一種在相信分數之前先檢查模型的心態。

什麼是資料外洩?

當模型在預測時意外看到實際上不允許知道的資訊時,就會發生洩漏,例如,在分割之前對資料進行歸一化或使用目標時間之後的資料建立特徵。

疑似洩漏跡象

  • 與專業直覺相比,結果過於美麗。
  • 驗證分數非常高,但實際實施卻很差。
  • 有些功能聽起來太熟悉了。

錯誤分析

訓練模型後,查看哪些模式預測錯誤最多,錯誤集中在哪些使用者群組,以及是否有任何模式與缺失資料、異常值或特殊細分相關。

快速入住流程

  1. 檢查哪些功能僅在目標事件之後出現。
  2. 檢查所有預處理是否都在進行中。
  3. 查看最嚴重的錯誤和重複出現的錯誤群組。
  4. 確認資料劃分在時間邏輯或使用者邏輯上是否正確。

常見錯誤

  • 只要看看美麗的排行榜,就立刻相信它。
  • 不要讀取幾十行實際錯誤資料。
  • 忽略預測問題中的時間因素。

練習練習

  • 建立自己的小洩漏範例並觀察分數異常增加。
  • 返回並正確修復管道。
  • 製作20個錯誤預測樣本的誤差分析表。

完成標準

  • 偵測至少 3 種常見的洩漏類型。
  • 養成查看真實錯誤樣本而不僅僅是查看分數的習慣。
  • 知道為什麼分數好的模型可能不可用。

逐步練習(進階)

  1. 建立資料時間軸來標記要素的建立時間。
  2. 檢查所有特徵是否違反預測時間。
  3. 消除可疑洩漏特徵後重新訓練模型。
  4. 比較之前/之後的指標以量化洩漏影響。
  5. 對前 30 個最錯誤的預測進行錯誤分析。

應提交工件

  • 依時間軸排列的功能審核表。
  • 報告洩漏發現和糾正措施。
  • 主要錯誤組表及改進建議。

自測題

  • 預處理型洩漏與洩漏目標型洩漏有何不同?
  • 為什麼太漂亮的模特兒會成為危險訊號?
  • 錯誤分析如何幫助選擇改進方向?