簡介
學習 ML 不僅僅是為了獲得更好的成績。在訓練集上很強但在新資料上很弱的模型是尚未準備好用於實際使用的模型。本文可協助您透過非常具體的跡象來發現過度擬合和欠擬合。
課程目標
- 區分過度擬合和欠擬合。
- 知道如何一起讀取訓練分數和驗證分數。
- 當模型沒有正確學習時,有一個清單可以處理。
什麼是欠擬合?
當模型太簡單或特徵太差時,就會出現欠擬合,導致即使在訓練集上也無法很好地學習訊號。
什麼是過度擬合?
當模型同時學習真實訊號和訓練集的獨特雜訊時,就會發生過度擬合。
典型跡象:
- 火車分數非常高。
- 驗證分數顯然很低。
- 每次更改分割時,結果都會大幅波動。
如何務實處理
欠擬合時:加入有用的特徵,使用更強的模型,如果是迭代演算法,則訓練時間更長。
過度擬合時:降低模型複雜性、添加正規化、增加資料或使用交叉驗證。
學習曲線
學習曲線顯示,如果增加數據,模型可能會得到改善。這是比猜測更好的診斷方法。
常見錯誤
- 在沒有適當驗證的情況下不斷增加模型複雜度。
- 運行多次,然後選擇最佳分割。
- 修復基於測試集的功能。
練習練習
- 訓練 3 個模型,其複雜度不斷增加。
- 記錄訓練分數和驗證分數。
- 結論哪個模型欠擬合,哪個模型過擬合,哪個模型最合理。
完成標準
- 用日常語言解釋兩個概念。
- 知道如何理解訓練和驗證之間的差異。
- 針對每種情況提出至少 2 個解決方案。
逐步練習(進階)
- 訓練三個複雜度不斷增加的模型。
- 收集每個模型的訓練/驗證分數。 3.根據訓練資料量繪製學習曲線。
- 嘗試正規化或減少模型深度。 5.記錄編輯前後的變化。
應提交工件
- 學習曲線圖。
- 調整前後的比較表。
- 適用於以下項目的過度擬合決策清單。
自測題
- 哪一個標誌最能區分欠擬合和過擬合?
- 為什麼更多的數據可以減少過度擬合?
- 什麼時候降低模型複雜度是最合理的選擇?