簡介
至此,您已經有了線性模型的良好基礎。本文介紹了面板資料在實務上最強大的一組演算法:決策樹、隨機森林和Boosting。
課程目標
- 了解決策樹、隨機森林和提升的直覺。
- 了解可解釋性、速度和強度之間的權衡。
- 為表格資料選擇正確的基於樹的模型。
決策樹
決策樹依照年齡 > 35 或 num_tickets > 3 等問題來分割資料。優點是易於理解,不需要縮放特徵並捕獲非線性關係。缺點是如果樹太深,很容易過度擬合。
隨機森林
隨機森林是許多決策樹一起投票。與單棵樹相比,它通常可以減少過度擬合,並且是表格數據的非常強大的基線。
XGBoost 和提升
Boosting 依序訓練多棵樹;每棵新樹都專注於糾正前一棵樹的錯誤。因此,提昇在排行榜上通常非常強大,但如果驗證控制不好,也很容易被濫用。
何時使用哪一種模型?
- 決策樹:直覺學習或需要一個非常容易解釋的模型。
- 隨機森林:表格資料的強大基線。
- XGBoost、LightGBM、CatBoost:當您想要認真優化效能時。
常見錯誤
- 從一開始就調整了太多參數。
- 使用特徵重要性作為因果證據。
- 無需查看洩漏或錯誤分析即可信任排行榜。
練習練習
- 在同一資料集上比較邏輯迴歸、隨機森林和 XGBoost。
- 記錄指標、訓練時間、可解釋性。
- 總結哪種模式最適合中小企業環境。
完成標準
- 解釋 bagging 和 boosting 之間的差異。
- 了解基於樹的模型何時比線性模型更強。
- 比較同一問題的至少 3 個模型。
逐步練習(進階)
- 運行 3 個模型:決策樹、隨機森林、XGBoost。
- 保持相同的訓練/驗證分割以進行公平比較。 3、各型號燈光調校(2-3個主要參數)。
- 比較指標、訓練時間和解釋的難易度。
- 撰寫根據資料大小選擇模型的指南。
應提交工件
- 三種模型的基準表。
- 功能重要性圖表有仔細的註釋。
- 根據每個項目背景選擇模型的規則。
自測題
- Bagging 和 Boosting 在誤差減少機制方面有何不同?
- 隨機森林什麼時候比 XGBoost 更好?
- 為什麼特徵重要性不等於因果關係?