はじめに
この時点で、線形モデルの基礎が整いました。この記事では、実際のパネル データ用の最も強力なアルゴリズム グループ、つまりデシジョン ツリー、ランダム フォレスト、およびブースティングを紹介します。
レッスンの目標
- デシジョン ツリー、ランダム フォレスト、ブースティングの直感を理解します。
- 説明可能性、スピード、強度の間のトレードオフを理解します。
- テーブル データに適切なツリーベースのモデルを選択します。
デシジョン ツリー
デシジョン ツリーは、年齢 > 35 または num_tickets > 3 などの質問によってデータを分割します。利点は、理解しやすく、特徴をスケーリングする必要がなく、非線形関係をキャプチャできることです。欠点は、ツリーが深すぎると過剰適合しやすいことです。
ランダムフォレスト
ランダム フォレストは、一緒に投票する多数の決定木です。多くの場合、単一ツリーと比較して過剰適合が軽減され、表形式データの非常に強力なベースラインとなります。
XGBoost とブースト
ブーストでは複数のツリーを順番にトレーニングします。新しいツリーはそれぞれ、前のツリーのエラーを修正することに重点を置いています。したがって、ブーストはリーダーボードでは非常に強力であることがよくありますが、検証が適切に制御されていない場合は簡単に悪用される可能性もあります。
どのモデルをいつ使用するか?
- デシジョン ツリー: 直感的に学習するか、非常に説明しやすいモデルが必要です。
- ランダム フォレスト: 表形式データの強力なベースライン。
- XGBoost、LightGBM、CatBoost: パフォーマンスを真剣に最適化したい場合。
よくある間違い
- 最初からパラメーターを調整しすぎています。
- 特徴の重要性を原因と結果の証拠として使用します。
- リークやエラー分析を表示せずにリーダーボードを信頼します。
練習問題を練習する
- 同じデータセットでロジスティック回帰、ランダム フォレスト、および XGBoost を比較します。
- 指標、トレーニング時間、説明可能性を記録します。
- 中小企業環境に最適なモデルを決定します。
完了基準
- バギングとブースティングの違いを説明します。
- ツリーベースのモデルが線形モデルよりも強力であることを認識します。
- 同じ問題について少なくとも 3 つのモデルを比較します。
段階的に練習する (上級)
- 3 つのモデルを実行します: デシジョン ツリー、ランダム フォレスト、XGBoost。
- 公平な比較のために、同じトレーニング/検証分割を維持します。
- 各モデルのライトチューニング (2 ~ 3 つの主要パラメータ)。
- メトリクス、トレーニング時間、解釈のしやすさを比較します。
- データサイズに応じたモデル選択のガイドラインを作成します。
アーティファクトを送信する必要があります
- 3 つのモデルのベンチマーク表。
- 機能重要度チャートには丁寧な注釈が付いています。
- 各プロジェクトのコンテキストに応じてモデルを選択するためのルール。
セルフテストの質問
- エラー削減メカニズムの点で、バギングとブースティングはどのように異なりますか?
- ランダム フォレストが XGBoost よりも優れているのはどのような場合ですか?
- 特徴の重要性が原因と結果と同義ではないのはなぜですか?