簡介
這是該系列的第一個小型項目分類。目標不僅僅是訓練流失模型,而是知道如何提出產品問題:預測誰要離開做什麼、將觸發什麼操作、哪些指標真正值得關注。
課程目標
- 制定了比較完整的分類工作流程。
- 建立基線,選擇指標,嘗試多個閾值。
- 從商業角度呈現結果。
問題背景
一家訂閱公司希望預測哪些客戶在未來 30 天內有離開的風險。如果您儘早知道,CS 或行銷團隊可以發送保留獎勵。
推薦程序
1.讀取並檢查資料。 2. 查看客戶流失率是否超標。 3. 建立一個簡單的基線。 4. 先訓練邏輯迴歸。 5.透過混淆矩陣、精確率、召回率、F1、ROC-AUC進行評估。 6.根據業務目標測試閾值。
功能建議
- 終身教職
- 每月費用
- 合約類型
- 支持門票
- 付款方式
- is_auto_renew
框架程式碼
從 sklearn.compose 導入 ColumnTransformer
從 sklearn.pipeline 導入管道
從 sklearn.preprocessing 導入 OneHotEncoder、StandardScaler
從 sklearn.impute 導入 SimpleImputer
從 sklearn.linear_model 導入 LogisticRegression
如何向利害關係人展示
不要只是說「模型達到 F1 = 0.71」。假設模型捕捉了即將流失的客戶的百分比,有多少客戶被錯誤警告,以及保留成本是否合理。
常見錯誤
- 資料超出類別時的準確性指示器。
- 不指定正在使用的閾值。
- 使用攪拌時間後出現的功能,導致洩漏。
練習練習
- 製作一本完整的筆記本來預測客戶流失。
- 選擇 2 個不同的門檻並比較假設的成本/效益。
- 將結論寫成一封簡短的電子郵件發送給 PM。
完成標準
- 具有清晰的基準、主要模型和指標。
- 有關於閾值的解釋。
- 從業務角度而非技術角度得出結論。
逐步練習(進階)
- 設計具有明確預測視窗時間的流失目標變數。
- 根據業務規則(基於規則)建立基準。
- 訓練至少2個模型:Logistic + Tree-based。 4.根據假設的保留成本優化閾值。
- 為業務團隊撰寫簡短的執行摘要。
應提交工件
- 帶管道的端到端筆記本。
- Markdown 文件總結了成本假設。
- 行動清單表:哪一組需要先介入。
自測題
- 流失標籤在哪一步可能會洩漏?
- 為什麼我們在 ML 模型之前需要一個基於規則的基準?
- 如何選擇哪個門檻更接近利潤目標?