簡介
你並不總是有標籤。聚類是一組幫助發現未標記資料中隱藏結構的技術。在實踐中,它經常用於客戶細分、行為分組和數據發現。
課程目標
- 了解聚類與監督學習有何不同。
- 了解如何在基礎層面上使用 K 均值。
- 了解聚類評估的限制。
K 均值如何運作?
- 選擇簇數 k。
- 將每個點分配給最近的聚類中心。
- 再次更新聚類中心。
- 重複直至穩定。
適當的實際問題
- 依照購買行為將客戶分組。
- 透過嵌入將貼文或使用者分組。
- 為業務團隊建立細分,以採取不同的行動。
如何選擇簇的數量?
沒有絕對的答案。可以參考肘法、剪影評分以及最重要的商業解讀。
常見錯誤
- 認為生成的簇始終是自然真理。
- 選擇 k 只是因為圖表看起來不錯。
- 不檢查集群的業務意義。
練習練習
- 對資料集分段運行 K-Means。
- 用業務語言描述每個集群。
- 為每個集群建議不同的操作。
完成標準
- 了解沒有標籤的聚類。
- 可以使用縮放資料來運行 K-Means。
- [ ]從業務角度解讀叢集。
逐步練習(進階)
- 聚類前對特徵進行歸一化。
- 使用多個 k 值運行 K 均值。
- 使用輪廓分數和業務解釋進行評估。
- 嘗試加入DBSCAN或Hierarchical進行比較。
- 根據業務語言為集群命名。
應提交工件
- 聚類演算法比較表。
- 描述每個叢集的設定檔(叢集設定檔)。
- 每個集群的建議操作清單。
自測題
- 為什麼聚類沒有絕對正確的答案?
- DBSCAN 在什麼時候比 K-Means 更有利?
- 如何評價一個集群對業務是否有用?