Chuyển đến nội dung chính

第 17 課:聚類(K-Means、DBSCAN、分層)

在沒有標籤的情況下進行客戶細分和資料結構發現的無監督學習。

🧠 人工智慧與機器學習 — 第 16 課 第 17 課:聚類(K-Means、DBSCAN、 分層)

機器學習:從基礎到高級

第 3 部分:足以使用的高階演算法

亞洲開發網

簡介

你並不總是有標籤。聚類是一組幫助發現未標記資料中隱藏結構的技術。在實踐中,它經常用於客戶細分、行為分組和數據發現。

課程目標

  • 了解聚類與監督學習有何不同。
  • 了解如何在基礎層面上使用 K 均值。
  • 了解聚類評估的限制。

K 均值如何運作?

  1. 選擇簇數 k。
  2. 將每個點分配給最近的聚類中心。
  3. 再次更新聚類中心。
  4. 重複直至穩定。

適當的實際問題

  • 依照購買行為將客戶分組。
  • 透過嵌入將貼文或使用者分組。
  • 為業務團隊建立細分,以採取不同的行動。

如何選擇簇的數量?

沒有絕對的答案。可以參考肘法、剪影評分以及最重要的商業解讀。

常見錯誤

  • 認為生成的簇始終是自然真理。
  • 選擇 k 只是因為圖表看起來不錯。
  • 不檢查集群的業務意義。

練習練習

  • 對資料集分段運行 K-Means。
  • 用業務語言描述每個集群。
  • 為每個集群建議不同的操作。

完成標準

  • 了解沒有標籤的聚類。
  • 可以使用縮放資料來運行 K-Means。
  • [ ]從業務角度解讀叢集。

逐步練習(進階)

  1. 聚類前對特徵進行歸一化。
  2. 使用多個 k 值運行 K 均值。
  3. 使用輪廓分數和業務解釋進行評估。
  4. 嘗試加入DBSCAN或Hierarchical進行比較。
  5. 根據業務語言為集群命名。

應提交工件

  • 聚類演算法比較表。
  • 描述每個叢集的設定檔(叢集設定檔)。
  • 每個集群的建議操作清單。

自測題

  • 為什麼聚類沒有絕對正確的答案?
  • DBSCAN 在什麼時候比 K-Means 更有利?
  • 如何評價一個集群對業務是否有用?