Chuyển đến nội dung chính

第 18 課:PCA、t-SNE、UMAP 用於視覺化

降低資料維度以了解叢集、檢測異常並提高下游模型效能。

🧠 人工智慧與機器學習 — 第 17 課 第 18 課:PCA、t-SNE、UMAP 用於視覺化

機器學習:從基礎到高級

第 3 部分:足以使用的高階演算法

亞洲開發網

簡介

當資料的維度太多時,就很難看到、難以繪製,有時甚至很難建模。 PCA、t-SNE 和 UMAP 有助於降低資料維度,但用途不同。

課程目標

  • 區分 PCA 與 t-SNE 和 UMAP。
  • 知道何時使用它進行維度壓縮以及何時使用它進行視覺化。
  • 避免誤解降維圖。

主成分分析

PCA 找到保留資料最大變異數的新軸。這是一種快速、線性的技術,相對容易解釋,並且在降低輸入維度方面非常有用。

t-SNE 和 UMAP

t-SNE 和 UMAP 主要用於視覺化高維度資料中的局部結構。 UMAP 通常速度更快且非常適合嵌入;用於視覺化本地叢集的強大 t-SNE。

解釋警告

降維後的二維圖表上的距離並不總是反映原始空間中的真實距離。不要使用漂亮的圖表作為結論的有力證據。

常見錯誤

  • 使用t-SNE或UMAP作為主要特徵輸入而沒有仔細檢查。
  • 將圖解釋為真正的類別邊界。
  • 需要時,不要在 PCA 之前縮放資料。

練習練習

  • 在相同資料集上執行 PCA 和 t-SNE。
  • 為兩者繪製二維圖。
  • 寫評論:哪個工具更適合視覺化,哪個工具更適合預處理。

完成標準

  • [ ]區分PCA、t-SNE、UMAP的用途。
  • 不要過度解釋降維圖。
  • 了解如何為正確的目的選擇工具。

逐步練習(進階)

  1. 執行保留 90% 變異數的 PCA。
  2. 使用 2D PCA 進行資料視覺化。
  3. 在同一輸入嵌入上執行 t-SNE 和 UMAP。 4.運行時和群集鏡像穩定性比較。
  4. 為儀表板查看者撰寫解釋性警告。

應提交工件

  • 3 種技術的視覺效果。
  • 比較使用每種技巧的目標的表格。
  • 根據用例選擇降維工具的說明。

自測題

  • PCA 在再現性方面有哪些優勢?
  • 為什麼t-SNE不適合作為主要特徵?
  • UMAP 何時優於 t-SNE?