簡介
當資料的維度太多時,就很難看到、難以繪製,有時甚至很難建模。 PCA、t-SNE 和 UMAP 有助於降低資料維度,但用途不同。
課程目標
- 區分 PCA 與 t-SNE 和 UMAP。
- 知道何時使用它進行維度壓縮以及何時使用它進行視覺化。
- 避免誤解降維圖。
主成分分析
PCA 找到保留資料最大變異數的新軸。這是一種快速、線性的技術,相對容易解釋,並且在降低輸入維度方面非常有用。
t-SNE 和 UMAP
t-SNE 和 UMAP 主要用於視覺化高維度資料中的局部結構。 UMAP 通常速度更快且非常適合嵌入;用於視覺化本地叢集的強大 t-SNE。
解釋警告
降維後的二維圖表上的距離並不總是反映原始空間中的真實距離。不要使用漂亮的圖表作為結論的有力證據。
常見錯誤
- 使用t-SNE或UMAP作為主要特徵輸入而沒有仔細檢查。
- 將圖解釋為真正的類別邊界。
- 需要時,不要在 PCA 之前縮放資料。
練習練習
- 在相同資料集上執行 PCA 和 t-SNE。
- 為兩者繪製二維圖。
- 寫評論:哪個工具更適合視覺化,哪個工具更適合預處理。
完成標準
- [ ]區分PCA、t-SNE、UMAP的用途。
- 不要過度解釋降維圖。
- 了解如何為正確的目的選擇工具。
逐步練習(進階)
- 執行保留 90% 變異數的 PCA。
- 使用 2D PCA 進行資料視覺化。
- 在同一輸入嵌入上執行 t-SNE 和 UMAP。 4.運行時和群集鏡像穩定性比較。
- 為儀表板查看者撰寫解釋性警告。
應提交工件
- 3 種技術的視覺效果。
- 比較使用每種技巧的目標的表格。
- 根據用例選擇降維工具的說明。
自測題
- PCA 在再現性方面有哪些優勢?
- 為什麼t-SNE不適合作為主要特徵?
- UMAP 何時優於 t-SNE?