簡介
存在的问题是,正类非常罕见,几乎没有足够的标签来训练标准分类,例如检测欺诈、操作异常、传感器错误。那麼異常檢測就是一個值得考慮的方向。
課程目標
- 了解異常檢測與分類有何不同。
- 了解一些入門技術,例如隔離森林。
- 了解如何評估業務環境中的異常情況。
核心直觉
異常值是指與其他數據有意義差異的數據。關鍵是,不同並不總是壞事。因此,異常檢測始終需要與操作環境連結。
隔离森林
直觀的想法:在樹的隨機分割中,異常值通常可以更快被隔離。一個點越容易分離,它就越有可能成為異常點。
评估模型
您可能需要一組有限的標籤,與業務專家一起查看最重要的警報,並衡量錯誤警報的成本與錯過警報的成本。
常見錯誤
- 將每個異常值稱為重要異常值。
- 未與領域專家確認。
- 任意使用閾值,不考慮操作影響。
練習練習
- 在交易資料集上執行隔離森林。
- 找出 20 個最不尋常的點進行回顧。
- 撰寫評論:哪些警告是合理的,哪些警告可能是誤報。
完成標準
- 理解異常檢測不只是用眼睛發現異常值。
- 了解如何使用隔離森林等基本模型。
- 將評估與實際營運成本連結起來。
逐步練習(進階)
- 明確定義特定問題中的異常是什麼。
- 運作具有多個污染等級的隔離森林。
- 透過人工審核查看異常分數最高的分數。
- 比較配置之間的誤報。
- 提出實際操作警告閾值。
應提交工件
- 主要異常現象列表及解釋。
- 誤報的營運影響表。
- 提議的警告分類程序。
自測題
- 統計異常值和業務異常有什麼區別?
- 為什麼污染需要視情況進行調整?
- 何時需要人機參與進行異常審查?