Chuyển đến nội dung chính

第 19 課:真實系統中的異常偵測

隔離森林、One-Class SVM 並設計詐欺警告規則、日誌監控、品質控制。

🧠 人工智慧與機器學習 — 第 18 課 第 19 課:系統中的異常檢測 真的

機器學習:從基礎到高級

第 3 部分:足以使用的高階演算法

亞洲開發網

簡介

存在的问题是,正类非常罕见,几乎没有足够的标签来训练标准分类,例如检测欺诈、操作异常、传感器错误。那麼異常檢測就是一個值得考慮的方向。

課程目標

  • 了解異常檢測與分類有何不同。
  • 了解一些入門技術,例如隔離森林。
  • 了解如何評估業務環境中的異常情況。

核心直觉

異常值是指與其他數據有意義差異的數據。關鍵是,不同並不總是壞事。因此,異常檢測始終需要與操作環境連結。

隔离森林

直觀的想法:在樹的隨機分割中,異常值通常可以更快被隔離。一個點越容易分離,它就越有可能成為異常點。

评估模型

您可能需要一組有限的標籤,與業務專家一起查看最重要的警報,並衡量錯誤警報的成本與錯過警報的成本。

常見錯誤

  • 將每個異常值稱為重要異常值。
  • 未與領域專家確認。
  • 任意使用閾值,不考慮操作影響。

練習練習

  • 在交易資料集上執行隔離森林。
  • 找出 20 個最不尋常的點進行回顧。
  • 撰寫評論:哪些警告是合理的,哪些警告可能是誤報。

完成標準

  • 理解異常檢測不只是用眼睛發現異常值。
  • 了解如何使用隔離森林等基本模型。
  • 將評估與實際營運成本連結起來。

逐步練習(進階)

  1. 明確定義特定問題中的異常是什麼。
  2. 運作具有多個污染等級的隔離森林。
  3. 透過人工審核查看異常分數最高的分數。
  4. 比較配置之間的誤報。
  5. 提出實際操作警告閾值。

應提交工件

  • 主要異常現象列表及解釋。
  • 誤報的營運影響表。
  • 提議的警告分類程序。

自測題

  • 統計異常值和業務異常有什麼區別?
  • 為什麼污染需要視情況進行調整?
  • 何時需要人機參與進行異常審查?