はじめに
正のクラスが非常にまれであるため、標準的な分類をトレーニングするのに十分なラベルがほとんどないという問題があります。たとえば、不正行為、動作異常、センサー エラーの検出などです。その場合、異常検出は検討に値する方向です。
レッスンの目標
- 異常検出と分類がどのように異なるかを理解します。
- Isolation Forest などの入門テクニックを理解します。
- ビジネスの状況における異常を評価する方法を知っています。
核となる直感
外れ値とは、残りのデータとは意味のある形で異なる値です。重要なのは、異なることが必ずしも悪いことではないということです。したがって、異常検出は常に運用コンテキストと結び付ける必要があります。
孤立の森
直感的なアイデア: ツリーをランダムに分割すると、外れ値がより早く分離されることがよくあります。点の分離が容易であればあるほど、それが異常である可能性が高くなります。
モデルを評価する
限られたラベルのセットが必要になる場合があり、ビジネスの専門家と一緒に上位のアラームを確認し、誤ったアラームのコストと誤ったアラームを見逃した場合のコストを測定します。
よくある間違い
- すべての異常値を重要な異常と呼びます。
- ドメインの専門家に確認されていません。
- 運用への影響を考慮せず、任意に閾値を使用します。
練習問題を練習する
- トランザクション データセットで Isolation Forest を実行します。
- 最も珍しい点トップ 20 を確認してください。
- コメントを書く: どの警告が妥当で、どの警告が誤報である可能性があるか。
完了基準
- 異常検出を理解するには、単に目で異常値を見つけるだけではありません。
- Isolation Forest のような基本モデルの使用方法を理解します。
- 評価を実際の運用コストに関連付けます。
段階的に練習する (上級)
- 特定の問題における異常とは何かを明確に定義します。
- いくつかのレベルの汚染で Isolation Forest を実行します。
- 手動レビューにより上位の異常スコアを確認します。
- 構成間の誤警報を比較します。
- 実際の動作上の警告しきい値を提案します。
アーティファクトを送信する必要があります
- 説明付きの上位異常のリスト。
- 誤検知の運用影響表。
- 提案された警告トリアージ手順。
セルフテストの質問
- 統計的な外れ値とビジネスの異常の違いは何ですか?
- 状況に応じて汚染を調整する必要があるのはなぜですか?
- 異常レビューに人間参加者が必要になるのはどのような場合ですか?