Chuyển đến nội dung chính

第 23 課:監控、漂移偵測與再培訓

部署後監控品質、偵測偏差、設計再訓練循環和最小化警報。

🧠 人工智慧與機器學習 — 第 22 課 第 23 課:監控、漂移偵測和 再培訓

機器學習:從基礎到高級

第 4 部分:生產、可解釋性和頂點

亞洲開發網

簡介

部署後的模型並沒有靜止不動。使用者資料變化、市場行為變化、產品變化。因此,機器學習系統有責任在部署後監控質量,而不是認為訓練已完成。

課程目標

  • 了解預測漂移、資料漂移和概念漂移。
  • 了解需要監控的最小訊號。
  • 設計一個基本的再訓練循環。

需要追蹤的事情

  • 分配輸入功能。
  • 每個類別的預測率。
  • 當有回饋標籤時模型品質。
  • 延遲、請求錯誤和服務可用性。

漂流的類型

  • 資料漂移:輸入分佈變化。
  • 概念漂移:輸入與目標變化之間的關係。
  • 預測漂移:模型輸出變化異常。

何時重新訓練?

並非每次看到漂移時,您都會立即重新訓練。你需要回答漂移是否真的影響效能,是否有足夠的新的可靠數據來重新訓練,以及重新訓練是否需要在發布前進行人工審核。

對新手的最低限度監控

  • 儀表板追蹤請求和錯誤的數量。
  • 一些重要特徵的分佈圖。
  • 按週或按月追蹤關鍵指標。
  • 當分佈偏差超出閾值時發出警告。

常見錯誤

  • 僅監控基礎設施,但不監控模型品質。
  • 自動重新訓練不檢查迴歸。
  • 不要對資料和模型進行版本控制。

練習練習

  • 設計模型流失或住房的監控清單。
  • 確定必須監控的 5 個指標。
  • 寫一個簡單的重新訓練策略:何時重新訓練、誰批准、如何回滾。

完成標準

  • 區分資料漂移和概念漂移。
  • 建議的最小監控指標集。
  • 制定基本的重新訓練和回溯計畫。

逐步練習(進階)

  1. 選擇一組品質和績效監控指標。
  2. 為5個主要功能設定資料漂移警告閾值。
  3. 模擬漂移場景並觀察警告。
  4. 設計有核准步驟的再訓練流程。
  5. 當新模型較差時編寫回滾劇本。

應提交工件

  • 每週監控清單。
  • 重新訓練和發布模型流程。
  • 模型的事件回應手冊。

自測題

  • 資料漂移和概念漂移有什麼不同?
  • 什麼時候應該定期重新訓練,什麼時候應該根據事件重新訓練?
  • 如果漂移增加但指標並未減少,首先應採取什麼措施?