簡介
部署後的模型並沒有靜止不動。使用者資料變化、市場行為變化、產品變化。因此,機器學習系統有責任在部署後監控質量,而不是認為訓練已完成。
課程目標
- 了解預測漂移、資料漂移和概念漂移。
- 了解需要監控的最小訊號。
- 設計一個基本的再訓練循環。
需要追蹤的事情
- 分配輸入功能。
- 每個類別的預測率。
- 當有回饋標籤時模型品質。
- 延遲、請求錯誤和服務可用性。
漂流的類型
- 資料漂移:輸入分佈變化。
- 概念漂移:輸入與目標變化之間的關係。
- 預測漂移:模型輸出變化異常。
何時重新訓練?
並非每次看到漂移時,您都會立即重新訓練。你需要回答漂移是否真的影響效能,是否有足夠的新的可靠數據來重新訓練,以及重新訓練是否需要在發布前進行人工審核。
對新手的最低限度監控
- 儀表板追蹤請求和錯誤的數量。
- 一些重要特徵的分佈圖。
- 按週或按月追蹤關鍵指標。
- 當分佈偏差超出閾值時發出警告。
常見錯誤
- 僅監控基礎設施,但不監控模型品質。
- 自動重新訓練不檢查迴歸。
- 不要對資料和模型進行版本控制。
練習練習
- 設計模型流失或住房的監控清單。
- 確定必須監控的 5 個指標。
- 寫一個簡單的重新訓練策略:何時重新訓練、誰批准、如何回滾。
完成標準
- 區分資料漂移和概念漂移。
- 建議的最小監控指標集。
- 制定基本的重新訓練和回溯計畫。
逐步練習(進階)
- 選擇一組品質和績效監控指標。
- 為5個主要功能設定資料漂移警告閾值。
- 模擬漂移場景並觀察警告。
- 設計有核准步驟的再訓練流程。
- 當新模型較差時編寫回滾劇本。
應提交工件
- 每週監控清單。
- 重新訓練和發布模型流程。
- 模型的事件回應手冊。
自測題
- 資料漂移和概念漂移有什麼不同?
- 什麼時候應該定期重新訓練,什麼時候應該根據事件重新訓練?
- 如果漂移增加但指標並未減少,首先應採取什麼措施?