Chuyển đến nội dung chính

第 15 課:護欄與安全 — 保護特工免受“叛亂”

及時注入防禦、輸出驗證、PII 過濾。 Guardrails 框架:NeMo Guardrails、Guardrails AI。人機互動模式。速率限制和成本控制。

🧠 人工智慧與機器學習 — 第 14 課 第 15 課:護欄與安全 — 保護人員 來自“叛逆”

建構 AI 代理:從零到生產

第 6 部分:生產與實際部署

亞洲開發網

簡介

特工有權採取行動——這意味著錯誤的特工可能會造成真正的損害:刪除文件、發送錯誤的電子郵件、洩露資料。安全並不是可有可無的-它是強制性要求。


1. 威脅

1.1 及時注射

使用者故意提供隱藏指令來劫持代理行為。

1.2 工具濫用

代理以錯誤的方式呼叫該工具:刪除而不是選擇,將電子郵件傳送給錯誤的人。

1.3 資料外洩

代理在回應中意外暴露了敏感資料。

2. 防禦層

class GuardedAgent:
    def run(self, user_input):
        # Layer 1: Input validation
        if self.detect_injection(user_input):
            return "Suspicious input detected"
        
        # Layer 2: Tool permission check
        # Only allow approved tools
        
        # Layer 3: Output filtering
        output = self.agent.run(user_input)
        output = self.filter_pii(output)
        
        # Layer 4: Human approval for risky actions
        if self.is_risky_action(output):
            return self.request_human_approval(output)
        
        return output

總結

  • 代理安全=輸入驗證+工具權限+輸出過濾+手動批准
  • 及時注射是威脅#1
  • 未經批准切勿授予代理刪除/更新權限
  • 成本控制防止支出失控
  • 高風險決策的人機參與

練習

  1. 實作提示注入偵測器
  2. 建立工具的權限系統(唯讀 vs 讀寫)
  3. 實施 PII 過濾器(屏蔽電子郵件、電話號碼)
  4. 建立人機互動的審批流程