簡介
特工有權採取行動——這意味著錯誤的特工可能會造成真正的損害:刪除文件、發送錯誤的電子郵件、洩露資料。安全並不是可有可無的-它是強制性要求。
1. 威脅
1.1 及時注射
使用者故意提供隱藏指令來劫持代理行為。
1.2 工具濫用
代理以錯誤的方式呼叫該工具:刪除而不是選擇,將電子郵件傳送給錯誤的人。
1.3 資料外洩
代理在回應中意外暴露了敏感資料。
2. 防禦層
class GuardedAgent:
def run(self, user_input):
# Layer 1: Input validation
if self.detect_injection(user_input):
return "Suspicious input detected"
# Layer 2: Tool permission check
# Only allow approved tools
# Layer 3: Output filtering
output = self.agent.run(user_input)
output = self.filter_pii(output)
# Layer 4: Human approval for risky actions
if self.is_risky_action(output):
return self.request_human_approval(output)
return output
總結
- 代理安全=輸入驗證+工具權限+輸出過濾+手動批准
- 及時注射是威脅#1
- 未經批准切勿授予代理刪除/更新權限
- 成本控制防止支出失控
- 高風險決策的人機參與
練習
- 實作提示注入偵測器
- 建立工具的權限系統(唯讀 vs 讀寫)
- 實施 PII 過濾器(屏蔽電子郵件、電話號碼)
- 建立人機互動的審批流程