AI Agent 如何避免敏感資料外洩?資料邊界與防護流程
代理型 AI 一旦能讀取文件、查詢資料庫、呼叫 SaaS 工具或代替人完成工作流程,敏感資料的路徑就不再只有「使用者輸入 → 模型輸出」。資料還可能經過檢索、工具回傳、快取、日誌、第三方服務和人工覆核。外洩通常不是 AI「自己決定」造成,而是系統把資料、權限或輸出通道設計得太寬。
因此,防護重點不只是要求模型「不要洩密」。OWASP 對敏感資訊揭露的說明指出,單靠系統提示詞限制輸出並不可靠;需要資料清理、權限控制、輸入/輸出驗證與完整的信任邊界。本文聚焦防護設計,不提供繞過控制或取得資料的方法。
先畫出敏感資料的生命週期
在串接任何模型或代理前,列出資料從何而來、誰能使用、會到哪裡去、保存多久,以及在每一段可被誰讀取。至少區分個人資料、帳務/合約資料、內部營運資訊、憑證與公開資訊;每一類都要有明確的用途、保留期限和處理責任人。
這個盤點必須包含容易被忽略的副本:檢索索引、向量資料庫、工具回傳內容、測試資料、觀測日誌、客服附件和錯誤追蹤系統。若無法說清楚一段資料為何存在、誰需要它,就不應預設代理可以存取它。
入口:資料最小化與去識別化
代理收到的上下文應只包含完成當前任務真正需要的最小範圍。能以摘要、遮罩、代號、聚合數值或受控查詢取代原始資料時,就不要把完整文件或敏感欄位直接交給模型。密碼、金鑰、一次性驗證碼、完整身分證件與不必要的客戶資料不應進入提示詞、範例、測試集或一般日誌。
對外部文件、電子郵件、網頁與附件,應把內容視為待分析資料,而不是可信指令。它們可以提供事實線索,但不得自行改寫系統規則、資料分類、工具權限或發布政策。
中段:檢索與工具必須各自過濾
檢索系統要先依使用者身分、租戶、資料標籤、任務目的和時間範圍做過濾,再把結果交給模型;不能因為代理「可能有用」就讀取整個知識庫。工具也是一樣:把讀取、草稿、送出、刪除和管理權限分開,預設使用唯讀、最小權限和短效授權。
工具回傳內容也要當作不可信輸入。代理不應把文件或 API 回傳裡的文字直接當成新的控制指令,更不應據此擴大查詢範圍、改變權限或自行啟動高影響操作。
出口:在送出前檢查內容與對象
資料保護的最後一道關卡是輸出。對要寄送、寫入外部系統、建立分享連結或執行交易的動作,先以結構化欄位確認收件者、目的、資料分類與範圍;再依規則進行敏感欄位檢查、遮罩或阻擋。高風險動作必須停在人工確認,而不是讓模型自行判定「看起來安全」。
這不代表所有輸出都要由人逐字審核。可以依資料等級設計不同門檻:公開資訊自動處理、內部資訊需記錄與抽查、受限資訊必須由具權限的人核准。關鍵是規則可說明、可測試、可追溯。
日誌與監控:留下證據,但不要再複製一份秘密
可觀測性對排查事件很重要,但完整提示詞與工具回應常含敏感資料。日誌應先遮罩高風險欄位,以請求 ID、資料分類、工具名稱、決策結果和必要的雜湊或參照資訊取代原文;並設定存取權限、保留期限與定期刪除流程。
監控指標可以追蹤異常的資料量、跨租戶查詢、被阻擋的輸出、工具權限錯誤與人工覆核率。若這些指標突然改變,應觸發調查,而不是只把它當成模型品質波動。
事件處理:先限制擴散,再釐清範圍
若懷疑敏感資料被不當取用或輸出,第一步是依既有事件程序暫停相關代理、撤銷或縮小工具權限、隔離可疑工作階段並保全必要稽核紀錄。接著由資安、隱私、法務與業務責任人依組織程序確認資料類型、影響範圍、通知義務與修復措施。不要為了「快速恢復服務」而刪除調查證據或把事件細節再次貼進不受控的模型。
把防護做成可重複測試的流程
- 使用去識別或合成資料測試代理是否遵守資料標籤與租戶邊界。
- 對每個工具建立允許與拒絕案例,驗證錯誤授權、空白條件與過度範圍都會被安全處理。
- 定期檢查模型、檢索索引、外掛與供應商設定改版後,資料流與輸出控制是否仍有效。
- 保留控制版本、測試結果、例外核准與事件演練紀錄,讓風險能被持續衡量。
NIST 的 AI RMF 強調治理、情境辨識、量測與管理要貫穿系統生命週期;對代理型 AI 而言,這表示資料保護不是單一功能,而是設計、採購、部署、監控與退場時都要重新確認的控制。若想延伸閱讀代理系統的權限與人工覆核,也可以閱讀本站的代理型 AI 企業安全風險文章。















