AI Agent 安全的真正挑戰:從模型防禦到執行邊界工程
當前對 AI Agent 安全的討論,過度聚焦於模型是否會被欺騙。然而,真正的風險並非模型輸出錯誤的文字,而是當這些錯誤輸出被直接轉化為具備權限的行動時,所引發的連鎖效應。本文將透過 EchoLeak 漏洞的案例,剖析 Agent 安全的核心問題,並主張我們需要將治理重心從模型本身,轉移到建立清晰的審批鏈、權限邊界與可驗證性,也就是「執行邊界工程」。
當前對 AI Agent 安全的討論,經常陷入一個迷思:我們過度聚焦於模型本身是否會被 prompt injection 等手法欺騙。這固然是個問題,但並非核心。我認為,Agentic AI 的真正風險,並非模型偶爾說錯話,而是當這些錯誤、甚至惡意的輸出,被系統直接轉化為具備權限的行動——存取資料、呼叫 API、發送郵件——所引發的連鎖效應。因此,我們的治理重心必須從模型防禦,提升到更宏觀的「執行邊界工程」(execution-boundary engineering),也就是建立清晰的審批鏈、權限邊界與可驗證性。這才是建構可信任 AI 系統的關鍵。
為什麼我們對 Agent 風險的討論經常失焦?
過去一年多,產業的焦點大多放在如何讓大型語言模型(LLM)變得更「聰明」或更「對齊」。我們討論的是模型的幻覺、偏見,以及如何透過各種 prompt engineering 或 fine-tuning 來防堵惡意輸入。這些努力很重要,但它們處理的對象是模型的「認知層」。然而,當 LLM 成為 AI Agent 的大腦時,風險就從認知層蔓延到了「執行層」,這也是學術界在探討 LLM Agent 安全挑戰時的關鍵議題之一。
一個只會聊天的模型,說錯話的後果頂多是提供錯誤資訊。但一個能讀取你的郵件、整理你的檔案、並代你發信的 Agent,一旦被誤導,它的輸出就不再只是文字,而是實際的系統操作。這兩者之間的風險規模有著天壤之別。將 Agent 安全等同於模型安全,就像是把保護國家元首的任務,完全交給一位只負責言詞審查的秘書,卻忽略了周遭的實體維安與授權流程。真正的威脅,往往發生在指令被下達並執行的那一刻。
EchoLeak 漏洞:一個關於執行鏈的警世寓言
2024 年揭露的 Microsoft 365 Copilot 漏洞 EchoLeak (CVE-2024-32711),便是一個極佳的案例,它完美地展示了風險如何從模型滲透到執行層面。這個漏洞的核心並不是 Copilot 的基礎模型不夠聰明或被騙了,而是整個系統處理外部資訊與執行內部指令的流程存在缺陷。
攻擊者可以發送一封精心設計的惡意郵件。當 Copilot 讀取這封郵件時,郵件內容中的隱藏指令會污染模型的上下文。接著,當使用者對 Copilot 下達一個看似無害的指令時(例如「總結我的郵件」),被污染的模型就會產生一個惡意輸出,這個輸出會觸發 Copilot 的內部工具,將使用者的敏感資料(如 OAuth token)外洩到攻擊者指定的伺服器。整個過程,使用者可能毫無察覺。
EchoLeak 的教訓是:即使模型本身沒有被「破解」,一個設計不良的執行鏈,依然能讓 Agent 成為資料外洩的幫兇。問題不在於模型「想」做什麼,而在於系統「允許」它做什麼。
這類攻擊路徑的複雜性,也催生了更系統化的分析框架。例如,Agentic AI Exploit Framework (AAEF) 就提供了一套詞彙來解剖這類攻擊。以 AAEF v0.2.0 的視角來看,EchoLeak 的攻擊鏈涵蓋了從「入侵」(Intrusion)到「執行」(Execution)等多個階段,清楚地表明這是一個系統層級的漏洞,而非單純的模型弱點。
如何建立可治理的執行邊界?
既然問題的根源在於不受控的執行權限,那麼解決方案也必須從這裡著手。我認為,建構一個穩固的「執行邊界」,需要三大支柱:
- 審批鏈 (Approval Chain):並非所有 Agent 的動作都該被自動執行。對於高風險操作,例如刪除大量檔案、分享敏感文件或代表使用者發送重要郵件,系統必須強制介入一個審批環節。這個審批者可以是使用者本人(human-in-the-loop),也可以是另一套基於規則的驗證系統。關鍵在於,在「意圖」與「執行」之間,設立一個明確的檢查點。
- 權限邊界 (Permission Boundary):這源自於資訊安全的「最小權限原則」。AI Agent 被授予的權限,應該僅限於完成當前任務所需的最小範圍。例如,一個被要求總結會議記錄的 Agent,就不應該擁有刪除行事曆或讀取郵件的權限。權限應該是動態、短期的,而非靜態、永久的。Google 在其 AI 安全開發指南中也強調了限制工具權限的重要性。
- 可驗證性 (Verifiability):所有由 Agent 執行的動作,都必須留下清晰、可供審計的紀錄。當出現問題時,我們必須能夠回溯 Agent 的決策過程:它接收到什麼輸入?它基於什麼理由做出判斷?它呼叫了哪個工具?傳遞了什麼參數?缺乏可驗證性,就意味著我們在操作一個無法究責的黑盒子,這在任何嚴肅的生產環境中都是不可接受的。
將這三者結合,我們就能將討論從「如何防止模型被騙?」這個無解的難題,轉向「如何確保即使模型被騙,系統也能將損害控制在最小範圍內?」這個更務實、更具工程意義的問題上。這不僅是技術選擇,更是治理架構的設計哲學。
最終,AI Agent 的信任基礎,並非建立在對模型能力的無限崇拜之上,而是建立在一個穩固、透明且可控的系統架構之上。我們需要的不是一個不會犯錯的 AI,而是一個犯錯時不會造成災難、且能讓我們理解它為何犯錯的系統。這正是「執行邊界工程」的核心價值,也是我們在邁向更自主化 AI 系統時,必須優先解決的課題。
延伸閱讀
- LLM Agent Safety: 一篇探討 LLM Agent 安全挑戰的學術論文。
- Agentic AI Exploit Framework (AAEF): 在 GitHub 上的 AAEF 專案,提供分析 Agent 漏洞的框架。
- CVE-2024-32711: 美國國家漏洞資料庫中關於 EchoLeak 的官方紀錄。
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。