多 Agent 協作的規模化瓶頸:從對話到文件
當前對多 Agent 系統的想像,常圍繞在複雜的對話流程,但這種模式很快會遇到成本與協調的瓶頸。本文主張,Agent 協作的關鍵不在於增加對話回合,而是設計共享的狀態與文件介面。當協作規模化時,以文件為中心的非同步協調,將成為比點對點即時通訊更低成本、更可審計、更具治理性的架構基礎。
多 Agent 的瓶頸往往不是模型數量,而是協作資訊在規模擴大後失去共同脈絡。把文件設計成共享狀態與決策證據的介面,可以減少冗餘通訊、降低 Token 成本,並讓協作過程保有可追溯、可審計與可回溯的治理基礎。
為什麼多數 Agent 協作會陷入溝通困境?
目前主流的 Agent 協作框架,例如微軟的 AutoGen,常採用「群聊」模式。一個用戶代理(User Proxy Agent)提出需求,多個專家代理(Expert Agents)在一個共享的對話空間中輪流發言,直到任務完成。這種模式在處理相對簡單、邊界清晰的任務時非常直觀有效。然而,一旦團隊規模擴大或任務複雜度提升,問題便隨之浮現。
首先是成本問題。每一次對話輪轉,都意味著大量的 Token 消耗。在一個 N 個 Agent 的團隊中,若採用廣播式的溝通,通訊成本會隨著 Agent 數量與互動頻率急劇上升。更重要的是,不斷增長的對話歷史很快會超出模型的上下文視窗限制(例如 GPT-4 Turbo 的 128k context window),導致 Agent「遺忘」早期的重要資訊,進而影響決策品質。
這種點對點的密集通訊,本質上是一種高成本、低效率的同步機制。它要求所有 Agent 持續關注對話流,卻往往產生了大量冗餘資訊,反而拖慢了整體效率。
協調的媒介,決定了系統複雜度的上限。當溝通本身成為負擔,我們需要的不是更好的對話者,而是更好的協作基礎設施。
共享文件:如何成為更優越的協調層?
將協調的重心從「對話」轉移到「文件」,並非一個全新的概念。這其實呼應了經典 AI 中的「黑板系統(Blackboard System)」架構。在這個模型中,各領域的專家(Agents)不直接對話,而是共同讀寫一個共享的知識庫(黑板),非同步地貢獻自己的解決方案。每個 Agent 只需關注黑板上與自己相關的資訊變化,大幅降低了通訊的複雜性。
在現代 Agent 架構中,這塊「黑板」就是結構化的共享文件或資料庫。一個優秀的案例是 MetaGPT 框架,它將軟體開發流程標準化,讓不同角色的 Agent(如產品經理、架構師、工程師)產出標準化的文件,例如產品需求文件(PRD)、技術設計文件與 API 文件。這些文件成為 Agent 之間唯一的溝通介面。這種做法帶來幾個顯著優勢:
- 降低成本: Agent 不再需要處理冗長的對話歷史,只需讀取結構化的文件,Token 消耗大幅降低。
- 持久化與可審計性: 所有決策過程與中間產物都被記錄在文件中,形成了清晰、可追溯的紀錄。這對於後續的除錯、優化與治理至關重要。
- 非同步與解耦: Agent 可以獨立、非同步地工作,只要遵循共同的文件格式即可。這使得系統更容易擴展,也更容易替換或升級單一 Agent。
MetaGPT 的實驗結果也證明了此模式的有效性,它在 HumanEval 編碼基準測試中達到了 87.7% 的高分,顯示結構化協作能夠產出高品質的成果。
如何設計以文件為中心的協作架構?
從對話轉向文件,意味著我們需要更謹慎地設計 Agent 之間的「介面」。這不僅是技術選擇,更是對協作流程的重新思考。這也與吳恩達(Andrew Ng)提出的 Agentic Workflows 概念不謀而合,即從單一模型的 Prompt Engineering 轉向設計多個 Agent 的協作流程。
一個穩健的以文件為中心的架構,應包含幾個關鍵元素:
- 結構化的文件範本(Structured Templates): 為不同類型的任務定義清晰、標準化的文件格式與綱要,確保 Agent 的產出一致且可被其他 Agent 解析。
- 狀態管理與版本控制(State & Version Control): 共享文件本身就是系統的狀態。需要引入類似 Git 的版本控制機制,追蹤文件的變更歷史,並處理可能發生的衝突。諸如 LangGraph 這樣的工具,正是將狀態機的概念引入 Agent 協作,這與文件導向的思維非常契合。
- 觸發與通知機制(Triggers & Notifications): 當文件被更新時,需要有機制能選擇性地通知相關的 Agent 採取行動,而非對所有 Agent 進行廣播。
近期一篇在 arXiv 上的研究(2608.16801)透過時序網路分析,量化了不同協作模式下的通訊成本。其初步發現支持了這個觀點:隨著 Agent 團隊規模從 5 個擴展到 15 個以上,採用共享文件策略的團隊,其點對點通訊密度顯著降低,總體 Token 成本節省超過 60%。
這證明了文件不僅是理論上更優雅的方案,在實務上也具備顯著的經濟效益。最終,一個成熟的多 Agent 系統,其內部溝通看起來可能不會像一群人熱烈討論,而更像一個紀律嚴明、透過文檔與 API 高效協作的工程組織。
延伸閱讀
- AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation Framework
- MetaGPT: Meta Programming for Multi-Agent Collaborative Framework
- Agentic Design Patterns by Andrew Ng
- LangGraph Official Documentation
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。