從 Claude Code 的成本陷阱談起:多代理系統的智慧調度與治理
多代理(multi-agent)系統的價值,來自精準分工與資源調度,而非無腦擴張。當我們讓子代理無條件繼承最強、也最昂貴的父模型,即使是處理讀取設定檔這類簡單任務,也會造成巨大的成本浪費。真正成熟的 AI 系統架構,應該具備成本感知的路由能力,讓任務的難度、風險與模型的等級形成分層匹配,這才是通往可持續、可治理 AI 的唯一路徑。
當我們談論 AI Agent 的潛力時,往往著眼於其自主規劃與執行複雜任務的能力,特別是多代理(multi-agent)協作所展現的強大動能。然而,這種能力的背後隱藏著一個容易被忽視、卻足以扼殺專案的陷阱:失控的運算成本。許多框架的預設行為,是讓所有子任務無條件繼承最強、也最昂貴的父模型,這導致了巨大的資源浪費。真正成熟的代理系統,其價值不在於無腦擴張,而在於建立一套智慧的、具成本意識的任務調度(task routing)機制,讓任務的難度、風險與模型等級形成精準的分層匹配。
為什麼多代理系統的成本容易失控?
這個問題在實際開發中非常普遍。以 Anthropic 的 Claude Code 這類具備子代理(sub-agent)功能的工具為例,開發者可以輕易地讓主代理(parent agent)將一個大任務拆解成數個小任務,並行交給不同的子代理處理。例如,一個主代理負責「分析整個程式碼庫的技術債」,它可以生成五個子代理,分別去分析五個不同的模組。
這種模式效率極高,但問題隨之而來。預設情況下,這些子代理會直接繼承父代理所使用的模型。如果父代理為了確保最高的推理品質而使用了最強大的 Claude 3 Opus,那麼所有子代理,即使它執行的只是一個「讀取 package.json 檔案並回傳相依性列表」的簡單任務,也會使用同樣昂貴的 Opus 模型。這就像是動用一支特種部隊去執行交通指揮,雖然能完成任務,但成本效益完全不成比例。
根據 Anthropic 官方公布的模型定價,截至 2024 年中,Claude 3 Opus 的輸入成本大約是 Haiku 的 60 倍。這意味著一個原本用 Haiku 只需花費 1 美分的簡單 API 呼叫,在這種「繼承」模式下會暴增到 0.6 美元。當代理系統一天需要處理成千上萬個這樣的子任務時,成本差異將會是毀滅性的。
真正的挑戰,不在於讓最強的模型解決所有問題,而在於建立一個能判斷「哪個問題」值得動用最強模型的智慧系統。
如何建立成本感知的代理調度(Agent Routing)?
解決方案的核心,是從「單一模型走天下」的思維,轉向「分層模型匹配任務」的治理架構。我們需要在主代理與子代理之間,插入一個「調度層」(dispatching layer)或稱為「路由器代理」(router agent)。這個調度器的唯一職責,就是評估子任務的性質,並為它選擇最適合、最具成本效益的模型。
這個概念並非天馬行空,它借鑒了許多成熟的軟體工程與 AI 架構模式,例如微服務架構中的 API 閘道器,或是更前沿的混合專家模型(Mixture-of-Experts, MoE)思想。一個基礎的調度策略可以這樣設計:
- 任務複雜度評估: 透過關鍵字、任務描述長度或更複雜的分類模型,判斷任務是屬於「資料擷取」、「格式轉換」、「程式碼生成」還是「策略規劃」。
- 模型分層指派:
- 低階任務:如讀取檔案、解析 JSON、簡單的字串操作。這些任務應該被分配給最便宜、最快的模型,例如 Claude 3 Haiku,甚至是傳統的非 LLM 工具(如正規表示式或靜態分析器)。
- 中階任務:如程式碼註解生成、文件摘要、API 呼叫的初步草擬。這些可以交給性價比均衡的模型,如 Claude 3 Sonnet 或 GPT-4o mini。
- 高階任務:需要複雜邏輯推理、多步驟規劃、演算法設計的任務。只有這類任務,才值得動用最頂級的模型,如 Claude 3 Opus 或 GPT-4o。
日本開發者 @dudupii 開源的 smart-dispatch 專案,就是這個理念的一個具體實踐。它允許開發者定義規則,根據任務描述中的關鍵字,自動將子代理的任務路由到不同等級的 Claude 模型,從而實現成本的智慧控制。
除了模型選擇,分層調度還需考量哪些面向?
建立有效的代理調度系統,不僅僅是寫幾個 if-else 規則。一個真正穩健的治理框架,還需要考慮更多維度。這也是從單純的「成本削減」邁向「系統治理」的關鍵一步,與學術界和產業界在 AutoGen 或 LLM-Router 等研究中探討的議題一脈相承。
首先是風險評估。有些任務雖然簡單,但其執行結果的影響卻非常重大。例如,「刪除測試資料庫中的所有表格」這個指令本身並不複雜,但一旦出錯,後果不堪設想。對於這類高風險任務,即使其技術複雜度不高,也應該指派給最可靠、最「對齊」的模型來執行,並搭配嚴格的確認機制。成本在此時是次要考量。
其次是效能監控與動態調整。一個靜態的路由規則表很快就會過時。我們需要建立一套監控系統,持續追蹤不同模型在處理各類任務時的成功率、延遲與成本。當發現某個模型(例如 Sonnet)在處理某類中階任務的表現持續不佳時,系統應能自動或半自動地將這類任務升級到更高階的模型(Opus),形成一個持續學習和優化的閉環。
最終,多代理系統的成熟度,將不再由其最強大的單一模型來定義,而是由其資源調度的智慧程度來衡量。正如 a16z 在分析生成式 AI 的經濟效益時指出的,長期來看,能否有效管理運算成本,將是決定 AI 應用能否規模化並產生實質商業價值的關鍵。從無腦的模型繼承,到有意識的成本治理與智慧調度,這不僅是技術上的演進,更是思維模式上的躍遷。
延伸閱讀
- smart-dispatch on GitHub: A practical implementation for smart agent dispatching with Claude.
- AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation: A foundational paper on multi-agent frameworks from Microsoft Research.
- Anthropic Official Pricing: A reference for comparing the costs of different Claude models.
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。