AI 協作的下一步:為何「職能分離」是建構可靠 Agent 系統的關鍵?
當我們要求單一 AI 模型從規劃、實作到審核一手包辦時,其實正在埋下系統性風險。真正的 AI 協作,應該借鏡成熟的軟體開發流程,將任務拆解為「規格判斷」、「程式實作」與「成果審核」三階段,並指派不同特性的模型各司其職。本文將探討這種「職能分離」架構,如何從根本上提升 AI 系統的穩定性與可靠性,將其從單次生成工具,升級為可持續運作的分工機器。
在建構 AI Agent 系統時,我們常陷入一個迷思:試圖尋找一個最強大的模型來完成所有任務。然而,更穩定、更可靠的架構,反而是將 AI 協作流程拆解為「規格判斷」、「實作」與「審核」三個獨立階段,並讓不同特性的模型各司其職。這種「職能分離」的原則,不僅是為了優化效率,更是為了降低系統性錯誤、建立可預測工作流程的基石。當模型被放在各自擅長的位置上,整個 Agent 系統的價值才能從單次生成,升級為可持續運作的專業分工機器。
為什麼單一全能模型,反而是系統的弱點?
當前許多強大的基礎模型,例如 GPT-5 或 Claude 4 Opus,都展現了驚人的多工處理能力。它們既能理解複雜的需求、規劃執行步驟,也能生成高品質的程式碼。這很容易讓人產生一種錯覺,認為只要用上最好的單一模型,就能打造出最完美的自動化系統。然而,這種「萬能瑞士刀」式的思維,在系統工程的尺度上,其實隱含著風險。
問題在於,「規劃」與「執行」是兩種截然不同的認知模式。規劃需要的是廣泛的脈絡理解、權衡取捨的判斷力,以及與使用者進行澄清對話的能力。而執行,尤其在程式碼生成這類任務上,則更需要精確的語法知識、對 API 的熟悉度,以及遵循嚴格格式的產出能力。要求單一模型在同一個任務流程中頻繁切換這兩種模式,就像要求一位產品經理在定義完規格後,立刻無縫切換成資深工程師寫出產品級的程式碼。雖然並非不可能,但出錯的機率顯著提高,且錯誤的根源也變得難以追蹤。
職能分離的 AI 協作框架,如何運作?
一個更穩健的作法,是借鏡人類社會行之有年的組織分工原則,將 AI Agent 的工作流拆解成獨立的職能單位。日本開發者 kobaruto sato 的實驗為我們提供了一個具體的範例,即便他使用的是較早期的模型,其核心思想至今依然適用。我們可以將一個複雜的開發任務,拆解成以下三個關鍵階段:
第一階段:規格判斷與規劃(Planner)
此階段的目標是釐清需求、定義邊界、規劃實作路徑。適合擔任此角色的,是具備強大語言理解與邏輯推理能力的模型。例如 Anthropic 的 Claude 3 Opus,它在多項基準測試中展現了近乎人類水準的理解力(例如在 MMLU 知識問答上達到 86.8% 的準確率),擅長進行多輪對話、討論方案的優劣,甚至能主動提出潛在問題。這個「規劃者」不直接產出最終程式碼,而是產出清晰的規格文件或偽代碼(pseudo-code)。
第二階段:實作與生成(Executor)
此階段的任務是根據前一階段產出的規格,精準地生成程式碼。適合這個角色的,是針對程式語言特化的模型。雖然 OpenAI 的 Codex 已整合至後續模型中,但其背後的設計理念——專注於程式碼生成——依然重要。現今有許多開源或商用的 Code LLMs,它們被大量高品質程式碼訓練,能產出語法正確、風格一致的程式。這個「執行者」專心致志,只依據明確的指令工作。
第三階段:審核與驗證(Verifier)
此階段負責檢驗「執行者」的產出是否符合「規劃者」最初的意圖。我們可以再次利用具備強大邏輯推理能力的模型(甚至是同一個「規劃者」模型,但在不同的 prompt 指令下運作),讓它扮演 Code Reviewer 的角色。它會比對規格文件與實際程式碼,檢查邏輯錯誤、遺漏的功能或不符規格的地方,並提出修正建議,形成一個封閉的品管迴圈。
這種分層式的架構,讓每個模型都能在其「認知舒適區」內運作,最大化其優勢,同時也最小化其弱點。
這種架構如何從根本上降低系統性風險?
將 AI 協作流程職能化,其核心價值不僅在於提升單次任務的成功率,更在於降低整個系統的長期風險。當錯誤發生時,我們能更輕易地定位問題——是規劃階段的規格就出了錯?還是執行階段的程式碼生成有誤?或是審核階段沒能發現問題?這種故障隔離(fault isolation)的能力,是建構可維護、可擴展 AI 系統的基礎。
此外,這種架構也讓我們能更靈活地升級系統。當市場上出現一個更擅長推理的新模型時,我們可以只替換「規劃者」和「審核者」,而保留原本表現優良的「執行者」。反之亦然。這種模組化的設計,避免了被單一供應商或單一模型架構綁死的風險。
從 Anthropic 提出的 「憲法 AI」(Constitutional AI)概念,到 Andrew Ng 等人倡導的 Agentic Workflow,我們看到一個清晰的趨勢:AI 系統的未來,不在於追求一個無所不能的「神級」模型,而在於如何設計一套有效的協作機制,讓多個各有所長的 AI Agent 能夠像一支訓練有素的團隊一樣,分工合作、彼此監督、共同完成目標。從這個角度看,我們的工作將越來越不像是「提示詞工程師」,而更像是設計與指揮 AI 團隊的「系統架構師」。
延伸閱讀
- Claude Code と Codex CLI を組み合わせたら最高の執事になった話 (kobaruto sato, Zenn.dev)
- Sparks of Artificial General Intelligence: Early experiments with GPT-4 (Sébastien Bubeck, et al., arXiv)
- Why Agentic AI is the Next Big Wave (Andrew Ng, DeepLearning.AI)
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。