訓練與現實脫節:為何 AI Agent 的工具調用,需要將執行環境納入獎懲迴圈?
當 AI Agent 的訓練環境與真實部署環境存在巨大落差,我們透過強化學習(RL)得到的策略,往往難以在實際的工具調用中穩定泛化。一篇新研究提出將部署時的「執行框架」(Harness)納入訓練迴圈,這不僅是模型優化問題,更是縮小模擬與現實鴻溝的系統工程挑戰。
AI Agent 在複雜工具調用上的表現,其瓶頸往往不在模型本身,而在於訓練環境與真實部署環境的脫節。當我們使用強化學習(RL)來優化代理策略時,若訓練迴圈過於理想化,所學到的行為便難以泛化到充滿限制與非預期錯誤的生產環境。
為什麼理想化的訓練環境,會養出脆弱的 AI Agent?
在 AI Agent 的開發中,我們習慣將模型的「思考能力」與「執行能力」分開看待。我們專注於透過強化學習(RL)或人類回饋強化學習(RLHF)來優化大型語言模型(LLM)的決策鏈,但在訓練過程中,模型互動的「世界」通常是個被大幅簡化的模擬環境。例如,工具(API)的調用被假設為即時完成、永遠成功,且回傳的資料格式總是完美無缺。
這種理想化的假設,在真實世界中不堪一擊。實際部署時,Agent 必須面對網路延遲、API 速率限制、非預期的錯誤碼(如 503 Service Unavailable)、權限控管,甚至是工具版本更新造成的行為不一致。當一個在無菌室中長大的 Agent 突然被拋入充滿摩擦力的現實環境,它原先學到的策略很容易失靈,陷入不斷重試或做出錯誤決策的窘境。
這個挑戰在概念上,與機器人領域長期探討的「模擬到現實的落差」(sim-to-real gap)如出一轍。在模擬器中走得再好的機器人,也可能因為沒考慮到真實地板的摩擦力或光線變化而寸步難行。同樣地,一個只學會「語意上」如何調用工具的 LLM Agent,如果沒有在訓練中體驗過執行的現實,就很難發展出穩健的錯誤處理與適應能力。
Agent Lightning 如何透過「受控代理 RL」彌補訓練與現實的鴻溝?
為了解決這個問題,一篇名為 Agent Lightning v1.0: Towards Harnessed Agentic RL 的研究,提出了一個我認為相當有啟發性的方向:將部署時的「執行框架」(Harness)直接納入強化學習的訓練迴圈中。他們將此方法稱為「受控代理強化學習」(Harnessed Agentic RL)。
所謂的「Harness」,指的是在生產環境中包覆並管理 Agent 執行的那層系統工程基礎設施。它不僅僅是像 OpenAI 的 Function Calling 或 LangChain Agents 執行器那樣的工具調用介面,更包含了所有現實世界的限制與反饋機制。Agent Lightning 框架所定義的 Harness,可能包含以下幾個關鍵元素:
- 真實延遲模擬: 每次工具調用都會引入符合現實網路狀況的延遲,讓 Agent 學會等待與規劃非同步任務。
- 資源與權限限制: Agent 的操作受到嚴格的配額限制(如每分鐘 API 調用次數),迫使其學習更有效率的策略。
- 隨機性錯誤注入: 訓練環境會機率性地回傳各種 API 錯誤,強迫 Agent 發展出重試、備用方案或向使用者求助的能力。
- 狀態監控與回饋: Harness 會提供關於執行環境狀態的即時回饋,這些回饋會成為 RL 獎勵函數的一部分。
我們不能再將 Agent 的「大腦」(LLM)與其「身體」(執行環境)分開優化。真正的智慧,體現在與真實世界限制的互動之中。
透過這種方式,獎勵訊號不再僅僅基於任務是否「語意上」完成,而是基於在「現實限制下」是否高效、穩健地完成。Agent 不僅要學會做什麼(what to do),更要學會如何在限制中做(how to do it under constraints)。
這對打造實用 AI Agent 意味著什麼?
將 Harness 納入訓練迴圈,本質上是把一部分的系統工程問題,轉化為模型可以學習的策略問題。這帶來了非常實際的好處。該研究在 SWE-bench Verified 這個高難度的軟體工程任務 benchmark 上進行了實驗,結果顯示,經過 Harnessed Agentic RL 訓練的 Qwen3.5 模型,其解決問題的成功率顯著高於僅在理想化環境中訓練的同等模型。
這個結果並不令人意外。一個學會在顛簸路面上開車的駕駛,遠比一個只在模擬器裡開車的人,更能應對真實的路況。這項工作提醒我們,當前許多專注於提升 LLM 推理能力的努力,例如發展像 Toolformer 這樣更強的工具使用模型,可能只解決了一半的問題。如果模型學到的精妙策略無法在充滿雜訊的現實中執行,那便是紙上談兵。
從我的觀點來看,Agent Lightning 提出的方向,是 AI Agent 從「玩具」走向「工具」的必經之路。它意味著 Agent 的開發不再只是演算法工程師的工作,而是需要演算法、軟體工程與系統工程團隊的緊密協作。我們需要設計出能反映生產環境複雜性的訓練 Harness,並將其視為與模型同等重要的一等公民。唯有如此,我們才能打造出真正能夠在真實世界中自主、可靠地完成複雜任務的 AI 系統。
延伸閱讀
- Agent Lightning v1.0: Towards Harnessed Agentic RL (核心研究論文)
- SWE-bench: Can Language Models Solve Real-World Software Engineering Problems? (評測基準)
- Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (關於 Sim-to-Real 落差的經典論文)
- OpenAI Function Calling 文件 (業界標準的工具調用實踐)
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。