從工具呼叫到 Runtime 優化:當 Agent 學會「預判你的預判」

AI Agent 遲鈍的「思考、呼叫、等待」循環,不僅拖慢使用者體驗,更限制了系統潛力。一篇新研究提出將執行者與預測者合一的架構,讓 Agent 能預先推測並準備下一步工具。這不只是加速技巧,更是對 Agent Runtime 的根本性重構,為即時互動與成本效益開闢了新路徑,預示著 Agent 效能的重大突破。

從工具呼叫到 Runtime 優化:當 Agent 學會「預判你的預判」

AI Agent 在「思考-行動」循環中,每呼叫一次外部工具,就必須經歷完整的等待與回應週期,這種阻塞式互動模式嚴重拖慢使用者體驗,並限制了系統複雜度。一篇新研究提出將執行者與預測者合一的架構,讓 Agent 能在執行當前步驟的同時預測下一步工具,並預先準備。這不只是單純的加速技巧,更是對 Agent Runtime 的根本性重構,打破了延遲的枷鎖,為即時互動與成本效益開闢了全新的工程路徑。

為什麼傳統 Agent 的互動循環總是充滿延遲?

目前主流的 Agent 大多遵循類似 ReAct (Reason and Act) 的框架。這個框架將複雜任務拆解成一連串的「思考(Thought)、行動(Action)、觀察(Observation)」循環。例如,當被要求「查詢今天台北的天氣並推薦穿搭」時,Agent 的內部流程可能是:

  1. 思考:我需要先知道天氣,才能推薦穿搭。第一步是呼叫天氣 API。
  2. 行動:執行 get_weather(city="Taipei")
  3. 等待:系統發出 API 請求,等待遠端伺服器回應。這段時間可能從數百毫秒到數秒不等,期間 Agent 的思考流程完全停滯。
  4. 觀察:收到 API 回應「28°C,晴天」。
  5. 思考:天氣是晴朗炎熱,適合穿著輕便透氣的衣物。下一步是根據這個資訊生成建議。

問題出在第三步的「等待」。這個延遲看似微不足道,但在需要連續呼叫十幾次工具的複雜任務鏈中,這些延遲會快速疊加,導致總體反應時間長到令人難以忍受。

這不僅是使用者體驗的問題,更是一個深刻的架構問題。它迫使開發者在「任務的精細度」與「系統的回應速度」之間做出痛苦的權衡,也讓即時、流暢的多工具協作變得遙不可及。

如何將執行者與預測者合而為一?

為了解決這個根本性的延遲問題,一篇來自 arXiv 的研究提出了「自推測代理人」(Self-Speculating Agent)的概念。這個架構的核心思想,是打破「執行」與「規劃下一步」之間的壁壘,將兩者整合進一個統一的模型中。

傳統架構下,我們可能需要兩個獨立模型:一個是負責思考與決策的 Agent,另一個是負責預測下個工具的 Speculator。而這篇研究透過聯合強化學習(Joint Reinforcement Learning),成功地讓單一模型同時學會這兩項技能。在 Agent 進行當前步驟的推理時,它會同時「推測」出機率最高的下一步工具呼叫。例如,在它還在處理天氣 API 回應的同時,就已經預測到下一步極有可能是「生成穿搭建議」。

這個「預測」並非空想,而是與底層的運算機制緊密結合。當模型預測下一步將呼叫某個工具時,它可以利用 KV 快取(KV Cache)機制,預先計算並快取該工具呼叫所需的大部分神經網路狀態。

如此一來,當 Agent 真正完成當前步驟、決定執行下一步時,如果預測命中,大部分的運算工作都已完成,工具呼叫的延遲幾乎可以被消除。根據該研究在 Qwen 模型家族上的實驗,這種方法可以在不顯著影響任務準確率的前提下,大幅提升預測的精準度。

這不僅是速度的優化,更是從序列式、阻塞式的執行模型,轉向平行化、推測式的 Runtime 架構。它從根本上改變了 Agent 與外部世界的互動方式。

預測執行除了加速,還能帶來哪些工程效益?

將推測能力內建於 Agent Runtime 中,帶來的好處遠不止是表面上的速度提升。該研究的實驗數據指出,在 Qwen1.5-7B 這樣的模型上,工具呼叫預測的 Hit@1 準確率(即第一次猜就猜中的機率)可以達到 85% 以上,並在多步驟的工具密集型任務中,將端到端的延遲降低了近 60%。這背後代表著一系列深刻的工程效益:

  • 大幅降低延遲:最直接的效益。對於需要與使用者即時互動的應用(如客服、程式碼助手),流暢的體驗是決定成敗的關鍵。
  • 提升運算效率與成本效益:傳統 Agent 在等待工具回應時,運算資源(如 GPU)處於閒置狀態。推測執行讓這些空檔被有效利用,減少了總體的資源佔用時間,進而降低了營運成本。
  • 解鎖更複雜的任務鏈:過去因為延遲過高而不敢設計的複雜、長鏈路任務,現在變得可行。這為打造能夠自主完成研究、分析、報告等深度工作的 AI Agent 系統開啟了新的可能性。

從本質上看,這種從「被動等待」到「主動預測」的轉變,讓 Agent 的行為模式更接近人類。我們在執行一個任務時,大腦總是在潛意識中規劃著接下來的兩三步。

將這種推測執行(Speculative Execution)的思想引入 Agent 架構,或許是通往更高效、更強大 AI 系統的關鍵一步。它提醒我們,優化 AI Agent 不應只停留在模型演算法層面,對其 Runtime 的重新思考與設計,同樣蘊含著巨大的潛力。

延伸閱讀

我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。