重構 Agent 經濟學:真正的成本突破口,不在模型,而在上下文緩衝層

當 AI agent 執行長任務時,真正的成本瓶頸在哪?本文從一個能節省 98% token 的實作談起,探討為何在 LLM 與工具間建立「上下文緩衝層」,是將 context engineering 從提示詞技巧,升級為執行堆棧核心成本控制能力的關鍵一步。

重構 Agent 經濟學:真正的成本突破口,不在模型,而在上下文緩衝層

我認為,AI agent 的發展已進入一個關鍵轉折點。真正的突破,將不再是單純追求更大、更強的基礎模型,而是來自於更智慧的執行堆棧(execution stack)設計。具體來說,在大型語言模型(LLM)與其調用的外部工具之間,建立一個能過濾噪音、精煉資訊的「上下文緩衝層」,才是降低運營成本、實現複雜長任務的關鍵。當系統只將最必要的觀察(observation)回送給模型,我們談論的就不再只是提示詞工程的節省技巧,而是整個 agent 系統的成本控制能力。這項轉變,將直接改寫長任務 agent 的經濟模型,讓許多過去因成本過高而不可行的應用成為可能。

為什麼工具調用是 Agent 的隱形成本黑洞?

當前的 AI agent 架構,大多遵循一個類似 ReAct (Reason and Act) 的循環:模型進行思考,決定下一步行動,然後調用工具(tool use)來獲取外部資訊或執行操作。這個模式雖然強大,卻隱藏著一個巨大的成本陷阱——上下文窗口(context window)的消耗。每一次工具調用,都會從兩個方向侵蝕寶貴的上下文空間:

  • 輸入(Input):模型生成工具調用的指令本身會佔用 token。
  • 輸出(Output):工具執行後返回的結果,往往是未經處理的原始數據,例如完整的 API JSON 回應、冗長的日誌文件,或是整個網頁的 HTML 原始碼。

問題的核心在於「輸出」的噪音。一個簡單的查詢,可能返回數千甚至數萬 token 的原始資料,其中絕大部分對 agent 的下一步決策並無直接幫助。在一個需要數十、甚至上百步才能完成的長任務中,這些冗餘的資訊會被反覆送入上下文,導致成本呈指數級增長。這不僅大幅拉高了 API 費用,更可能因為無關資訊的干擾,降低了模型的判斷準確性,形成一個惡性循環。

我們很容易陷入一個誤區,認為只要模型夠大、上下文窗口夠長,就能解決一切問題。但事實上,更有效率的作法,是從根本上管理流入模型的資訊品質與數量。

緩衝層如何運作:Context Mode 的實踐案例?

最近在開發者社群引起討論的一個專案 Context Mode,為解決這個問題提供了一個極具啟發性的架構。其核心思想便是在 LLM 與工具的輸出之間,建立一個中介的緩衝層。這個緩衝層的目標非常明確:阻止任何未經處理的原始數據直接進入模型的上下文窗口。根據作者的測試,這種方法最高可以節省高達 98% 的上下文 token 消耗。

這個緩衝層主要透過兩種機制來實現資訊的過濾與精煉:

沙箱化的隔離執行(Sandboxed Execution)

每個工具調用都在一個獨立的、隔離的子進程中運行。這個沙箱環境支援超過 10 種常見的程式語言運行時,如 JavaScript、Python 等。關鍵在於,工具執行的完整過程與原始輸出(例如詳細的日誌、錯誤訊息、中間產物)都保留在沙箱內部。最終,只有最核心的標準輸出(stdout)結果,也就是任務最直接的答案,會被提取出來並返回給 LLM。這種做法好比一位稱職的助理,他不會把訪談的全部錄音檔丟給你,而是只給你整理好的重點摘要。

知識庫與即時精準檢索(Just-in-Time Retrieval)

當工具需要處理的是大型文件或程式碼庫時,將全部內容塞給模型顯然是不切實際的。Context Mode 的作法是將這些資料預先建立索引,存入一個本地的知識庫。它利用 SQLite 的 FTS5 虛擬表 進行全文檢索,並結合像 Okapi BM25 這樣的經典排名演算法與 Porter stemming 詞幹提取技術,來確保檢索的精準度。當模型需要相關資訊時,它不是讀取全文,而是向這個知識庫發出查詢,只取回最相關的幾個程式碼塊或文件片段。這本質上是一種高度客製化、輕量級的檢索增強生成(RAG)應用。

這如何從根本上改變 Agent 的經濟模型?

節省 98% 的 token 成本,這個數字固然驚人,但其背後更深遠的意義在於,它徹底改變了我們設計與評估長任務 agent 的經濟可行性。過去,一個需要執行 50 個步驟的複雜任務,可能因為高昂的 token 成本而僅限於學術研究或財力雄厚的團隊。但有了上下文緩衝層這樣的架構,成本可能降低到原來的 2%,這使得許多商業應用從「不可能」變為「可能」。

這也意味著,「Context Engineering」的範疇被大大擴展了。它不再僅僅是關於如何撰寫更精簡、更有效的提示詞(prompt),而是升級為一種系統層級的「執行堆棧成本控制能力」。我們開始思考:

  • 哪些資訊是決策所必需的?
  • 哪些資訊可以在模型外部被預處理或快取?
  • 如何設計工具,使其輸出本質上就是精煉過的?

這種從「模型為中心」轉向「系統為中心」的思維,才是建構下一代 AI agent 的核心。當我們不再將 LLM 視為一個無所不能的黑盒子,而是將其定位為一個強大的推理引擎,並為其打造一個高效、低成本的資訊供應鏈時,我們才能真正釋放 AI agent 在真實世界中解決複雜問題的潛力。這個緩衝層的設計,正是這條供應鏈中至關重要的一環,它確保了送往推理核心的,永遠是最高品質的「原料」。

延伸閱讀

我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。

ссс