超越 Token 壓縮:AI 長程任務成功的關鍵在於「上下文工程」

當業界還在追求無止盡的 Context Window 擴張,我們可能忽略了真正的瓶頸。長程任務的穩定性與效率,並非來自於讓 AI 記憶所有事,而是教它如何像編輯一樣主動管理上下文——決定什麼該保留、什麼該遺忘。這套「上下文工程」的方法論,正是打造可持續、可治理 AI 代理的下一步。

超越 Token 壓縮:AI 長程任務成功的關鍵在於「上下文工程」

隨著大型語言模型(LLM)的 Context Window 不斷擴張,從數十萬到百萬級 Token 已成常態,我們似乎正走在一條暴力解決問題的道路上。然而,這並非長久之計。真正能提升 AI Agent 在長程任務中穩定性與一致性的關鍵,並非被動地壓縮所有歷史對話,而是導入一套主動的「上下文工程」(Context Engineering)方法論:像人類編輯一樣,有意識地決定什麼資訊該保留、什麼該外移、什麼又該重寫。這不僅是技術優化,更是邁向可治理 AI 系統的必要思維轉變。

為什麼單純擴大 Context Window 不夠?

近年來,模型製造商競相推出擁有巨大上下文視窗的模型,例如 Google Gemini 1.5 Pro 的 100 萬 Token,似乎暗示著只要容量夠大,AI 就能處理任何複雜的長程任務。但實務上,這種「暴力破解」的策略很快就碰到瓶頸,主要體現在三個層面:

  1. 高昂的成本與延遲:首先是實際運作的成本與效率問題。Token 成本和處理時間會隨著上下文長度呈線性,甚至超線性增長。想像一個需要即時反應或持續運作的 AI 代理,每一輪對話都得帶著數十萬 Token 的歷史包袱,這不僅讓運算變得不切實際,也大幅拖慢了反應速度。
  2. 資訊檢索的可靠性:大量的研究,例如史丹佛大學著名的 「大海撈針」(Needle-In-A-Haystack)測試,都顯示模型在處理極長上下文時,容易出現「中間遺忘」(Lost in the Middle)現象。關鍵資訊如果被埋藏在上下文的中間,模型的回憶與推理能力會顯著下降。
  3. 任務一致性的漂移:當上下文充滿了各種歷史對話、工具輸出與中間思考時,Agent 的核心目標很容易被雜訊淹沒,導致任務漂移(task drift)。它可能會過度關注最近的對話,而忘記了最初的指令與約束。

顯然,擁有一個巨大的記憶體,不等於能有效運用它。我們需要的不是更大的儲存空間,而是更好的記憶管理系統。

從被動壓縮到主動編輯:什麼是「上下文工程」?

一篇於 2026 年 7 月發表的論文 《ACM: Agentic Context Management for Long Horizon Tasks》,提出了一個極具啟發性的框架,正好回應了這個挑戰。其核心思想是將上下文管理從一種被動的「壓縮」任務,轉變為主動的「編輯與治理」工作。這就是我所說的「上下文工程」。

這套方法論模擬了人類處理記憶的方式。我們不會鉅細靡遺地記住生命中的每一秒,而是會:

  • 形成摘要:將日常經驗轉化為更高層次的概念與結論。
  • 外部化記憶:將細節寫在筆記本或行事曆上,需要時再去查閱。
  • 選擇性遺忘:過濾掉不重要、不相關的資訊,以保持思緒清晰。

ACM 框架正是將這套認知策略應用於 AI Agent。它不再將所有資訊都塞進短期的工作記憶(即 Context Window),而是引入一個代理控制器(Agentic Controller),動態決定如何處理每一條新資訊。

關鍵的思維轉變在於:上下文視窗不該被當成一個無限的歷史紀錄,而應該被視為一個高度策展、專為當前任務服務的「動態工作區」。

如何實踐 Agentic Context Management?

ACM 框架的精髓在於賦予 Agent 自主管理其上下文的能力,主要透過三種核心操作來實現:

1. 濃縮(Condense):
這不僅僅是傳統的摘要。Agent 會評估一段對話或資訊,判斷其核心價值,並將其「重寫」成更精簡、更具結構的知識。例如,將一段冗長的錯誤日誌,濃縮成一句「API 金鑰因過期而驗證失敗」。這保留了關鍵因果,卻拋棄了無關的堆疊追蹤細節。

2. 儲存(Store):
對於那些當下不緊急,但未來可能有關聯的資訊(例如,專案的背景資料、用戶的個人偏好),Agent 會將其移出即時的上下文視窗,存放到一個外部的長期記憶體中,通常是向量資料庫。這個過程類似於我們將文件歸檔,它釋放了寶貴的工作記憶空間,同時確保了資訊的可檢索性。

3. 搜尋(Search):
當 Agent 在解決問題時意識到需要某個被存起來的資訊,它會主動查詢外部記憶體。這個機制與檢索增強生成(RAG)的理念一脈相承,但更具主動性。它不是被動地等待用戶提問,而是在 Agent 的自主推理鏈中,將「搜尋記憶」作為一個可選的內部工具。

透過這三種操作的動態組合,Agent 能夠維持一個小而美的上下文視窗,裡面只包含當前任務最相關的資訊。這不僅大幅降低了 Token 成本與延遲,更重要的是,它確保了 Agent 的專注力與任務一致性,避免在無盡的歷史紀錄中迷失方向。這套方法論與 Lilian Weng 關於自主代理系統記憶模組的探討不謀而合,都指向了一個共同的未來:AI 需要的不只是更大的大腦,而是更聰明的記憶治理機制。

將上下文管理提升到「工程」與「治理」的層次,意味著我們不再將 LLM 視為一個黑盒子,而是開始設計其「認知架構」。這讓我們能夠打造出更穩定、更可預測,也更具成本效益的 AI 系統,尤其是在那些需要長期運作、持續演進的複雜任務場景中。這條路雖然比單純擴展 Context Window 更具挑戰,但它通往的是一個更健壯、更可信任的 AI 未來。

延伸閱讀

我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。