從 Token 預算超限談起:AI Agent 的記憶體治理,為何比上下文窗口更重要?
許多人相信,不斷擴增的上下文窗口是解決 AI 記憶問題的萬靈丹。然而,一個在 Agent 框架中常見的技術錯誤,卻揭示了更深層的真相:若缺乏分層、分頁與外部緩衝等結構化的記憶體架構,再強大的模型也會在資訊膨脹下失去穩定性。真正可持續的 Agent 設計,靠的不是塞入更多 Token,而是更智慧的記憶體治理。
許多人將 AI 的未來寄望於無盡擴展的上下文窗口(Context Window),認為只要能塞入更多資訊,就能打造出更聰明、記憶力更好的 AI。但我認為這是一個迷思。真正的瓶頸並非窗口大小,而是記憶體的架構與治理。一個在 AI Agent 開發中常見的「Token 預算超限」錯誤,恰好暴露了這個根本性問題:若沒有明確的長短期記憶分層、分頁與外部緩衝機制,再強大的模型也會在上下文膨脹下失去穩定推理能力。可持續的 Agent 設計,靠的是記憶治理(Memory Governance),而不是無止盡的 Token 堆積。
AI Agent 的記憶同步,為何常出錯?
在建構多 Agent 系統時,我們經常會設計一個中央協調者或閘道器(Gateway),讓底下數個獨立運作的子 Agent(sub-agent)能定期回報進度、同步學習。一個常見的實作,是透過定時任務(cron job)——例如每天 23:00——自動抓取所有 Agent 的對話歷史,進行摘要與歸檔。
問題就出現在這裡。以 OpenClaw 這類框架為例,其歷史紀錄讀取的 API 在預設情況下,會試圖一次性獲取一個 Agent Session 的「全部」歷史紀錄。
當系統剛上線時,這不成問題。但運行數週、數月後,累積的對話歷史輕易就能突破模型的 Token 預算,導致 API 呼叫失敗,整個記憶同步機制隨之崩潰。這個看似簡單的工程錯誤,實則是一個架構警訊:我們正在用一種線性、無差別的方式對待所有記憶,而這條路很快就會走到盡頭。
為什麼無限制擴充上下文,不是根本解方?
即使我們能擁有像 Google Gemini 1.5 Pro 那樣 高達 100 萬 Token 的上下文窗口,直接將所有歷史紀錄塞進去依然是個壞主意。這背後至少有三個根本性約束:
- 運算成本的詛咒:Transformer 架構的注意力機制,其計算複雜度與輸入長度(N)成二次方關係(O(N²))。即使有各種線性化變體,巨大的上下文窗口仍意味著高昂的運算成本與延遲,這在需要快速反應的 Agent 應用中是難以接受的。
- 大海撈針的挑戰:研究早已證實,大型語言模型在處理長上下文時,會出現「迷失在中間(Lost in the Middle)」的現象。模型對上下文開頭和結尾的資訊最為敏感,而夾在中間的關鍵細節很容易被忽略。將數十萬字的原始對話紀錄直接灌入,無異於製造大量雜訊,干擾模型的關鍵判斷。
- 認知資源的類比:人類的認知系統也並非將所有經歷都儲存在「工作記憶」中。我們有瞬時記憶、短期記憶與長期記憶之分。將所有資訊不加區分地塞入單一的上下文窗口,就像要求一個人在做決策時,必須同時回想起過去一年中說過的每一句話。這不是「記憶力好」,而是認知過載。
我們的目標不該是給 AI 一個完美的、鉅細靡遺的記憶,而是一個「有用」的記憶。無盡的原始數據流是雜訊,而經過結構化、摘要化的知識才是信號。
如何設計更穩健的記憶體治理機制?
回到最初的 Token 超限問題,其解決方案恰恰指出了兩種最基本的記憶體治理策略:分頁(Paging)與外部化(Externalization)。這不只是權宜之計,更是設計可持續 Agent 架構的核心原則。
首先是分頁與截斷,對應的是「短期工作記憶」的管理。與其一次讀取全部歷史,我們應該只獲取近期最重要的互動。例如,將 API 的 `limit` 參數從預設的「全部」改為 `10` 或 `20`。這確保了 Agent 在執行當前任務時,只專注於最相關的上下文,避免被過時的資訊干擾。這是一種基於「時間局部性(temporal locality)」的簡單而有效的策略。
其次是外部化與摘要,這是在建構「長期鞏固記憶」。與其讓對話歷史在 Session 中無限膨脹,不如定期將其轉移、處理後存放到外部儲存體。一個簡單的作法是,將每天的對話摘要成幾個關鍵的「經驗教訓(lessons learned)」,並存入一個 Markdown 文件或向量資料庫。當 Agent 需要回溯過往經驗時,它不是去讀取數千條原始對話,而是透過檢索增強生成(RAG)的方式,從這個濃縮的知識庫中查詢相關見解。這形成了一個清晰的記憶層級:
- 工作記憶(Working Memory):儲存在當前的 Prompt 中,容量小、速度快、易揮發。透過分頁和截斷來管理。
- 長期記憶(Long-term Memory):儲存在外部文件或資料庫中,容量大、速度慢、持久化。透過摘要、嵌入和檢索來管理。
從一個小小的 Token 預算錯誤出發,我們看到的是一條通往更成熟 AI 架構的道路。當業界還在為上下文窗口的數字狂歡時,真正的突破或許在於那些更底層、更接近認知科學的記憶體治理原則。打造能夠長期穩定運作、真正可信賴的 AI Agent,關鍵不在於擁有一個更大的容器,而在於學會如何聰明地分類、儲存與遺忘。
延伸閱讀
- Lost in the Middle: How Language Models Use Long Contexts (arXiv)
- Attention Is All You Need (arXiv)
- What Is Retrieval-Augmented Generation? (Amazon Web Services)
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。