Declarative Attention:從被動篩選到主動宣告,重塑 LLM 的上下文管理策略

目前主流的 RAG 或長上下文視窗,仍是被動地餵給模型大量資訊。但如果模型能像呼叫工具一樣,主動宣告「我需要這段對話」或「給我那份文件的第三章」呢?Declarative Attention 提出了一個新方向,將上下文管理從外部演算法轉為模型內在的可控行為,這不僅是效率問題,更是通往可治理 AI 的關鍵一步。

Declarative Attention:從被動篩選到主動宣告,重塑 LLM 的上下文管理策略

我們常談論如何用 RAG 或長上下文視窗優化模型,但這些方法本質上仍是被動的資訊灌輸。我認為,真正的突破在於讓模型能「主動宣告」它需要哪些資訊。最近提出的 Declarative Attention 機制,將注意力控制工具化,讓模型自行決定讀取哪些 KV cache 區塊。這不僅能大幅降低推理成本,更重要的是,它提供了一種可觀察、可治理的上下文管理框架,是打造可信任 AI 系統的關鍵一步。

為什麼我們需要重新思考上下文管理?

大型語言模型(LLM)的推理成本,尤其是在處理長序列時,一直是個棘手的問題。自從 Attention Is All You Need 論文問世以來,Transformer 架構雖然強大,但其注意力機制的計算複雜度與序列長度成二次方關係,記憶體佔用也隨之劇增。為了解決這個問題,業界發展出各種長上下文技術與近似注意力演算法,但它們大多圍繞著一個核心挑戰:如何管理與日俱增的 KV cache。

KV cache 儲存了先前 token 的鍵(Key)與值(Value)向量,避免了重複計算,是提升生成效率的關鍵。然而,當上下文長度達到數十萬甚至數百萬 token 時,這個快取本身就成了巨大的記憶體負擔與 I/O 瓶頸。

現有的解決方案,如 Sliding Window 或各種 RAG(Retrieval-Augmented Generation)策略,本質上都是在模型「外部」進行的篩選與過濾。我們像一個圖書管理員,猜測模型可能需要什麼資料,然後把一整疊書(上下文)塞給它,讓它自己費力地在裡面尋找答案。這個過程不僅效率低落,而且是一個黑盒子,我們無從得知模型真正關注了哪些資訊。

Declarative Attention:將注意力視為一種可調用的工具

近期由 Salesforce AI Research 等機構提出的 Declarative Attention 提供了一個截然不同的思路:與其由外部演算法被動篩選,不如讓模型自己「主動宣告」它需要哪些上下文。這個概念的核心是將注意力控制「工具化」。

具體來說,研究者們讓模型學會生成一個特殊的控制指令,例如 [DECLARE: "summarize_document_chunk_3"]。這個宣告會被系統攔截,並解析為一個指令:只從 KV cache 中讀取被標記為 "summarize_document_chunk_3" 的那一部分。如此一來,模型就不再需要遍歷整個龐大的 KV cache,而是可以像進行一次精準的資料庫查詢一樣,只載入它明確宣告需要的資訊。這種作法有幾個顯著的優勢:

  • 無需重新訓練: 這套機制可以直接應用於現有的開源模型,例如 Gemma 或 Qwen 系列,只需透過簡單的 in-context learning 或微調即可引導模型學會生成宣告指令。
  • 大幅提升效率: 實驗數據顯示,在長上下文摘要任務中,Declarative Attention 可以減少高達 128 倍的 KV cache I/O,並帶來 2.1 倍的端到端推理加速。
  • 兼容並蓄: 它可以與現有的 RAG 系統結合。RAG 負責初步召回相關文件區塊,而 Declarative Attention 則讓模型在這些區塊之間進行更細緻、主動的資訊調用。

我們可以簡單比較一下兩種模式的差異:

傳統上下文管理 (RAG / 長上下文) Declarative Attention
控制方 外部演算法 (被動) 模型自身 (主動)
資訊流 灌輸 (Push) 宣告與拉取 (Pull)
KV Cache 存取 全量或近似掃描 精準、稀疏的區塊讀取
可觀察性 低,注意力權重難以解釋 高,宣告指令明確可記錄

這對打造可治理的 AI 意味著什麼?

Declarative Attention 的價值遠不止於性能優化,它為 AI 的「可治理性」(Governance)帶來了新的可能性。當模型的資訊取用行為從隱晦的注意力權重分佈,轉變為一系列明確、可記錄的「宣告」時,我們就獲得了前所未有的觀察與控制窗口。

核心的轉變在於,我們將上下文管理從一個外部、通常不透明的過濾演算法,轉移到模型內部、一種明確且可觀察的宣告行為。

想像一個應用場景:在處理敏感的醫療或金融資料時,我們可以透過審計模型生成的宣告指令,來確保它沒有存取權限之外的資訊。我們可以分析這些宣告的模式,了解模型解決特定問題時的「思考路徑」,從而更好地偵錯、優化其行為。

這種透明度是建立可信任 AI 系統的基石。過去,我們試圖透過複雜的 可解釋性 AI(XAI)技術來窺探模型的內心世界;現在,Declarative Attention 讓模型有機會「開誠布公」地告訴我們它需要什麼。

當然,這項技術仍處於早期階段,如何讓模型學會更複雜、更高效的宣告策略,以及如何設計對應的記憶體架構,都還有待深入研究。但我認為,這個從被動接收到主動宣告的範式轉移,指明了一個重要的方向:未來的 AI Agent 不應只是被動的資訊處理器,而應該是能夠主動、高效且可控地管理自身認知資源的參與者。這不僅關乎效率,更關乎我們能否建立與 AI 長期、可信的協作關係。

延伸閱讀

我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。