當 AI Agent 學會裝忙:為何漂亮的輸出指標,可能正掩蓋一場無聲的推理崩潰?
多步驟 AI Agent 可能在訓練中悄悄與現實脫鉤,其輸出看似豐富多樣,實則早已不再依賴真實輸入,形成一種「範本式」的空洞回應。這種「推理崩潰」無法被傳統的熵指標偵測,暴露出我們在評估 Agent 可靠性上的盲點。我們真正需要衡量的,不是輸出的花俏程度,而是輸入與輸出之間,是否依然存在著穩固的資訊耦合關係。
我們在打造多步驟 AI Agent 時,常陷入一個迷思:只要模型的輸出看起來豐富、多樣、不重複,就代表它運作良好。然而,近期研究揭示了一種更隱蔽的失敗模式,其中 Agent 儘管表面指標一切正常,其內在的推理鏈條卻已然崩潰。這種現象提醒我們,真正重要的不是輸出看起來有多麼「熵值高」,而是輸入的資訊是否能實質地傳遞到輸出端。若失去了這種資訊上的耦合(informational coupling),我們得到的只是一個學會裝忙、看似滔滔不絕,實則與現實脫節的數位傀儡,這對建立可信任 AI 系統是個根本性的挑戰。
什麼是「範本崩潰」:當 Agent 看似正常,實則與現實脫鉤?
在訓練複雜的、需要進行多輪互動的 AI Agent 時,我們期望它能根據不斷變化的輸入,動態地調整其行為與回應。然而,來自 Google DeepMind 與史丹佛大學等機構的研究者在開發 RAGEN-2 模型的過程中,發現了一種被稱為「範本崩潰」(Template Collapse)的現象。這是一種極其狡猾的失敗模式。
在這種狀態下,Agent 停止了對輸入的真正理解與推理。取而代之的是,它學會從一個預先內化的「範本庫」中,挑選出看似合理的回應。這些回應本身可能相當多樣化、文法通順且內容豐富,但它們與當下的具體輸入之間,已經沒有了實質的因果關聯。換句話說,無論你對它說什麼,它都只是在自說自話,從一堆看似不錯的答案中隨機挑選一個給你。Agent 依然在「生成」,但已經停止了「回應」。
最棘手的是,這種崩潰很難被傳統的監控指標發現。如果我們只看輸出的多樣性,一切似乎都很完美。
為什麼傳統的熵指標會失靈?
在語言模型的訓練中,我們經常使用「熵」(Entropy)作為一個評估指標。高熵值通常代表輸出的不確定性高、內容更多樣,這能有效避免模型產生重複、單調的回答。在許多情境下,這是一個有用的啟發式規則。例如,一個只會回答「好的」的客服機器人,其輸出熵值極低;而一個能提供多種建議的機器人,熵值就相對較高。
然而,「範本崩潰」恰好鑽了這個指標的空子。想像一個 Agent 內化了 1,000 種不同的、高品質的通用模板。當它開始崩潰時,它會隨機或依循某種內部規律從這 1,000 種模板中挑選一種來輸出。對於外部觀察者來說:
- 輸出多樣性高:因為有 1,000 種選擇,所以回答很少重複,熵值維持在一個很高的水準。
- 輸出品質看似不錯:單看每一個獨立的模板,可能都寫得很好。
問題在於,這個熵值只描述了輸出(Y)本身的分佈,卻完全沒有告訴我們任何關於輸入(X)與輸出(Y)之間關聯性的資訊。傳統熵指標的失靈,根源於它回答了錯誤的問題。我們問的是「你的回答夠不夠豐富?」,而我們真正該問的其實是「你的回答,有多少是源自於我的問題?」
當評估從單純的「生成品質」轉向「互動可靠性」時,我們需要的就不再是單純衡量輸出多樣性的熵,而是能夠量化輸入與輸出之間資訊傳遞強度的指標。
我們該如何衡量輸入與輸出的「實質耦合」?
為了解決這個問題,RAGEN-2 的研究團隊引入了資訊理論中的一個經典概念:互資訊(Mutual Information, MI)。與只看單一變數的熵不同,互資訊 I(X; Y) 專門用來衡量兩個變數之間的統計依賴性。簡單來說,它量化了「在知道輸入 X 的情況下,我們對輸出 Y 的不確定性減少了多少」。
如果輸入與輸出完全獨立(即 Agent 完全在自說自話),它們的互資訊為 0。反之,如果輸入與輸出高度相關,互資訊就會很高。透過監控訓練過程中的互資訊值,研究人員就能夠精準地捕捉到「範本崩潰」發生的瞬間——即使熵值依然穩定,但互資訊會出現斷崖式下跌。
基於這項診斷,RAGEN-2 研究團隊進一步提出了名為「信噪比感知過濾」(SNR-Aware Filtering)的解決方案。在強化學習的訓練過程中,Agent 會不斷產生行動軌跡(trajectories)來學習。此方法透過估算每個軌跡的信噪比(signal-to-noise ratio),優先保留那些與任務目標(signal)高度相關的數據,並過濾掉那些可能導致模型分心、最終學會走捷徑的低品質數據(noise)。
根據論文,這種「信噪比感知過濾」方法成功地防止了範本崩潰,並在 Jericho 等複雜的文字冒險遊戲環境中取得了顯著的性能提升。例如,在 `zork1` 遊戲中,Agent 的成功率從基線的 2% 提升到 39%。
這個案例給我們的啟示,遠不止於解決一個特定的 RL 訓練 bug。它揭示了一個更深層的議題:隨著 AI 系統日益複雜與自主,我們必須從「監督輸出品質」轉向「度量過程可靠性」。我們需要發展更精細的工具,來驗證 AI 的每一步行為是否都忠實地根植於其接收到的資訊與被賦予的目標,而不僅僅是產出一個看起來正確的最終答案。這對於金融交易、醫療診斷、自動駕駛等高風險領域的 AI Agent 而言,更是攸關性命的根本要求。
延伸閱讀
- RAGEN-2: Rewarding Action Generation for Open-ended Text-based Games (arXiv)
- Deep Reinforcement Learning from Human Preferences (OpenAI Blog)
- Information Theory: Mutual Information (CMU Lecture Slides)
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。