不只是解題機器:LLM 如何自我編排推理策略,走向真正的問題解決能力?
大型語言模型不只是在記憶答案,而是開始學習如何「學習」。一篇新研究揭示了 LLM 如何將通用的解題技巧,自我組合成針對特定任務的推理策略,這不僅提升了效能,更暗示了未來 AI Agent 設計的重大轉變。
大型語言模型的未來,正從單純的「答案引擎」轉向具備可遷移「問題解決框架」的「策略生成器」。近期一項名為 Self-Discover 的研究,揭示了 LLM 如何不再依賴固定推理路徑,而是能從通用技巧中,自我編排出針對特定任務的最佳策略。這項突破不僅大幅提升了模型的效率與泛用性,更根本地改變了我們對 AI Agent 架構的想像。它預示著設計重點將從單輪次輸出品質,轉向可重用、可組合的策略生成與治理,開啟了 AI 解決複雜問題的新篇章。
過去幾年,我們見證了提示工程的快速演進,從簡單的零樣本、少樣本提示,發展到更結構化的 思維鏈(Chain-of-Thought, CoT),試圖引導模型模擬人類的循序推理過程。然而,CoT 本質上仍是一種相對單一且通用的模板。面對千變萬化的複雜問題,單靠一種固定的思考模式,顯然會遇到瓶頸。真正的人類專家在解決問題時,並非套用單一公式,而是會根據問題的性質,靈活地組合不同的思考工具與技巧。這正是 Google DeepMind 等機構的研究人員在 《Self-Discover: LLMs Self-Compose Reasoning Structures》一文中所探索的核心議題:我們能否讓 LLM 學會這種「策略組合」的能力?
Self-Discover 如何讓模型學會「謀定而後動」?
Self-Discover 的核心思想,是讓大型語言模型在解決一個複雜任務前,先進行一次「自我探索」,為任務量身打造一套專屬的推理策略。這個過程並非漫無目的地發散,而是遵循一個清晰的三階段框架:
- 選擇(SELECT):首先,模型會從一個包含 39 種通用推理技巧的「工具箱」中,挑選出與當前任務最相關的模組。這些模組涵蓋了多種認知技巧,例如「將問題拆解成更小的部分」、「從第一性原理思考」或「批判性地思考並修正先前的步驟」等。
- 適應(ADAPT):接著,模型會將選出的通用技巧,改寫成針對當前任務的具體指導方針。舉例來說,通用的「批判性思考」可能會被細化為「檢查數學計算中的每一步,確保單位和運算符號的正確性」。這個步驟讓策略更具體、更具可執行性。
- 執行(IMPLEMENT):最後,模型會將這些適應後的指導方針,組合成一個結構化的推理計畫(reasoning structure),然後遵循這個計畫,一步步地解決問題並產出最終答案。
這種「先規畫、後執行」的模式,讓模型從一個被動的指令執行者,轉變為主動的策略規畫者。它不再是盲目地遵循通用指令,而是學會了審題、分析,並為自己設計最佳的解題路徑。
為什麼「策略組合」比單純的 CoT 更重要?
從結果來看,這種動態生成策略的方法取得了顯著的成功。在極具挑戰性的 BigBench-Hard (BBH) 基準測試中,使用 Self-Discover 的 GPT-4 和 PaLM 2-L,其表現比標準的 CoT 提示分別高出了 32% 和 19%。更重要的是,它的效率遠高於其他暴力破解式的增強方法。例如,相較於透過多次採樣、投票選出最佳答案的 Self-Consistency,Self-Discover 所需的推論計算量要少上 10 到 40 倍。
這背後的意義遠不止於性能提升。CoT 像是一本食譜,教你做一道特定的菜;而 Self-Discover 則是教模型如何成為一名廚師,懂得根據現有食材和目標,靈活組合切、炒、燉、烤等基本功,創造出最適合的菜色。前者是知識的應用,後者則是能力的生成。
這種從「應用固定策略」到「生成動態策略」的轉變,代表模型的價值不再僅僅是儲存在權重中的知識,更在於它湧現出的、組織和運用知識的元能力(meta-skill)。這意味著模型開始具備可遷移的問題求解結構,而不只是針對特定問題的記憶性答案。
策略的遷移性:它如何開啟 AI Agent 設計的新篇章?
Self-Discover 最令人振奮的發現之一,是這些由大型模型生成的「推理結構」具有高度的可遷移性。研究顯示,由頂尖模型(如 GPT-4)為某個任務生成的推理計畫,可以直接被規模小得多的模型(如 Llama 2-7B)沿用,並顯著提升後者的解題能力。這個發現為 AI 系統的設計帶來了全新的想像空間。
這意味著我們可以將「策略發現」和「策略執行」這兩個環節解耦。未來,我們可以利用最強大的模型擔任「策略家」的角色,負責分析複雜問題並生成高效的解決方案藍圖;而那些計算成本較低、反應更快的輕量級模型,則可以作為「執行者」,專注於遵循這些高品質的藍圖來完成任務。這種分層協作的架構,不僅能大幅降低運營成本,也為建構更複雜、更模組化的 AI Agent 系統鋪平了道路。
總結來說,Self-Discover 的探索讓我們窺見了 LLM 發展的下一個階段。當模型學會的不再只是答案,而是解決問題的方法論時,它們才真正開始從一個龐大的知識庫,蛻變為一個具備初階通用智慧的協作者。未來 AI Agent 的設計重點,也將隨之從追求單一模型的極致性能,轉向如何有效地生成、驗證、重用和治理這些由模型自我發現的推理策略。
延伸閱讀
- Self-Discover: LLMs Self-Compose Reasoning Structures (Zhou et al., 2024)
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (Wei et al., 2022)
- LLM-powered Autonomous Agents (Lilian Weng)
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。