模型能力的商品化時代:真正的護城河是 Harness 系統工程
當 GPT-5、Claude 4 等頂尖模型的 API 唾手可得,真正的技術壁壘在哪?OpenAI Frontier 團隊的實踐揭示,決勝點已從模型本身轉移到承載模型的系統工程——Harness。這篇文章將探討為何 harness-first 的思維,是打造高品質 AI 服務的關鍵。
當頂尖大型語言模型的能力逐漸商品化,開發者能輕易透過 API 取得 SOTA 等級的智能,真正的競爭壁壘已不再是模型本身。我的觀察是,決勝點正快速轉移到承載模型的「Harness」——也就是圍繞模型的工具、評測、記憶與執行流程設計。一個 harness-first 的系統工程思維,將比你選用哪個模型品牌,更能決定最終交付的產品品質與可靠性。這是一場從模型競賽轉向系統工藝的典範轉移。
當模型成為引擎,誰來打造車身?
最近,產業的焦點總是圍繞著下一個「更好」的模型:GPT-5 何時推出?Claude 3.5 Sonnet 的視覺能力有多強?Gemini 1.5 Pro 的百萬 token 上下文如何改變遊戲規則?這種「模型中心論」的思維很直觀,卻可能讓我們忽略了更根本的問題:有了頂尖的引擎,誰來打造能贏得比賽的賽車?
這個問題的答案,在 OpenAI Frontier 團隊成員 Ryan Lopopolo 的一場深度訪談中,得到了清晰的印證。Lopopolo 所屬的,是一個僅有 3 人的小型探索團隊,他們的工作不是訓練新模型,而是將現有最強大的模型(例如 GPT-4o)的能力推向極限。他們發現,要榨出模型 100% 的潛力,關鍵不在於無止盡的提示工程,而在於建構一個強健的系統,也就是我們所說的「Harness」。
為什麼 Harness 比模型本身更重要?
Harness 這個詞,原意是馬具,用來駕馭馬匹、承載貨物。在 AI 工程的脈絡裡,它指的是圍繞著語言模型核心的所有輔助系統與基礎設施。這包括了:
- 工具(Tooling):讓模型能與外部 API、資料庫或任何程式碼互動的能力。
- 記憶(Memory):管理長期與短期對話歷史、使用者偏好與世界知識的機制。
- 評測(Evaluation):自動化、可重複地衡量系統在特定任務上表現的框架。
- 執行與協調(Execution & Orchestration):決定模型思考路徑、錯誤處理、自我修正與多步驟任務分解的控制流程。
當前,頂尖模型如 OpenAI 的 GPT-4o 或 Anthropic 的 Claude 3.5 Sonnet,在基礎推理、語言和程式碼能力上的差距已非常微小。對於多數應用場景來說,它們都是「足夠好」的引擎。然而,一個未經「駕馭」的原始模型,其輸出充滿了不確定性。它可能會產生幻覺、無法穩定地使用工具、或在複雜任務中迷失方向。
這就是 Harness 的價值所在。它扮演著馴馬師與車輛工程師的角色,將模型的原始智能,轉化為可預測、可靠且高效的產出。一個設計精良的 Harness,可以讓 GPT-4 的表現超越一個直接調用 GPT-4o 的簡易系統。這也意味著,真正的護城河,是那些難以複製的系統設計、領域知識與工程實踐。
如何建構一個強大的 AI Harness?
建構一個 harness-first 的 AI 系統,需要將思維從「提示詞」轉向「架構」。這不僅是 prompt engineering,更是 software engineering 2.0。以下是幾個核心的建構模塊:
1. 可靠的工具執行與錯誤處理
模型與世界的互動,是透過工具(或稱 function calling)完成的。一個強大的 Harness 不僅要提供工具,更要能處理工具執行失敗、回傳格式錯誤或 API 超時等問題。例如,系統需要設計重試機制、語義快取(semantic caching),甚至讓模型具備自我除錯的能力,分析為何工具調用失敗並嘗試修正。這也是 ReAct (Reasoning and Acting) 等框架背後的精神:將思維鏈與行動緊密結合。
2. 持續演進的自動化評測(Eval)
如果沒有客觀的評測,任何對系統的改進都只是憑感覺。Harness 的核心之一,就是建立一套針對核心任務的自動化評測基準。這不是學術界的通用 benchmark,而是與業務目標強相關的客製化測試集。例如,一個客服 AI Agent 的 Eval,可能包含「問題解決率」、「首次回應正確率」、「對話輪次」等指標。透過像 lm-evaluation-harness 這類開源工具的啟發,團隊可以建立 CI/CD 流程,確保每次架構或模型的調整,都能帶來可量化的提升。
一個沒有自動化評測的 AI 開發團隊,就像一個在濃霧中開車的司機,你或許在前進,但完全不知道方向是否正確,離懸崖有多近。
3. 分層的記憶與狀態管理
對於需要長期互動的 Agent 來說,記憶至關重要。一個好的 Harness 會設計分層的記憶系統,例如:
- 短期記憶:當前對話的上下文。
- 工作記憶:執行複雜任務時的中繼步驟與思考過程。
- 長期記憶:透過 RAG 或向量資料庫儲存的使用者檔案、過去的成功經驗等。
如何有效地壓縮、檢索並將這些記憶注入提示詞,是決定 Agent 能否處理複雜、長週期任務的關鍵。
4. 精巧的控制流程設計
單純的「輸入 -> LLM -> 輸出」鏈條過於脆弱。先進的 Harness 會採用更複雜的控制流程。例如,Tree of Thoughts 允許模型探索多個推理路徑並從中選擇最佳解;或是設計自我修正迴圈,讓模型在輸出前先進行自我批判與迭代。這些複雜的執行邏輯,才是 AI 系統真正產生智慧湧現(emergence)的地方。
Harness-First 思維將如何改變 AI 實務?
採用 harness-first 的開發思維,對團隊和產品策略有深遠的影響。
首先,它將團隊的重心從追逐最新模型,轉移到建立穩固、可擴展的系統基礎上。模型變成了一個可以替換的模組。今天你用 OpenAI,明天可以無痛切換到 Anthropic 或 Google,只要它們的 API 接口符合你的 Harness 設計。這大大降低了被單一供應商鎖定的風險。
其次,這也重新定義了 AI 團隊的技能需求。相比於尋找「提示詞大師」,企業更需要具備深厚軟體工程背景、懂得分散式系統、測試驅動開發(TDD)與可觀測性(observability)的工程師。正如 a16z 在其經典文章 《Emerging Architectures for LLM Applications》 中所描繪的,未來的 AI 應用架構將會越來越複雜,但也越來越標準化。
最終,這條路徑通往的是更可靠、更可治理的 AI。當我們能清晰地定義系統的每一個環節——從工具使用到記憶管理,再到評測指標——我們就離打造真正值得信賴的 AI 更近了一步。競爭的終局,比的不是誰的引擎馬力最大,而是誰的整體造車工藝更勝一籌。
延伸閱讀
- Latent Space Podcast: AGI in 3 People (Ryan Lopopolo 訪談)
- ReAct: Synergizing Reasoning and Acting in Language Models (arXiv)
- Emerging Architectures for LLM Applications (a16z)
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。