AI 開發的重心轉移:從生成程式碼到可量化驗收

AI 開發的核心不再是更快產生程式碼,而是先建立可量化的驗收條件、評估閉環與回歸機制,讓模型產出能真正進入可靠的工程交付。

AI 開發的重心轉移:從生成程式碼到可量化驗收

AI 開發的關鍵已不在能否快速生成程式碼,而在能否設計可量化、可回歸的驗收系統。當模型參與交付,團隊必須先定義 acceptance criteria、evaluation harness 與責任邊界,才能把速度轉化為穩定的軟體品質。

當 AI 成為主力開發者,我們的瓶頸在哪裡?

在近期一場由 AWS 日本解決方案架構師高野賢司主講的研討會中,一個核心觀點被提出:程式碼的編寫主體,正快速地從人類轉移到 AI。像 Amazon Q Developer 這類工具,或是更進一步的 AI 軟體工程師代理(AI Agent),已經能自主完成探索、編輯、測試等一系列開發任務。高野先生將其類比為自動駕駛的 Level 3——在特定條件下,系統可以完全接管駕駛,人類只需在必要時介入。

這意味著,軟體工程師的角色正在發生根本性的轉變。我們不再是逐行撰寫邏輯的工匠,而是更像一位建築師或產品經理,主要職責轉變為兩大核心:首先,精準傳達意圖,亦即如何用自然語言、規格文件或測試案例,清晰地向 AI 描述我們「想要什麼」;其次,則是高效審核成果,確保能快速、準確地驗證 AI 交付的成果「符不符合我們的要求」。

瓶頸因此從「寫得有多快」轉移到「驗收得有多準」。如果我們對 AI 生成的程式碼缺乏系統性的品質保證機制,那麼開發速度的提升,只會被後續無盡的 bug fixing、重構與技術債所抵銷。開發者「You build it, you own it」的核心精神,在 AI 時代不僅沒有過時,反而變得更加重要。正如 Amazon CTO Werner Vogels 早在 2006 年所強調的,開發團隊必須對其創造的產品負起端到端的責任,無論其中有多少比例是由 AI 完成的。

Design for Evaluation:先設計驗收,再交付 AI

面對這個挑戰,一個稱為「為評估而設計」(Design for Evaluation)的設計思想應運而生。它的核心主張非常簡單:在要求 AI 開始生成任何程式碼之前,我們必須先設計好如何評估它的產出。

這不僅僅是傳統的單元測試或整合測試,而是一套更宏觀、更系統化的工程實踐。它要求我們在專案初期就建立起一個完整的評估循環,這個循環與傳統的 MLOps 或 DevOps 流程緊密結合,但更聚焦於 AI 生成內容的品質與可靠性。這個系統至少應包含以下幾個關鍵部分:

明確的驗收標準:定義「成功」的樣貌

這包括功能性需求(它是否完成了任務?)、非功能性需求(效能、安全性、可讀性如何?)、程式碼風格是否符合團隊規範等。這些標準必須是可量化的,而不只是模糊的「感覺良好」。

自動化的評估框架:打造智慧驗收工具鏈

這是一套自動化工具鏈,能夠接收 AI 生成的程式碼,並根據預設的驗收標準進行評分。這遠比早期的 HumanEval(包含 164 個程式設計問題)等基準測試複雜,更接近於像 SWE-bench 這樣,能夠在真實 GitHub issue 上進行驗證的框架。該研究顯示,頂尖模型已能解決約 13% 的真實世界問題。

持續的回歸驗證:確保品質不倒退

AI 的行為可能是不穩定或不可預測的。即使是同一個提示,不同版本的模型也可能產生截然不同的輸出。因此,必須建立一套回歸驗證機制,確保 AI 的新貢獻不會破壞現有功能,這對於維護長期專案至關重要。

清晰的責任邊界:人與 AI 各司其職

AI 應該負責什麼?人類審核者又該聚焦在哪裡?定義清晰的邊界,可以讓我們將有限的人力投入到最關鍵的環節,例如業務邏輯的正確性、架構設計的合理性,而不是耗費在 AI 擅長的語法修正或模板化工作上。

如何建立有效的 AI 開發評估循環?

建立這樣一套評估系統,本質上是將軟體品質保證的思維,從「事後測試」提前到「事前設計」。這需要工程文化的轉變,以及對新工具鏈的投資。

在 AI 驅動的開發流程中,評估框架本身,就是最重要的產品規格書 (spec)。它定義了成功的樣貌,並為 AI 的創造力提供了護欄。

實務上,這意味著我們的開發流程會更像這樣:當接到一個新需求時,第一步不是打開 AI 聊天視窗開始提示,而是先撰寫或擴充我們的評估腳本。這個腳本可能包含新的測試案例、效能指標、或安全掃描規則。唯有當這個「評估護欄」建立起來後,我們才將任務交給 AI 開發代理。AI 在這個框架內自主探索、編寫、並反覆測試,直到它的產出能夠通過所有驗收標準為止。

這個過程與學術界正在探索的 AgentBench 或 Stanford HELM 這類更廣泛的 AI 代理評估框架一脈相承,但更聚焦於軟體交付的具體場景。它不僅評估 AI 的能力,更重要的是將評估過程本身整合為軟體生命週期的一部分。這也讓我們能夠更好地管理和驗證 AI 在複雜任務中的表現,例如與外部工具的互動。

最終,軟體工程師的價值,將體現在設計、建立和維護這套精密的評估系統上。我們的工作是確保無論程式碼由誰編寫,最終交付到用戶手中的,都是一個高品質、可信賴且安全的產品。從這個角度看,AI 不是來取代工程師的,而是將我們從繁瑣的實作細節中解放出來,讓我們能更專注於軟體工程中最具創造力與挑戰性的部分:定義品質、設計架構與承擔責任。



我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。

延伸閱讀