AI 開發的瓶頸轉移:當 Code 不再稀缺,「批評」與「驗證」成為新護城河
Shopify 的 AI 轉型經驗,揭示了工程團隊的下一個挑戰。當大型語言模型能以驚人速度產出程式碼,真正的生產力瓶頸已不再是「生成」,而是「審核」。這篇文章將探討為何建立強大的驗證與批評系統,才是拉開差距的關鍵。
在 AI 程式開發的浪潮中,我們正目睹一場根本性的瓶頸轉移。過去,工程生產力的關鍵在於如何寫出更多、更好的程式碼;如今,當模型生成能力已足夠強大,真正的挑戰已轉向如何有效審核、驗證與部署這些由 AI 產生的海量變更。真正的生產力差距,將不再來自更快的程式碼生成,而是來自於誰能建立更強大、更有效率的批評與驗證系統。這不僅是工具的演進,更是開發流程與治理思維的重塑。
為什麼 AI 寫的程式碼,反而可能導入更多 bug?
一個看似矛盾的現象正在發生:即使大型語言模型(LLM)平均能寫出比人類工程師更簡潔、錯誤更少的程式碼,但在實務上,全面導入 AI 輔助開發的團隊,卻可能面臨生產環境中 bug 數量不減反增的窘境。Shopify 的 CTO Mikhail Parakhin 在一次深度訪談中,點出了這個問題的核心:瓶頸已經從「生成」轉移到「審核」。
當一個工程師每天需要審查的 Pull Request (PR) 數量從個位數暴增到數十甚至上百個時,人類的認知頻寬就成了最稀缺的資源。程式碼的產出速度超越了我們的驗證能力,導致了幾個連鎖反應:
- PR 審核品質下降:審核者被迫在速度與深度之間取捨,難以對每一行由 AI 生成的程式碼進行滴水不漏的檢查。
- 測試失敗率增加:大量的程式碼變更,即使單一變更品質很高,組合在一起時也更容易引發非預期的交互作用與整合問題。
- 部署回滾(Rollback)更頻繁:最終,這些未被充分驗證的問題滲透到生產環境,導致系統不穩定,需要緊急回滾。
這證實了許多研究的觀點,例如微軟研究院的一篇論文就曾指出,傳統的程式碼審查在發現深層邏輯錯誤方面效率有限。當 AI 將程式碼產量放大十倍、百倍時,這個弱點也被同步放大了。因此,Shopify 選擇不採用市面上的通用 AI 審查工具,而是投入資源打造自己的 PR 審核流程,因為他們體認到,問題的解方不在於加速生成,而在於強化批評與驗證的循環。
Shopify 的解方:如何建立一個強大的內部批評系統?
面對由 AI 帶來的「程式碼洪水」,與其在下游疲於奔命地審核,不如在上游建立一個強大的、自動化的驗證與批評系統。這正是 Shopify 這家成立超過 20 年、市值近 2000 億美元的公司正在實踐的路徑。他們打造了一系列內部工具,構成一套從實驗、優化到部署前的完整治理框架。
真正的突破點,不在於並行運作更多的 AI Agent,而在於建立更好的批評迴路(critique loops)與更強的驗證模型。
其中三個核心計畫——Tangle、Tangent 與 SimGym——揭示了未來 AI 驅動開發的樣貌:
- Tangle:Tangle 是一個確保機器學習與資料工作流「可重現」(reproducible)的平台,它讓任何實驗從一開始就具備產品級的協作能力,有效避免了從研究原型到生產部署的轉換成本與潛在風險。
- Tangent:Tangent 則是一套自動化的研究迴路,專門用於優化搜尋、佈景主題、提示詞壓縮等複雜任務。它將「優化」這件事民主化,讓產品經理等非技術專家也能輕鬆定義目標、進行實驗,本質上就是一個高效的自動化批評與改進引擎。
- SimGym:而 SimGym,或許是 Shopify 最具護城河意義的系統。它巧妙地利用 Shopify 龐大的真實歷史交易數據,建立了一個高擬真度的「客戶模擬器」。任何新的功能或程式碼改動,都可以在 SimGym 中進行虛擬 A/B 測試,精準預測其對轉換率的影響,而無需承擔真實上線的風險。這無疑是一個終極的、部署前的強大批評系統。
這套系統的強大之處在於,它將「批評」從一個被動、人工的環節,轉變成一個主動、自動化、且貫穿開發週期的核心流程。當程式碼由機器生成時,它的品質也應該由更聰明的機器系統來驗證。
開發流程的未來:我們需要新的 Git Metaphor 嗎?
當程式碼以機器的速度被創造和修改,我們沿用數十年的開發協作模式——以 Git、Pull Request 和 CI/CD 為核心的流程——可能需要一次徹底的革新。Parakhin 提出了一個發人深省的問題:我們是否需要一個全新的 Metaphor?
目前的 PR 模型是為人類協作設計的,它假設變更是小規模、可理解且需要人工討論的。但當一個 AI Agent 可以在幾分鐘內重構整個程式庫,這種以「diff」為基礎的審核模式顯然力不從心。這呼應了 Andrej Karpathy 提出的「軟體 2.0」概念,即軟體開發的重心將從人類手寫指令式程式碼,轉向由數據驅動、優化而來的神經網路。
未來的開發流程,審核的重點可能不再是逐行檢查程式碼的語法或風格,而是驗證程式碼是否符合「意圖」(intent)。開發者定義「什麼是目標」,而 AI 系統負責生成、測試、並證明其解決方案的正確性與安全性。這也解釋了為什麼像 GitHub Copilot X 這類工具正朝著更深度的測試生成、文件撰寫等方向演進。同時,Shopify 內部也在積極探索非 Transformer 架構,例如用於低延遲查詢的 Liquid AI,這顯示他們願意從根本上挑戰現有的技術堆疊,以適應新的典範。
從 Shopify 的實踐中我們可以看到,當 AI 補足了程式碼「生成」的短板後,真正的競爭力將來自於企業的「治理」能力——如何設計出一套能夠駕馭、驗證並安全部署 AI 創造力的系統。這場競賽的下半場,才正要開始。
延伸閱讀
- Latent Space Podcast: How Shopify is Going All-In on AI
- Microsoft Research: Code Reviews Do Not Find Bugs (2013)
- Andrej Karpathy: Software 2.0
- Hasani, R., Lechner, M., et al. (2021). Liquid Time-constant Networks.
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。