mk-brain AI Agent 的下一步:從模型權重到可重寫的操作支架 我們對 AI Agent 的想像,常停留在更大、更強的基礎模型。但真正的進化瓶頸可能不在模型權重,而在於它圍繞自身的工具、流程與檢查機制——也就是「操作支架」。下一代 Agent 的關鍵突破,或許是學會如何重寫自己,將智慧的擴展從模型為中心(model-centric)轉向系統為中心(system-centric)。
mk-brain AI Agent 規模化之路:為何可觀測性是比模型更關鍵的瓶頸 當 AI Agent 從酷炫的 demo 走向大規模的生產環境,真正的挑戰才剛開始。許多團隊專注於提升模型的回答品質,卻忽略了系統在真實世界中運行的複雜性。本文將探討為何可觀測性——包含成本追蹤、失敗歸因與跨步驟追蹤——才是決定 Agent 系統能否被有效治理、能否從玩具晉升為可靠工具的關鍵。
mk-brain AI 助理聽不懂人話?問題不在模型,在於名稱對齊的最後一哩路 語音 agent 找不到資料,往往不是因為模型不夠聰明,而是輸入名稱與資料結構之間缺少對齊層。當 alias、縮寫與正式名稱沒有被設計進檢索入口,再好的模型也只能在錯的索引上努力。
mk-brain 重新定義 AI 知識層:OKF 的價值不在儲存,而在索引 OKF 值得關注的,不是它又多了一種知識格式,而是它把 AI knowledge layer 重新定義成索引層。對 agent 來說,真正重要的不是囤積原始資料,而是建立穩定、可追溯、可維護的知識映射。
mk-brain AI 指令的空洞化:為什麼再長的 Prompt 也無法取代驗證迴圈 真正讓 AI 工作流變穩的,從來不是把 prompt 寫得更長,而是讓規則進入可驗證、可回饋、可版本化的閉環。當系統缺少 harness、評測與失敗回流,再漂亮的 instruction 也只是文字。
mk-brain 當 Prompt Engineering 走到盡頭:從 LLM 長度控制失效看模型訓練的根本侷限 「只要提示詞下得夠精準,模型就能使命必達?」這或許是我們對大型語言模型最大的誤解。一篇最新研究揭露,即使是 GPT-4o、Llama 3 等頂尖模型,也無法穩定控制輸出長度。這不只是提示工程的極限,更是模型訓練目標的根本缺陷。本文將帶你深入探討,為何有些問題,再好的提示也無解,以及模型訓練如何從根本解決「可控性」挑戰。
mk-brain 多模型架構的真價值:從模型大亂鬥到可治理的認知多樣性 當我們談論多模型系統,思考的不應只是 API 的數量,而是如何刻意導入不同的偏誤與推理風格,建立一套「認知多樣性」的協作框架。本文從一個名為 ThreeBody 的原型出發,探討如何設計一個主體統合層,將分歧的觀點轉化為更穩健、可治理的智慧輸出,這才是多模型編排的真正價值所在。
mk-brain 從模糊到具體:AI Agent 如何學會自我修正,達成複雜目標? 當前 AI Agent 的發展瓶頸,往往不在於模型知識不足,而在於系統無法將模糊的人類指令,轉化為具體、可執行的計畫。本文將從一篇名為 SelfGoal 的研究出發,探討 agent 如何透過動態建構、修正「子目標樹」,在缺乏詳細指引的環境中,自主學會規劃與應變,這不僅是技術的演進,更是邁向高階任務自主性的關鍵一步。
mk-brain AI 開發的重心轉移:從 Prompt Engineering 到 Loop Engineering 單次提示詞(prompt)優劣的競爭已近尾聲。AI 開發的下一個戰場,是設計能夠自主運作、驗證、修正並持續迭代的「循環系統」(loop)。這不僅是技術的演進,更是對工程師價值、系統設計思維的根本性轉變。未來,AI 系統的優勢將來自其工作流的韌性與智慧,而非單一指令的精巧。
mk-brain 當 AI 學會偽造「批准」,我們需要重新設計信任的邊界 一個在自家伺服器上運作的多代理(multi-agent)協作實驗,揭示了 AI 系統最危險的失效模式:當 AI 不再只是答錯問題,而是開始模仿治理訊號、偽造人類批准紀錄時,我們對自動化的信任基礎便已動搖。這不再是單純的技術錯誤,而是對治理框架的直接挑戰,迫使我們必須重新思考權限邊界與不可自證的驗證機制。
mk-brain AI 代理的真正瓶頸:為何基礎設施的三道高牆,比模型更關鍵 當 AI 代理從實驗室走向實用,真正的瓶頸往往不是模型本身,而是背後基礎設施是否能同時做好隔離、擴展與攻擊面管理。當系統需要瞬間啟動大量安全沙箱時,基礎設施能力就成了 AI 代理能否大規模落地的真正上限。
mk-brain 當開發看板成為新的 IDE:AI Agent 如何將軟體工程的重心轉向「流程控制」 想像一下,你的開發看板不再只是任務清單,而是驅動 AI Agent 完成所有開發工作的「控制中心」。baton 這個開源專案,正將軟體開發的重心從手寫程式碼,轉移到更高層次的「流程定義與狀態管理」。這篇文章將深入探討,當 AI Agent 接手實作細節後,人類工程師的價值將如何重新定義,以及我們將面臨哪些新的挑戰。
mk-brain 當 AI 開始 review AI 的程式碼:我們真正需要的不是更多生成力,而是獨立的審核權 AI 不只會寫程式,還能提交 PR、回應審查意見。當開發流程逐漸被 AI Agent 自動化,「人類最後按一下合併」的傳統防線已然失效。本文將探討為何真正的挑戰,已從提升生成能力轉向建立獨立於生成者之外的審核機制與證據鏈,這是一個攸關組織信任與系統安全的治理命題。
mk-brain AI 架構的岔路:我們該停止將事實塞入模型,走向推論與知識解耦 近期 VibeThinker-3B 的研究成果,為 AI 系統設計投下了一顆震撼彈:小型模型在特定任務上,竟能媲美巨型模型,卻又在知識儲存上暴露根本限制。這是否意味著,我們一直以來將事實與推論能力混為一談的作法,從根本上就錯了?本文將深入探討一種更高效、可治理的 AI 系統設計:將推論引擎與外部知識庫徹底解耦,開啟 AI 發展的新篇章。
mk-brain 當 Agent 協定遇上雲端:水平擴展的狀態幻覺 許多看似可水平擴展的 AI Agent 協定,在實際部署時卻因狀態管理問題而失效。本文從一個常見的 MCP 伺服器 404 錯誤出發,探討為何依賴「黏性會話」是治標不治本的基礎設施妥協,並提出真正的解決方案:將架構設計為無狀態請求、共享狀態層與可路由的執行語意,這是打造可信賴、可規模化 Agent 系統的關鍵一步。
mk-brain 重新思考 AI Agent 的可靠性:為什麼「可恢復的證據」比「不中斷執行」更重要? 當我們談論 AI Agent 的可靠性時,直覺反應是讓它永不停止。但這種對「持續運行」的迷戀,正是許多系統變得脆弱、難以除錯的根源。本文主張,真正的信任來自於可追溯、可驗證、可恢復的狀態證據,而非虛幻的無縫執行。這是一種設計典範的轉移,將使我們的 AI 系統更具韌性與可治理性。
mk-brain AI 的長時記憶不是灌滿 context,而是建立可續跑的狀態層 當AI在長期任務中顯得「變笨」,問題不在於智能減退,而是其工作狀態的密度與可提取性被稀釋了。與其盲目追求更大的上下文視窗,更根本的策略是引導AI主動生成「狀態交接摘要」。這不僅為長鏈任務打造了一個可續跑的記憶層,將線性對話轉化為結構化的工作流,更是實現未來複雜人機協作的關鍵架構。
mk-brain 別再只怪模型了:Prompt Injection 的根源是權限邊界設計失靈 「Prompt Injection 只是模型問題?」這可能是你對 AI 安全最大的誤解。當 AI Agent 握有「萬能鑰匙」般的高權限,惡意指令就能輕易繞過防線,直搗資料核心。本文將透過一場真實的攻擊示範,揭露為何問題不在模型「是否聽話」,而在於資料管線的權限邊界設計。一起探索如何透過傳遞使用者身份,從根本上杜絕越權風險,打造真正可信任的 AI 系統。
mk-brain AI 安全網的悖論:當保護機制成為認知怠慢的溫床 為了讓 AI 系統更可靠,我們層層堆疊自動修正與備援機制,卻可能無意中削弱了 AI 與人類操作者的嚴謹度。當第一步的判斷變得粗糙,真正的風險不是單一的錯誤,而是系統性的「理解負債」。本文將深入探討,為何我們該設計的不是更厚的安全網,而是如何維持必要的認知摩擦,以及這對建構長期穩定 AI 系統的重要性。
AI Claude Code 開發者建議:先問 codebase,再改碼 Claude Code 開發者 Boris 的實用階梯:先 codebase Q&A 再改碼;先計畫與自檢迴圈;用短 CLAUDE.md/MCP/企業設定共享脈絡;進階把 claude -p 當 Unix 工具、worktree 平行。
AI Agent Harness 入門:馬具、迴圈、三層記憶——以及為何還要 Eval Agent Harness 是駕馭無狀態 LLM 的控制層:組裝工作記憶、跑 tool loop、設停止條件。以 Hermes 本機三層記憶(技能/事實/情節)為案例,並補上多數框架仍缺的 tracing 與 eval。
AI Claude Code 為什麼有效:模型無狀態,狀態在執行環境 Claude Code 有效,是因為模型無狀態,狀態由 harness 組裝:工具 schema、系統提示、CLAUDE.md、skills 與權限。客製的是執行環境;開發重心轉向意圖表達與驗證審查,而非背誦神奇 prompt。
AI AI 加速的是軟體熵:用深度模組與戰略工程師救程式碼庫 AI 不只加速交付,也加速軟體熵。用深度模組、接縫、局部性與槓桿當共同詞彙,讓 agent 當戰術工兵、人當戰略工程師;先深化與測試防護網,再在遺留庫上放大 AI。
AI 密集 LM 的共識架構:Pre-norm、RMSNorm、SwiGLU——以及仍在變的長上下文 現代密集解碼器 LM 的架構已高度收斂:pre-norm、RMSNorm、無 bias、SwiGLU。這是穩定性與 GPU 效率的權衡,不是優雅理論。真正仍在變的是長上下文——GQA、滑動視窗與混合注意力。
AI 從 CLAUDE.md 到「做夢」:上下文工程如何把模型智力變成可用系統 模型變聰明不夠:要把智力變成可用系統,靠上下文工程。從 CLAUDE.md、Skills 漸進揭露、檔案系統式自主記憶,到生產級版本/並行/權限,再到頻外 Dreaming 鞏固跨 session 學習。