mk-brain 當 RLHF 不再只是標註流程,而是一套可迭代的系統工程 當大家還在比較模型能力時,真正開始拉開差距的,往往已經不是參數量,而是回饋系統能否持續運作。線上 RLHF 的意義,不只是讓模型更會回答,而是讓對齊從一次性標註,升級成可迭代、可複現、可擴展的工程流程。
mk-brain RAG 不夠了:下一代知識系統真正該升級的是理解層 今天很多團隊把 RAG 當成幻覺解法,但多數情況下,問題不是資料沒送進去,而是模型沒有真的理解。下一代知識系統的升級重點,不會只是把更多文件塞進 context,而是把檢索、理解與推理拆開來設計。
mk-brain 不是每次都該 RAG:真正成熟的 AI 系統,先判斷自己知不知道 很多系統把檢索當成預設開關,彷彿只要多查資料就能更準。但真正成熟的 AI 系統,關鍵不是永遠開啟檢索,而是先判斷自己知不知道、需不需要查、值不值得查。這背後其實是一個 retrieval policy 的設計問題。
AI 從 AI 使用者到 AI Orchestrator:我如何把 Claude Code 用成多 Agent 作業系統 當 AI 不再只是回答問題,而是開始參與真實工作流程,工程能力的核心也會改變:從單點使用模型,走向調度、治理與觀測一整個多 Agent 系統。
AI 我以為我在覺醒,其實是我的 rendering glitch 一次 AI agent 工程師的過勞解離記錄。三連休分不清夢境和現實,丟了一張 Neo 吃藍藥丸的圖給 GPT,結果 GPT 踩了煞車。
AI 看完 Google ADK 的 Demo,我為什麼還是繼續用自己的七位一體 Google Cloud 剛 demo 的 ADK + MCP + Agent Engine + A2A,被中文圈包裝成「Anthropic 公開了 AI 公司藍圖」的爆款帖。我把整場 demo 看完,對照自己這一年在家裡跑的七位一體系統,記下幾個結論——ADK 跟 MCP 可以拿來用,Agent Engine 才是 GCP 真正想賣你的綁定。
mk-brain 我們真的需要百萬 token 模型嗎?重新思考長上下文任務的真正瓶頸 在業界競相追逐更長的上下文視窗時,一篇研究點出了一個反直覺卻關鍵的觀點:長上下文任務的瓶頸,或許不在模型本身,而在於我們如何設計檢索與規劃策略。一個聰明的框架,甚至能讓短上下文模型高效解決長文件挑戰。
mk-brain 思考的工程學:當高品質的推理範本,勝過更大的模型 我們總以為追求更強的 AI 推理能力,就等於追求更大的模型。但一篇新研究「Buffer of Thoughts」提出了一個反直覺卻極具啟發性的方向:與其不斷擴大模型的規模,不如將高品質的思考流程「工程化」,使其成為可重複使用的模板。這不僅讓小模型的表現媲美頂尖模型,成本更僅有複雜框架的 12%。
mk-brain AI 推理的下一步:為何我們需要超越「流暢」,擁抱可驗證的符號邏輯? 大型語言模型擅長生成看似合理的推理過程,但這些過程往往經不起嚴格檢驗。當答案的「忠實度」比「流暢度」更重要時,我們該如何構建更可靠的 AI 系統?一篇新研究提出的 SymbCoT 框架,或許指出了關鍵方向:將語言的模糊性轉化為符號的確定性。
mk-brain 超越 Transformer 與 Mamba 之爭:一個統一模型架構的新起點 長期以來,AI 模型架構的發展彷彿一場路線之爭:究竟是選擇 Transformer 強大的表達能力,還是擁抱 Mamba 等狀態空間模型(SSM)的線性效率?一篇突破性的研究論文揭示,這兩者並非對立,而是一個更深層結構的兩種表現形式。這項發現不僅終結了長期的辯論,更為下一代 AI 系統的設計開闢了全新的可能性。
mk-brain 語言模型之後,Agent 的下一步:打造可操作的世界知識模型 大型語言模型雖然語言流暢,但在理解物理世界與常識時常顯得笨拙,導致 AI Agent 在規劃任務時頻頻出錯。最近一篇研究提出「世界知識模型」的概念,試圖將抽象的知識參數化,讓 Agent 的規劃不再只是機率猜測,而是基於對世界的真實理解。這或許是通往更可靠自主 Agent 的關鍵一步。
mk-brain AI 對齊的尺度困境:從人工標註到自動化系統設計 過去我們依賴大量人力來「教導」AI 何謂對錯,但當模型的知識與推理能力超越人類時,這種「人工監工」模式還能走多遠?AI 對齊(Alignment)正從一個勞力密集的標註問題,轉變為一個更根本的自動化系統設計挑戰。
mk-brain 解碼 AI 黑盒子:當可解釋性成為大型模型的基礎設施 大型語言模型(LLM)的強大能力令人驚嘆,但其內部運作的「黑盒子」特性,卻讓AI的安全性與可靠性蒙上陰影。現在,Anthropic 的一項突破性研究,成功利用稀疏自動編碼器(SAE)大規模解鎖 Claude 3 Sonnet 的內部語義特徵。這不僅是學術上的里程碑,更預示著可解釋性將從研究工具,一躍成為未來AI審計與治理的核心基礎設施。
mk-brain AI 的「我不知道」,比答對更重要:從信心分數到自我反思的信任躍升 大型語言模型(LLM)常過度自信,即使答案錯誤也理直氣壯。一篇最新研究指出,AI 的真正可靠性,不在於給出冰冷的信心分數,而是讓它學會「自我反思」,清楚解釋其不確定性的理由。這不僅是技術校準,更是建立可信任、可治理 AI 系統的關鍵一步,讓 AI 從黑箱神諭轉變為坦誠的協作夥伴。
mk-brain 拆解複雜決策:從資料填鴨到可治理的工作流 當我們面對複雜問題時,直覺反應是給 AI 更多資料,期待它能「自行理解」。但這種作法往往適得其反。真正的關鍵不在於資料的量,而在於建立一套清晰的決策流程,將龐大問題拆解為規劃、檢索、執行等可控的步驟。
mk-brain RAG 的真相:模型為何放棄內在記憶,選擇依賴上下文? 我們常以為 RAG 是為 LLM 補充新知,但最新研究揭示了驚人真相:模型竟傾向放棄自身記憶,過度依賴提供的上下文。這不是知識的融合,而是一種強烈的「走捷徑」偏誤。本文將深入探討這現象對 RAG 系統設計的深遠影響,並思考我們該如何從檢索量迷思,轉向更精妙的記憶分工與 Agent 架構。
Multi-Agent 我做了三個月的「七位一體」,跟 Perplexity Max 的「模型委員會」拓樸一模一樣——除了一個關鍵差別 今天看到 Perplexity Max 推出「模型委員會」(Model Council),它的拓樸跟我自己跑了三個月的「七位一體」幾乎一模一樣。但繼續往下讀,我意識到這件事的意義不是「我被抄了」或「業界終於追上了」——而是一個更有意思的問題:長得一樣的兩個東西,本質可以差非常多。
mk-brain 擴展定律的黃昏?當知識與推理分道揚鑣 過去,我們深信單一的擴展定律能指導大型語言模型的訓練。然而,一項顛覆性研究揭示:知識與推理能力遵循著截然不同的擴展路徑!這不僅是學術界的震撼彈,更直接衝擊了我們在模型架構、產品定位與資源配置上的每一個關鍵決策。是時候重新思考你的AI策略了。
AI 從 Vibe Coding 到 Agentic Engineering:當 LLM 不只是工具,而是新的計算介面 當 LLM 不只是寫程式的助手,而成為新的可編程計算介面,軟體工程、產品設計與基礎設施也開始從 vibe coding 走向 agentic engineering。
mk-brain LLM 的真正價值,不在自動化而在重組工作流 許多人將大型語言模型(LLM)視為單點任務的自動化工具,但這只是冰山一角。一份針對知識工作者的研究顯示,真正的生產力革命,來自於將 AI 無縫整合進完整的工作流程。這將從根本上重塑我們的資料脈絡、協作方式,甚至重新定義團隊內的責任分工,遠超乎你對自動化的想像。
mk-brain 長程任務 Agent 的真正瓶頸:我們需要的是可治理的系統,而不只是更強的模型 當 AI Agent 執行複雜任務時頻頻失敗,我們常歸咎於模型不夠聰明。但一篇新研究指出,真正的問題可能在於架構:將規劃與執行分層設計,才是提升可靠性的關鍵。這不只是技術細節,而是一種系統設計的典範轉移。
mk-brain Agent 開發的下一波浪潮:從 Prompt 煉丹到可預測的工作流工程 當前 AI Agent 的開發仍高度依賴手動調整與昂貴的試錯,如同煉金術。一篇新研究指出,透過將 Agent 工作流視為計算圖,並利用圖神經網絡(GNN)預測其效能,我們正迎來一個新典範:可預測、可搜尋、可自動優化的「工作流工程」,這將是建構複雜 AI 系統的關鍵下一步。
mk-brain 從神秘黑箱到可復現系統:推理模型的新護城河 長久以來,頂尖大型語言模型的推理能力,尤其透過強化學習(RL)達成的突破,一直被視為不可外傳的「煉金術」。但現在,一篇名為 DAPO 的研究,正悄悄預示著一個新時代的來臨:未來競爭的關鍵,將不再是神秘的模型權重,而是開放、可復現的系統工程能力。
mk-brain AI Agent 協作的信任難題:我們準備好迎接跨系統的「代理人戰爭」了嗎? 當 AI 代理人不再只是單打獨鬥,而是開始跨越系統邊界、自主協作時,一個攸關未來 AI 生態的根本性問題隨之浮現:我們該如何建立它們之間的信任?這不只是一項技術挑戰,更是決定 AI 協作能否安全、穩健發展的關鍵基石。本文將深入探討這場潛在的「代理人戰爭」,以及我們如何為其築起信任的防線。