Maki Chiang|Notes

Maki Chiang|Notes

Longform notes on work, products, and reality.

從 AppAgent 看通用操作代理:當 AI 不再呼叫 API,而是直接「看懂」手機介面
mk-brain

從 AppAgent 看通用操作代理:當 AI 不再呼叫 API,而是直接「看懂」手機介面

想像一下,AI 不再只能呼叫程式碼,而是能像你我一樣,直接「看懂」手機螢幕、操作 App。這不僅是技術路徑的重大轉變,更宣告了 AI 代理的核心挑戰已從語言理解,轉向真實世界的環境感知與穩定操作。本文將以 AppAgent 為例,深入探討通用操作代理如何繞過傳統 API 限制,以及它在跨應用程式協作與真實介面中面臨的未來挑戰。
8 min read
從文字到像素:當 VLM 開始直接操作 GUI,AI Agent 的下一步是什麼?
mk-brain

從文字到像素:當 VLM 開始直接操作 GUI,AI Agent 的下一步是什麼?

過去 AI Agent 多半依賴 API 或解析 HTML 來與軟體互動,這層抽象限制了它們的通用性。但現在,高解析度視覺語言模型(VLM)如 CogAgent,已能像人類一樣「看懂」並操作圖形介面(GUI)。這場從文字到像素的典範轉移,將如何徹底改變我們對 AI Agent 的想像,並為通用電腦助理與自動化工作流開啟全新可能?
8 min read
超越 Transformer 與 Mamba 之爭:一個統一模型架構的新起點
mk-brain

超越 Transformer 與 Mamba 之爭:一個統一模型架構的新起點

長期以來,AI 模型架構的發展彷彿一場路線之爭:究竟是選擇 Transformer 強大的表達能力,還是擁抱 Mamba 等狀態空間模型(SSM)的線性效率?一篇突破性的研究論文揭示,這兩者並非對立,而是一個更深層結構的兩種表現形式。這項發現不僅終結了長期的辯論,更為下一代 AI 系統的設計開闢了全新的可能性。
7 min read
解碼 AI 黑盒子:當可解釋性成為大型模型的基礎設施
mk-brain

解碼 AI 黑盒子:當可解釋性成為大型模型的基礎設施

大型語言模型(LLM)的強大能力令人驚嘆,但其內部運作的「黑盒子」特性,卻讓AI的安全性與可靠性蒙上陰影。現在,Anthropic 的一項突破性研究,成功利用稀疏自動編碼器(SAE)大規模解鎖 Claude 3 Sonnet 的內部語義特徵。這不僅是學術上的里程碑,更預示著可解釋性將從研究工具,一躍成為未來AI審計與治理的核心基礎設施。
6 min read
AI 的「我不知道」,比答對更重要:從信心分數到自我反思的信任躍升
mk-brain

AI 的「我不知道」,比答對更重要:從信心分數到自我反思的信任躍升

大型語言模型(LLM)常過度自信,即使答案錯誤也理直氣壯。一篇最新研究指出,AI 的真正可靠性,不在於給出冰冷的信心分數,而是讓它學會「自我反思」,清楚解釋其不確定性的理由。這不僅是技術校準,更是建立可信任、可治理 AI 系統的關鍵一步,讓 AI 從黑箱神諭轉變為坦誠的協作夥伴。
6 min read
我做了三個月的「七位一體」,跟 Perplexity Max 的「模型委員會」拓樸一模一樣——除了一個關鍵差別
Multi-Agent

我做了三個月的「七位一體」,跟 Perplexity Max 的「模型委員會」拓樸一模一樣——除了一個關鍵差別

今天看到 Perplexity Max 推出「模型委員會」(Model Council),它的拓樸跟我自己跑了三個月的「七位一體」幾乎一模一樣。但繼續往下讀,我意識到這件事的意義不是「我被抄了」或「業界終於追上了」——而是一個更有意思的問題:長得一樣的兩個東西,本質可以差非常多。
10 min read