重新定義 AI 知識層:OKF 的價值不在儲存,而在索引
OKF 值得關注的,不是它又多了一種知識格式,而是它把 AI knowledge layer 重新定義成索引層。對 agent 來說,真正重要的不是囤積原始資料,而是建立穩定、可追溯、可維護的知識映射。
企業在建構 AI Agent 的知識層時,最大的陷阱是把它當成一個無所不包的資料庫,最終只會養出一個難以維護的資料墳場。近期 Google Cloud 在 2024 年 3 月推出的 Open Knowledge Format (OKF) 讓我們重新思考這個問題:知識層的核心價值,或許根本不在於儲存原始資料,而在於建立一個穩定、可追溯、可維護的「索引層」。OKF 的設計理念,正是將知識管理從「儲存」的泥淖,拉向「映射」的清晰架構。
為什麼多數 AI 知識庫都註定成為資料墳場?
自從 Retrieval-Augmented Generation (RAG) (Lewis et al., 2020) 成為主流架構後,多數企業導入 AI 的第一步,就是將內部文件——無論是 PDF、Confluence 頁面還是 Google Drive 文件——全部丟進向量資料庫,期待 AI 能「讀懂一切」。這個看似直觀的作法,很快就會撞上三堵高牆:
- 資料不穩定(Volatility): 原始文件頻繁變動,版本混亂,導致 AI 的回答時好時壞,難以預測。
- 脈絡失真(Context Loss): 文件被切分成無數個 chunk 進行向量化,原始的結構與關聯性蕩然無存。AI 雖然能找到片段,卻無法理解全局。
- 追溯困難(Traceability): 當 AI 給出一個基於內部文件的答案時,我們很難確定它引用的究竟是哪個文件的哪個版本,導致除錯與驗證成為一場惡夢。根據 Vectara 在 2024 年的研究,即使是頂尖的模型,在 RAG 應用中仍有高達 8-15% 的幻覺比例。
這些問題的根源,在於我們錯把「資料傾倒」當成了「知識建構」。我們創造了一個巨大的、不斷膨脹的資料湖,卻沒有建立一套有效的治理機制。這不是知識層,而是資料墳場——埋葬著大量資訊,卻難以從中提煉出可靠的智慧。
OKF 不只是 Markdown,它如何成為知識映射的契約?
初看之下,Google Cloud 推出的 Open Knowledge Format (OKF) 規格極其簡單:它就是 Markdown 檔案,外加一段 YAML frontmatter。這種低門檻的設計,讓既有文件可以輕易地加上幾行 YAML 就完成轉換,導入成本極低。但當我實際將它導入系統後,很快就發現它的重點完全不在於 Markdown 的內容,而在於 YAML frontmatter 所扮演的「契約」角色。
這段 YAML 就像是為每一份知識文件簽訂的「身分證」,它定義了幾個關鍵的元數據:
id: 一個獨一無二且穩定的識別碼。version: 明確的版本號,解決了文件變動的追溯問題。source: 指向原始、權威的資料來源(例如 Confluence 的某個頁面連結)。valid_from/valid_until: 知識的生命週期,讓過時的資訊可以自動失效。
OKF 並非設計來取代你現有的 Confluence 或 Google Drive,而是作為一層穩定、面向 AI 的「知識中介層」。它的目標不是儲存,而是索引。(Google Cloud, 2024)
正是這個結構化的「契約」,讓 OKF 超越了一般的檔案格式。它不是要取代你現有的文件系統,而是要在混亂的原始資料之上,建立一層穩定、清晰、可供 AI 直接利用的知識鏡像。
如何從「資料層」轉向「索引層」?
OKF 帶來的最大啟示,是將 AI 的知識層從「資料儲存層」重新定義為「知識索引層」。這兩者有著本質的區別:
| 資料層(傳統 RAG) | 索引層(OKF 思維) | |
|---|---|---|
| 目標 | 儲存所有原始文件 | 映射與索引穩定知識 |
| 處理對象 | 動態、混亂的原始檔案 | 經過策展、版本化的知識鏡像 |
| 核心挑戰 | 資料同步、版本控制 | 知識治理、生命週期管理 |
| 對 AI 而言 | 一個巨大但不可靠的外部記憶體 | 一個穩定且可信賴的知識目錄 |
資料層與索引層的思維模式對比
換句話說,我們不應該再讓 AI Agent 直接去資料墳場裡大海撈針。相反地,我們應該為它建立一個圖書館的「卡片目錄」(card catalog)。每一張 OKF 卡片都清楚標示了某個知識點的標題、版本、來源與有效期限。Agent 首先查閱這個高度結構化、穩定可靠的目錄,當需要深入細節時,再透過 source 連結去調閱原始文件。
這種架構轉變,將複雜的資料治理問題,轉化為相對單純的索引管理問題。根據 NIST 在 2023 年發布的 AI 風險管理框架,確保 AI 系統的「可信度」與「可追溯性」是核心要求。OKF 的索引層設計,恰好為此提供了具體的實踐路徑。它讓知識的每一次引用都有源可溯,每一次變更都有跡可循。
OKF 對實務架構有何啟示:我們該如何治理知識,而非餵養怪獸?
OKF 的出現,提醒了所有 AI 系統的建構者:我們的工作重點應該從「如何餵給 AI 更多資料」轉向「如何為 AI 治理好一份穩定的知識地圖」。這不僅是技術選擇,更是策略思維的轉變。
在設計 AI Agent 的認知架構時,這意味著我們需要建立一個明確的「知識策展」(Knowledge Curation)流程。並非所有資訊都有資格被納入這個索引層,只有那些相對穩定、經過驗證、對 Agent 執行任務至關重要的核心知識,才應該被製作成 OKF 文件。這層人為的篩選與治理,正是確保 AI 系統長期穩定、可靠的關鍵。
最終,一個成熟的 AI 知識層,不應該比誰儲存的資料更多,而應該比誰的知識索引更清晰、更可信、更易於維護。OKF 提供了一個輕量級的起點,但其背後的「索引層」哲學,將對未來可治理 AI 系統的發展產生深遠的影響。
延伸閱讀
- Google Cloud Official Blog: Announcing Open Knowledge Format (OKF)
- Lewis, et al. (2020). "Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks" (The original RAG paper)
- Vectara (2024). "RAGs to Riches? The Tricks of the Trade for Successful Retrieval Augmented Generation"
- NIST AI Risk Management Framework
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。