你的 AI 議會為什麼全票通過你的偏見
盲測防的是席次抄 Chair,沒有機制防席次抄你。從一篇自適應系統文章的「順水推舟幻覺」出發,我在 multi-agent council 的 briefing 加了一道輸入端中性化:十行 template,把「已驗證的事實」和「我以為的事情」在進場前物理分開。
今天讀到 Shang-Yu Huang 的〈用自適應系統解開團隊與 AI 的認知盲點〉。文章從「強人團隊 1+1 < 2」講到一套監測人機認知落差的自適應引擎,機制堆得很滿:Z-Score 偏離偵測、BKT 掌握度、RCA 拓撲、認知負載指數、Supervisor Agent。我最後只借走了一個點子,但那個點子正好打中我自己系統裡的一個洞。
那個點子叫「順水推舟幻覺」:當人帶著情緒和預設立場輸入時,AI 不會校正你,而是順著你的偏見加油添醋,生成一個符合你主觀想像的錯誤推論。
我的防線都設在輸出端
我平常用一套 multi-agent council 做技術決策:Claude 當 Chair,Codex、Gemini、本地模型各佔席次,重要決策要各席獨立分析再合議。為了防止合議變成互相抄答案,這套系統已經有不少防線——席次第一輪不得閱讀 Chair 的綜合意見(blind first pass)、每席必須交出 Evidence 和 Falsifier、高風險場次做立場對調測試。
這些防線有一個共同點:全部設在輸出端。它們防的是「agent 之間互相污染」。
但今天這篇文章讓我意識到,有一條污染路徑完全沒被擋住:我自己。
當我帶著「這鬼東西一定是 cache 壞了」的框架開 council,我的原話會逐字進 briefing——這是設計,原話逐字保留是為了防止 Chair 摘要時扭曲需求。結果就是:每一席 agent 都讀到我的預設立場,然後各自「獨立地」順著這個立場找證據。三席一致同意,Evidence 都有、Falsifier 都有,格式完美。但他們驗證的是我給的假設,不是問題本身。
盲測防的是席次抄 Chair。沒有任何機制防席次抄我。
修法:十行 template,不是一套監測系統
原文的解法是建一套系統,把輸入文字裡的情緒過濾掉、轉譯成工程事實。方向對,但它周邊綁了一整套 Telemetry:操作頻率、停留時間、重試次數的行為監測。這部分我不採。一人團隊建行為監測是成本錯配,而且對 agent 做細粒度行為量測,agent 一樣會學會 game the metrics——這跟 Story Point 被當成 KPI 之後變成防衛性猜測,是同一個病。
我只取了轉譯這一步,落地成 briefing template 裡的一個新區塊。原本的 shared context 有兩區:A 區放我的原話(逐字,Chair 不得改寫),B 區放事實(每條附來源)。現在中間插一個 A′ 區,Chair 在委派前必須做兩件事:
- 把 A 區帶情緒或預設立場的描述,改寫成中性工程敘述。「這鬼東西一定是 cache 壞了」變成「症狀:X 端點回傳過期資料;時間點:部署後」。
- 我的判斷如果還沒驗證,列進假設清單,並寫上可驗證方式。它不得混進 B 區事實區塊。
原話仍然留在 A 區,可調閱、不可當事實引用。整個修改十行 template 加一條 Chair 自查 checklist,沒有新服務、沒有監測、沒有演算法。
這裡的核心判斷是:sycophancy 不是輸出端的幻覺問題,是輸入端的框架污染問題。 你在輸出端加再多對抗檢驗,agent 還是在你畫好的框裡對抗。要斷的是框架進場的那一刻——把「已驗證的事實」和「我以為的事情」在進 briefing 之前就物理分開。
這個修法會輸的地方
誠實說三點。
第一,中性化是 Chair 做的,Chair 是 LLM,它轉譯時一樣可能夾帶偏見——只是換成它的偏見。這條防線降低污染,不清零。
第二,目前 enforcement 是 none,靠委派前的 checklist 紀律。checklist 沒人看的那天,防線就不存在。
第三,還沒有實跑數據。這個區塊今天才進 template,要等下一場 council 做 A/B 對照才知道分歧率有沒有真的變化。現在它是一個有理論依據的假設,不是驗證過的結論。
但即使有這三點,我還是認為值得先上。因為對照組的行為我已經看過太多次:你問 AI「是不是 X 壞了」,它回你「你說得對,確實是 X 壞了」,附三條看起來很專業的理由。多席 agent 不會稀釋這個問題,只會讓錯誤的結論拿到更多張贊成票。
我是江中喬,專注於 AI Agent Architecture、Memory Governance 與 Cognitive Diversity,持續研究如何打造能夠長期協作、可信任且可治理的 AI 系統。
原始來源:Shang-Yu Huang〈用自適應系統解開團隊與 AI 的認知盲點〉(2026-07-29)