第一個 AI 說可行,第二個也同意。你不放心,再問第三個,它甚至替你補了三個理由。畫面上排著三份肯定,原本懸著的心終於放下。只是,你得到的是三次檢查,還是同一個想法的三種語氣?
意見變多,來源未必跟著變多
如果三個朋友都聽同一個人說某家店快要搬走,再分別轉告你,消息看起來來自三個方向,源頭仍然只有一個。你可以相信他們沒有故意說謊,但仍然需要知道最初的消息從哪裡來。
問不同 AI 也值得做類似的檢查。它們可能用了相近的資訊,也可能一起接受了提問裡沒有被檢查的前提。模型名字不同,並不會自動讓每份回答成為獨立證據。
Kim 等人在 2025 年發表的研究,於所測試的模型與任務中觀察到模型錯誤之間的相關性。這不能推成任何三個模型都必然一起錯,卻提醒我們:一致,本身還不是查證完成。
先看看你把什麼答案,藏進了問題
想像你問:「這個地點人潮這麼多,開咖啡店應該有機會吧?」回答很容易沿著你提供的街景往下展開。但「人潮多」是什麼時段?經過的人是否會停下?房租和座位條件如何?這些未必真的被確認。
可以把問題拆回可檢查的部分:「目前我只在週末下午看過這條街。哪些資訊還不足以判斷?」再要求對方分開列出已知、推測與待查。
如果想比較不同回答,先讓它們各自處理同一份原始資料,避免一開始就把前一份漂亮結論貼過去請下一個點評。這有助於看見不同切法,但仍不能保證它們的錯誤彼此獨立。
別只數有幾個答案,也看看有幾條路真的通向證據。
把分工放在證據上,別只放在立場上
叫一個支持、一個反對,可以增加討論的角度。只是反對得很有力,也可能沒有多一份事實。兩邊都有漂亮修辭,最後仍可能只是在替空白配音。
另一種分工,是讓一份回答檢查原始資料,一份找出必要但缺少的條件,再用實際紀錄確認最關鍵的數字。談店面,就需要相應的觀察與條件;談一份文件,就回到原文;談算式,就把計算重做一次。
AI 可以幫忙找到該查哪裡,也可以幫忙發現前後不一致。等它指出了一扇窗,你仍得確認窗外究竟有什麼。這一步,才把對話重新接回正在討論的世界。

讓一致成為線索,讓差異成為問題
三份回答相同,可以先記下共同理由,再追問它們是否依賴同一個前提。三份回答不同,也不用立即投票;可能只是各自把成本、時間或風險放在不同位置。
有時候,比完之後最有用的成果,不是一個獲勝的模型,而是一句更精準的待查問題:「如果平日人潮不到週末的一半,原本的方案還成立嗎?」接下來就知道該收集什麼。
多開幾個對話視窗,確實能增加思考的空間。只是當所有視窗都看向同一面牆,最值得做的那一步,也許是離開螢幕,去找一份它們還沒有看見的資訊。
挑一個已被多個 AI 肯定的想法,圈出它們共同依賴的一個前提,親自找一份能檢查它的資料。
留下一個自己的版本。
只存於此瀏覽器,不會送出。換裝置不會同步;清除瀏覽資料會移除紀錄。
延伸閱讀與資料來源
- Kim 等人,Correlated Errors in Large Language Models(ICML 2025) ↗
研究討論特定評測與任務中的模型錯誤相關性;不代表所有情境與模型組合都有相同程度的相關。
同一個問題,繼續聊。
這個主題的影片尚未上架。先留一個自己的版本,之後再回來看看。



