返回文章庫

人工智能/深層解釋

AI 為甚麼會「幻覺」?錯誤答案是怎樣產生的?

錯答案通常不是突然發瘋,而是流暢生成、評測獎勵猜測、上下文自我鞏固和引用錯位一起推到你面前。

01 / 人工智能

它不是先知道,再選擇說謊

AI 幻覺不是『資料庫搵唔到所以亂講』咁簡單。模型首先要完成語句,再由外部證據、評測方式和產品設計決定它有沒有機會承認不肯定。

完整感來自語言模式,真確性需要另一條證據鏈。

最令人中招的答案,通常不是離譜到笑出聲,而是剛剛好合理。日期差一天、公司名差一個字,已經足夠令一封電郵走錯方向。

如果答案斷斷續續,人會起疑;如果它有日期、引文、括號和一副『我好肯定喎』的語氣,反而容易放低戒心。流暢度本身不等於可靠性,卻會放大信任。

02 / 人工智能

訓練資料有空洞,考試卻獎勵猜測

OpenAI 的研究指出,常見評測若答對得分、答錯零分、承認不知道也零分,最佳策略便傾向猜。這與多項選擇題很相似:沒有扣分時,留白反而是最差策略。

幻覺不只是資料不夠,也可能是訓練和評分制度把自信猜測變成較有回報的行為。

夜晚十一點趕 proposal 時,你未必會逐句查一段講得好順的背景資料——模型正正知道怎樣把空位填得像真的。

所以驗證不應只問『模型有幾準』,還要問『哪類問題最容易錯、錯了會走到哪一步、誰會發現』。總體準確率好聽,但未必幫到前線。

03 / 人工智能

第一個小錯會長成完整故事

模型輸出每一部分都會成為下一步的上下文。它若先生成一個不存在的研究名稱,接下來便會根據這個名字補作者、方法和結論。

後文越連貫,讀者越容易反過來相信開頭。這是一種自我鞏固:不是模型忽然取得更多證據,而是錯誤已被寫進它自己的題目。

所以我寧願看到一句『呢點未核實』,也不想要一篇穿西裝的胡說八道。

低溫可以令輸出更一致,卻不會把錯誤知識變成真相。一個本來就最可能出現的錯答案,低溫只會更穩定地錯。

04 / 人工智能

有來源也不代表安全

接上搜尋或 RAG 能降低部分幻覺,卻會引入另一種錯誤:找錯文件、取出過時段落、忽略否定句,或把來源沒有說過的推論包裝成來源結論。引用只證明有一條連結,不證明句子被連結支持。

真正核實要逐項對照「主張—證據」。

05 / 人工智能

流暢度正是風險放大器

人對凌亂答案會提高警覺,對語氣平穩、結構清楚、細節豐富的答案則容易放下防備。模型能力越高,荒謬錯誤會減少,但剩下的錯誤可能更難被肉眼發現。

可靠性改善與可偵測性改善不是同一件事。

06 / 人工智能

把不知道變成可接受輸出

較安全的系統會容許模型說資料不足,要求列出假設,把事實與推論分欄,對高風險主張使用外部工具,並在證據衝突時停止。消除所有幻覺並不現實;真正可設計的是錯誤被發現前可以走多遠。

錯誤不是平均分布的

模型通常不會在所有問題上以同一機率出錯。罕見人物、冷門地區、最新事件、精確引文和彼此相似的專有名稱,往往比一般概念更脆弱。

這表示「它上次答對」不是可靠性證明;你要測的是同一種任務在邊界情況下如何崩潰。若系統把所有答案以同一語氣呈現,使用者便看不到風險分布。

最實用的設計不是只顯示一個總體準確率,而是辨認哪些問題需要查證、哪些可以直接使用、哪些根本不應讓模型猜。

溫度降低也不是事實開關

降低生成溫度可令輸出更穩定,卻不會把錯誤知識變成真相。一個錯答案如果在模型分布中本來就最可能,低溫只會令它更一致地出現。

相反,多次取樣可以暴露答案不穩,但多數票亦可能一致地複製共同偏誤。穩定性、信心和正確性是三個不同量,任何把它們當成同一個分數的介面,都在製造過度信任。

07 / 人工智能

最危險的錯誤,往往不是荒謬,而是太順。

如果答案斷斷續續,人會起疑;如果它有日期、引文、括號和一副『我好肯定喎』的語氣,反而容易放低戒心。流暢度本身不等於可靠性,卻會放大信任。

所以驗證不應只問『模型有幾準』,還要問『哪類問題最容易錯、錯了會走到哪一步、誰會發現』。總體準確率好聽,但未必幫到前線。

08 / 人工智能

降低溫度,不等於打開事實開關

低溫可以令輸出更一致,卻不會把錯誤知識變成真相。一個本來就最可能出現的錯答案,低溫只會更穩定地錯。

相反,多次取樣可以暴露不穩定,但多數票也可能一起複製同一個偏見。穩定、信心、正確,是三個不同的數。

09 / 人工智能

讀者最常問

有引用就安全?
唔係。連結可能存在,但未必支持句子中的每個主張;要逐項對照主張同證據。

RAG 可否消除幻覺?
可降低一部分,但會帶來檢索錯誤、版本錯和權限問題;資料管道仍然要測。

怎樣令同事少中招?
把事實、推論和待核實內容分開顯示;高風險答案要求來源或人手確認,不要只靠語氣。

資料註腳

資料註腳

  1. openai.com/index/why-language-models-hallucinate/
  2. cdn.openai.com/papers/Training_language_models_to_follow_instructions_with_human_feedback.pdf

來源用來支持機制與限制;模型、產品及價格會更新,閱讀時應以官方頁面的版本和日期為準。

讀到最後,沒有推銷。

這裏只保留一個更準確的理解,不把好奇心變成銷售漏斗。

WhatsApp 聯絡 Locke Lee