Skip to main content

Locke Lee

返回文章庫

人工智能/深層解釋

AI 為甚麼會「幻覺」?錯誤答案是怎樣產生的?

最危險的錯誤通常不是胡言亂語,而是一個結構完美、只差真相的答案。

01 / 人工智能

它不是先知道,再選擇說謊

語言模型的基本任務是延續文字,不是把每句輸出先送到世界真相資料庫核准。當問題暗示「一定有一個答案」,模型往往生成最像答案的形狀:人名、日期、書名甚至引用格式都可以非常完整。

完整感來自語言模式,真確性需要另一條證據鏈。

02 / 人工智能

訓練資料有空洞,考試卻獎勵猜測

OpenAI 的研究指出,常見評測若答對得分、答錯零分、承認不知道也零分,最佳策略便傾向猜。這與多項選擇題很相似:沒有扣分時,留白反而是最差策略。

幻覺不只是資料不夠,也可能是訓練和評分制度把自信猜測變成較有回報的行為。

03 / 人工智能

第一個小錯會長成完整故事

模型輸出每一部分都會成為下一步的上下文。它若先生成一個不存在的研究名稱,接下來便會根據這個名字補作者、方法和結論。

後文越連貫,讀者越容易反過來相信開頭。這是一種自我鞏固:不是模型忽然取得更多證據,而是錯誤已被寫進它自己的題目。

04 / 人工智能

有來源也不代表安全

接上搜尋或 RAG 能降低部分幻覺,卻會引入另一種錯誤:找錯文件、取出過時段落、忽略否定句,或把來源沒有說過的推論包裝成來源結論。引用只證明有一條連結,不證明句子被連結支持。

真正核實要逐項對照「主張—證據」。

05 / 人工智能

流暢度正是風險放大器

人對凌亂答案會提高警覺,對語氣平穩、結構清楚、細節豐富的答案則容易放下防備。模型能力越高,荒謬錯誤會減少,但剩下的錯誤可能更難被肉眼發現。

可靠性改善與可偵測性改善不是同一件事。

06 / 人工智能

把不知道變成可接受輸出

較安全的系統會容許模型說資料不足,要求列出假設,把事實與推論分欄,對高風險主張使用外部工具,並在證據衝突時停止。消除所有幻覺並不現實;真正可設計的是錯誤被發現前可以走多遠。

07 / 人工智能

錯誤不是平均分布的

模型通常不會在所有問題上以同一機率出錯。罕見人物、冷門地區、最新事件、精確引文和彼此相似的專有名稱,往往比一般概念更脆弱。

這表示「它上次答對」不是可靠性證明;你要測的是同一種任務在邊界情況下如何崩潰。若系統把所有答案以同一語氣呈現,使用者便看不到風險分布。

最實用的設計不是只顯示一個總體準確率,而是辨認哪些問題需要查證、哪些可以直接使用、哪些根本不應讓模型猜。

08 / 人工智能

溫度降低也不是事實開關

降低生成溫度可令輸出更穩定,卻不會把錯誤知識變成真相。一個錯答案如果在模型分布中本來就最可能,低溫只會令它更一致地出現。

相反,多次取樣可以暴露答案不穩,但多數票亦可能一致地複製共同偏誤。穩定性、信心和正確性是三個不同量,任何把它們當成同一個分數的介面,都在製造過度信任。

資料註腳

資料註腳

  1. openai.com/index/why-language-models-hallucinate/
  2. cdn.openai.com/papers/Training_language_models_to_follow_instructions_with_human_feedback.pdf

資料用來支持機制與限制;模型、產品及價格會更新,閱讀時應以來源的版本及日期為準。

讀到最後,沒有推銷。

這裏只保留一個更準確的理解,不把好奇心變成銷售漏斗。

WhatsApp 聯絡 Locke Lee