文章目錄+
01 / 人工智能
它不是先知道,再選擇說謊
完整感來自語言模式,真確性需要另一條證據鏈。
02 / 人工智能
訓練資料有空洞,考試卻獎勵猜測
OpenAI 的研究指出,常見評測若答對得分、答錯零分、承認不知道也零分,最佳策略便傾向猜。這與多項選擇題很相似:沒有扣分時,留白反而是最差策略。
幻覺不只是資料不夠,也可能是訓練和評分制度把自信猜測變成較有回報的行為。
03 / 人工智能
第一個小錯會長成完整故事
模型輸出每一部分都會成為下一步的上下文。它若先生成一個不存在的研究名稱,接下來便會根據這個名字補作者、方法和結論。
後文越連貫,讀者越容易反過來相信開頭。這是一種自我鞏固:不是模型忽然取得更多證據,而是錯誤已被寫進它自己的題目。
04 / 人工智能
有來源也不代表安全
接上搜尋或 RAG 能降低部分幻覺,卻會引入另一種錯誤:找錯文件、取出過時段落、忽略否定句,或把來源沒有說過的推論包裝成來源結論。引用只證明有一條連結,不證明句子被連結支持。
真正核實要逐項對照「主張—證據」。
05 / 人工智能
流暢度正是風險放大器
人對凌亂答案會提高警覺,對語氣平穩、結構清楚、細節豐富的答案則容易放下防備。模型能力越高,荒謬錯誤會減少,但剩下的錯誤可能更難被肉眼發現。
可靠性改善與可偵測性改善不是同一件事。
06 / 人工智能
把不知道變成可接受輸出
較安全的系統會容許模型說資料不足,要求列出假設,把事實與推論分欄,對高風險主張使用外部工具,並在證據衝突時停止。消除所有幻覺並不現實;真正可設計的是錯誤被發現前可以走多遠。
07 / 人工智能
錯誤不是平均分布的
模型通常不會在所有問題上以同一機率出錯。罕見人物、冷門地區、最新事件、精確引文和彼此相似的專有名稱,往往比一般概念更脆弱。
這表示「它上次答對」不是可靠性證明;你要測的是同一種任務在邊界情況下如何崩潰。若系統把所有答案以同一語氣呈現,使用者便看不到風險分布。
最實用的設計不是只顯示一個總體準確率,而是辨認哪些問題需要查證、哪些可以直接使用、哪些根本不應讓模型猜。
08 / 人工智能
溫度降低也不是事實開關
降低生成溫度可令輸出更穩定,卻不會把錯誤知識變成真相。一個錯答案如果在模型分布中本來就最可能,低溫只會令它更一致地出現。
相反,多次取樣可以暴露答案不穩,但多數票亦可能一致地複製共同偏誤。穩定性、信心和正確性是三個不同量,任何把它們當成同一個分數的介面,都在製造過度信任。
資料註腳
資料註腳
- openai.com/index/why-language-models-hallucinate/
- cdn.openai.com/papers/Training_language_models_to_follow_instructions_with_human_feedback.pdf
資料用來支持機制與限制;模型、產品及價格會更新,閱讀時應以來源的版本及日期為準。