文章目錄+
01 / 人工智能
它不是先知道,再選擇說謊
完整感來自語言模式,真確性需要另一條證據鏈。
最令人中招的答案,通常不是離譜到笑出聲,而是剛剛好合理。日期差一天、公司名差一個字,已經足夠令一封電郵走錯方向。
如果答案斷斷續續,人會起疑;如果它有日期、引文、括號和一副『我好肯定喎』的語氣,反而容易放低戒心。流暢度本身不等於可靠性,卻會放大信任。
02 / 人工智能
訓練資料有空洞,考試卻獎勵猜測
OpenAI 的研究指出,常見評測若答對得分、答錯零分、承認不知道也零分,最佳策略便傾向猜。這與多項選擇題很相似:沒有扣分時,留白反而是最差策略。
幻覺不只是資料不夠,也可能是訓練和評分制度把自信猜測變成較有回報的行為。
夜晚十一點趕 proposal 時,你未必會逐句查一段講得好順的背景資料——模型正正知道怎樣把空位填得像真的。
所以驗證不應只問『模型有幾準』,還要問『哪類問題最容易錯、錯了會走到哪一步、誰會發現』。總體準確率好聽,但未必幫到前線。
03 / 人工智能
第一個小錯會長成完整故事
模型輸出每一部分都會成為下一步的上下文。它若先生成一個不存在的研究名稱,接下來便會根據這個名字補作者、方法和結論。
後文越連貫,讀者越容易反過來相信開頭。這是一種自我鞏固:不是模型忽然取得更多證據,而是錯誤已被寫進它自己的題目。
所以我寧願看到一句『呢點未核實』,也不想要一篇穿西裝的胡說八道。
低溫可以令輸出更一致,卻不會把錯誤知識變成真相。一個本來就最可能出現的錯答案,低溫只會更穩定地錯。
04 / 人工智能
有來源也不代表安全
接上搜尋或 RAG 能降低部分幻覺,卻會引入另一種錯誤:找錯文件、取出過時段落、忽略否定句,或把來源沒有說過的推論包裝成來源結論。引用只證明有一條連結,不證明句子被連結支持。
真正核實要逐項對照「主張—證據」。
05 / 人工智能
流暢度正是風險放大器
人對凌亂答案會提高警覺,對語氣平穩、結構清楚、細節豐富的答案則容易放下防備。模型能力越高,荒謬錯誤會減少,但剩下的錯誤可能更難被肉眼發現。
可靠性改善與可偵測性改善不是同一件事。
06 / 人工智能
把不知道變成可接受輸出
較安全的系統會容許模型說資料不足,要求列出假設,把事實與推論分欄,對高風險主張使用外部工具,並在證據衝突時停止。消除所有幻覺並不現實;真正可設計的是錯誤被發現前可以走多遠。
錯誤不是平均分布的
模型通常不會在所有問題上以同一機率出錯。罕見人物、冷門地區、最新事件、精確引文和彼此相似的專有名稱,往往比一般概念更脆弱。
這表示「它上次答對」不是可靠性證明;你要測的是同一種任務在邊界情況下如何崩潰。若系統把所有答案以同一語氣呈現,使用者便看不到風險分布。
最實用的設計不是只顯示一個總體準確率,而是辨認哪些問題需要查證、哪些可以直接使用、哪些根本不應讓模型猜。
溫度降低也不是事實開關
降低生成溫度可令輸出更穩定,卻不會把錯誤知識變成真相。一個錯答案如果在模型分布中本來就最可能,低溫只會令它更一致地出現。
相反,多次取樣可以暴露答案不穩,但多數票亦可能一致地複製共同偏誤。穩定性、信心和正確性是三個不同量,任何把它們當成同一個分數的介面,都在製造過度信任。
07 / 人工智能
最危險的錯誤,往往不是荒謬,而是太順。
如果答案斷斷續續,人會起疑;如果它有日期、引文、括號和一副『我好肯定喎』的語氣,反而容易放低戒心。流暢度本身不等於可靠性,卻會放大信任。
所以驗證不應只問『模型有幾準』,還要問『哪類問題最容易錯、錯了會走到哪一步、誰會發現』。總體準確率好聽,但未必幫到前線。
08 / 人工智能
降低溫度,不等於打開事實開關
低溫可以令輸出更一致,卻不會把錯誤知識變成真相。一個本來就最可能出現的錯答案,低溫只會更穩定地錯。
相反,多次取樣可以暴露不穩定,但多數票也可能一起複製同一個偏見。穩定、信心、正確,是三個不同的數。
09 / 人工智能
讀者最常問
有引用就安全?
唔係。連結可能存在,但未必支持句子中的每個主張;要逐項對照主張同證據。
RAG 可否消除幻覺?
可降低一部分,但會帶來檢索錯誤、版本錯和權限問題;資料管道仍然要測。
怎樣令同事少中招?
把事實、推論和待核實內容分開顯示;高風險答案要求來源或人手確認,不要只靠語氣。
資料註腳
資料註腳
- openai.com/index/why-language-models-hallucinate/
- cdn.openai.com/papers/Training_language_models_to_follow_instructions_with_human_feedback.pdf
來源用來支持機制與限制;模型、產品及價格會更新,閱讀時應以官方頁面的版本和日期為準。