返回文章库

人工智能/深层解释

AI 为甚么会「幻觉」?错误答案是怎样产生的?

错答案通常不是突然发疯,而是流畅生成、评测奖励猜测、上下文自我巩固和引用错位一起推到你面前。

01 / 人工智能

它不是先知道,再选择说谎

AI 幻觉不是『资料库揾不到所以乱讲』咁简单。模型首先要完成语句,再由外部证据、评测方式和产品设计决定它有没有机会承认不肯定。

完整感来自语言模式,真确性需要另一条证据链。

最令人中招的答案,通常不是离谱到笑出声,而是刚刚好合理。日期差一天、公司名差一个字,已经足够令一封电邮走错方向。

如果答案断断续续,人会起疑;如果它有日期、引文、括号和一副『我好肯定㖞』的语气,反而容易放低戒心。流畅度本身不等于可靠性,却会放大信任。

02 / 人工智能

训练资料有空洞,考试却奖励猜测

OpenAI 的研究指出,常见评测若答对得分、答错零分、承认不知道也零分,最佳策略便倾向猜。这与多项选择题很相似:没有扣分时,留白反而是最差策略。

幻觉不只是资料不够,也可能是训练和评分制度把自信猜测变成较有回报的行为。

夜晚十一点赶 proposal 时,你未必会逐句查一段讲得好顺的背景资料——模型正正知道怎样把空位填得像真的。

所以验证不应只问『模型有几准』,还要问『哪类问题最容易错、错了会走到哪一步、谁会发现』。总体准确率好听,但未必帮到前线。

03 / 人工智能

第一个小错会长成完整故事

模型输出每一部分都会成为下一步的上下文。它若先生成一个不存在的研究名称,接下来便会根据这个名字补作者、方法和结论。

后文越连贯,读者越容易反过来相信开头。这是一种自我巩固:不是模型忽然取得更多证据,而是错误已被写进它自己的题目。

所以我宁愿看到一句『呢点未核实』,也不想要一篇穿西装的胡说八道。

低温可以令输出更一致,却不会把错误知识变成真相。一个本来就最可能出现的错答案,低温只会更稳定地错。

04 / 人工智能

有来源也不代表安全

接上搜寻或 RAG 能降低部分幻觉,却会引入另一种错误:找错文件、取出过时段落、忽略否定句,或把来源没有说过的推论包装成来源结论。引用只证明有一条连结,不证明句子被连结支持。

真正核实要逐项对照「主张—证据」。

05 / 人工智能

流畅度正是风险放大器

人对凌乱答案会提高警觉,对语气平稳、结构清楚、细节丰富的答案则容易放下防备。模型能力越高,荒谬错误会减少,但剩下的错误可能更难被肉眼发现。

可靠性改善与可侦测性改善不是同一件事。

06 / 人工智能

把不知道变成可接受输出

较安全的系统会容许模型说资料不足,要求列出假设,把事实与推论分栏,对高风险主张使用外部工具,并在证据冲突时停止。消除所有幻觉并不现实;真正可设计的是错误被发现前可以走多远。

错误不是平均分布的

模型通常不会在所有问题上以同一机率出错。罕见人物、冷门地区、最新事件、精确引文和彼此相似的专有名称,往往比一般概念更脆弱。

这表示「它上次答对」不是可靠性证明;你要测的是同一种任务在边界情况下如何崩溃。若系统把所有答案以同一语气呈现,使用者便看不到风险分布。

最实用的设计不是只显示一个总体准确率,而是辨认哪些问题需要查证、哪些可以直接使用、哪些根本不应让模型猜。

温度降低也不是事实开关

降低生成温度可令输出更稳定,却不会把错误知识变成真相。一个错答案如果在模型分布中本来就最可能,低温只会令它更一致地出现。

相反,多次取样可以暴露答案不稳,但多数票亦可能一致地复制共同偏误。稳定性、信心和正确性是三个不同量,任何把它们当成同一个分数的介面,都在制造过度信任。

07 / 人工智能

最危险的错误,往往不是荒谬,而是太顺。

如果答案断断续续,人会起疑;如果它有日期、引文、括号和一副『我好肯定㖞』的语气,反而容易放低戒心。流畅度本身不等于可靠性,却会放大信任。

所以验证不应只问『模型有几准』,还要问『哪类问题最容易错、错了会走到哪一步、谁会发现』。总体准确率好听,但未必帮到前线。

08 / 人工智能

降低温度,不等于打开事实开关

低温可以令输出更一致,却不会把错误知识变成真相。一个本来就最可能出现的错答案,低温只会更稳定地错。

相反,多次取样可以暴露不稳定,但多数票也可能一起复制同一个偏见。稳定、信心、正确,是三个不同的数。

09 / 人工智能

读者最常问

有引用就安全?
不系。连结可能存在,但未必支持句子中的每个主张;要逐项对照主张同证据。

RAG 可否消除幻觉?
可降低一部分,但会带来检索错误、版本错和权限问题;资料管道仍然要测。

怎样令同事少中招?
把事实、推论和待核实内容分开显示;高风险答案要求来源或人手确认,不要只靠语气。

资料注脚

资料注脚

  1. openai.com/index/why-language-models-hallucinate/
  2. cdn.openai.com/papers/Training_language_models_to_follow_instructions_with_human_feedback.pdf

来源用来支持机制与限制;模型、产品及价格会更新,阅读时应以官方页面的版本和日期为准。

读到最后,没有推销。

这里只保留一个更准确的理解,不把好奇心变成销售漏斗。

WhatsApp 联系 Locke Lee