跳到主要内容

Locke Lee

返回文章库

人工智能/深层解释

AI 为甚么会「幻觉」?错误答案是怎样产生的?

最危险的错误通常不是胡言乱语,而是一个结构完美、只差真相的答案。

01 / 人工智能

它不是先知道,再选择说谎

语言模型的基本任务是延续文字,不是把每句输出先送到世界真相资料库核准。当问题暗示「一定有一个答案」,模型往往生成最像答案的形状:人名、日期、书名甚至引用格式都可以非常完整。

完整感来自语言模式,真确性需要另一条证据链。

02 / 人工智能

训练资料有空洞,考试却奖励猜测

OpenAI 的研究指出,常见评测若答对得分、答错零分、承认不知道也零分,最佳策略便倾向猜。这与多项选择题很相似:没有扣分时,留白反而是最差策略。

幻觉不只是资料不够,也可能是训练和评分制度把自信猜测变成较有回报的行为。

03 / 人工智能

第一个小错会长成完整故事

模型输出每一部分都会成为下一步的上下文。它若先生成一个不存在的研究名称,接下来便会根据这个名字补作者、方法和结论。

后文越连贯,读者越容易反过来相信开头。这是一种自我巩固:不是模型忽然取得更多证据,而是错误已被写进它自己的题目。

04 / 人工智能

有来源也不代表安全

接上搜寻或 RAG 能降低部分幻觉,却会引入另一种错误:找错文件、取出过时段落、忽略否定句,或把来源没有说过的推论包装成来源结论。引用只证明有一条连结,不证明句子被连结支持。

真正核实要逐项对照「主张—证据」。

05 / 人工智能

流畅度正是风险放大器

人对凌乱答案会提高警觉,对语气平稳、结构清楚、细节丰富的答案则容易放下防备。模型能力越高,荒谬错误会减少,但剩下的错误可能更难被肉眼发现。

可靠性改善与可侦测性改善不是同一件事。

06 / 人工智能

把不知道变成可接受输出

较安全的系统会容许模型说资料不足,要求列出假设,把事实与推论分栏,对高风险主张使用外部工具,并在证据冲突时停止。消除所有幻觉并不现实;真正可设计的是错误被发现前可以走多远。

07 / 人工智能

错误不是平均分布的

模型通常不会在所有问题上以同一机率出错。罕见人物、冷门地区、最新事件、精确引文和彼此相似的专有名称,往往比一般概念更脆弱。

这表示「它上次答对」不是可靠性证明;你要测的是同一种任务在边界情况下如何崩溃。若系统把所有答案以同一语气呈现,使用者便看不到风险分布。

最实用的设计不是只显示一个总体准确率,而是辨认哪些问题需要查证、哪些可以直接使用、哪些根本不应让模型猜。

08 / 人工智能

温度降低也不是事实开关

降低生成温度可令输出更稳定,却不会把错误知识变成真相。一个错答案如果在模型分布中本来就最可能,低温只会令它更一致地出现。

相反,多次取样可以暴露答案不稳,但多数票亦可能一致地复制共同偏误。稳定性、信心和正确性是三个不同量,任何把它们当成同一个分数的介面,都在制造过度信任。

资料注脚

资料注脚

  1. openai.com/index/why-language-models-hallucinate/
  2. cdn.openai.com/papers/Training_language_models_to_follow_instructions_with_human_feedback.pdf

资料用来支持机制与限制;模型、产品及价格会更新,阅读时应以来源的版本及日期为准。

读到最后,没有推销。

这里只保留一个更准确的理解,不把好奇心变成销售漏斗。

WhatsApp 联系 Locke Lee