文章目录+
01 / 人工智能
它不是先知道,再选择说谎
完整感来自语言模式,真确性需要另一条证据链。
02 / 人工智能
训练资料有空洞,考试却奖励猜测
OpenAI 的研究指出,常见评测若答对得分、答错零分、承认不知道也零分,最佳策略便倾向猜。这与多项选择题很相似:没有扣分时,留白反而是最差策略。
幻觉不只是资料不够,也可能是训练和评分制度把自信猜测变成较有回报的行为。
03 / 人工智能
第一个小错会长成完整故事
模型输出每一部分都会成为下一步的上下文。它若先生成一个不存在的研究名称,接下来便会根据这个名字补作者、方法和结论。
后文越连贯,读者越容易反过来相信开头。这是一种自我巩固:不是模型忽然取得更多证据,而是错误已被写进它自己的题目。
04 / 人工智能
有来源也不代表安全
接上搜寻或 RAG 能降低部分幻觉,却会引入另一种错误:找错文件、取出过时段落、忽略否定句,或把来源没有说过的推论包装成来源结论。引用只证明有一条连结,不证明句子被连结支持。
真正核实要逐项对照「主张—证据」。
05 / 人工智能
流畅度正是风险放大器
人对凌乱答案会提高警觉,对语气平稳、结构清楚、细节丰富的答案则容易放下防备。模型能力越高,荒谬错误会减少,但剩下的错误可能更难被肉眼发现。
可靠性改善与可侦测性改善不是同一件事。
06 / 人工智能
把不知道变成可接受输出
较安全的系统会容许模型说资料不足,要求列出假设,把事实与推论分栏,对高风险主张使用外部工具,并在证据冲突时停止。消除所有幻觉并不现实;真正可设计的是错误被发现前可以走多远。
07 / 人工智能
错误不是平均分布的
模型通常不会在所有问题上以同一机率出错。罕见人物、冷门地区、最新事件、精确引文和彼此相似的专有名称,往往比一般概念更脆弱。
这表示「它上次答对」不是可靠性证明;你要测的是同一种任务在边界情况下如何崩溃。若系统把所有答案以同一语气呈现,使用者便看不到风险分布。
最实用的设计不是只显示一个总体准确率,而是辨认哪些问题需要查证、哪些可以直接使用、哪些根本不应让模型猜。
08 / 人工智能
温度降低也不是事实开关
降低生成温度可令输出更稳定,却不会把错误知识变成真相。一个错答案如果在模型分布中本来就最可能,低温只会令它更一致地出现。
相反,多次取样可以暴露答案不稳,但多数票亦可能一致地复制共同偏误。稳定性、信心和正确性是三个不同量,任何把它们当成同一个分数的介面,都在制造过度信任。
资料注脚
资料注脚
- openai.com/index/why-language-models-hallucinate/
- cdn.openai.com/papers/Training_language_models_to_follow_instructions_with_human_feedback.pdf
资料用来支持机制与限制;模型、产品及价格会更新,阅读时应以来源的版本及日期为准。