与世界事实冲突
对照外部可验证知识——人物、数字、引用、时间线。媒体最常指的「幻觉」多属此类。
- 事实矛盾爱迪生被说成发明了电话(实为贝尔)
- 事实捏造埃菲尔铁塔施工导致「巴黎虎」灭绝——该物种不存在
- 滚雪球一个错误数字被后续推理自我合理化成完整故事
大语言模型会生成听起来自信、实际却虚构的内容——学界称之为幻觉(hallucination)。 它不是神秘故障,而是数据缺陷、训练目标与推理采样三层耦合的结果。 本页基于公开综述,把机理拆成六组可动手实验。
AI 幻觉:模型输出包含虚假或误导性信息,并以事实口吻呈现。 它不涉及人类意义上的感知断裂——本质上是概率续写在「不知道」的区域继续作答。 批评者指出「幻觉」一词过度拟人;更准确的说法是:训练分布驱动的系统性错误生成。
综合 Wikipedia · Huang et al., ACM TOIS 2024 · Hicks et al., 2024
综述将幻觉归为事实性与忠实性两轴。 同一句错话,在不同任务里可能属于不同轴:翻译里编造原文没有的内容是忠实性;开放问答里说错年份是事实性。
对照外部可验证知识——人物、数字、引用、时间线。媒体最常指的「幻觉」多属此类。
输出可能碰巧正确,但不忠于你的要求或给定材料。RAG 场景中尤其危险。
幻觉很少是单点故障。点开每一层,看具体机制与「一句话机理」。后面的实验会分别复现这些层。
每一步生成都在概率分布上抽样。温度越低越保守;越高,分布越平坦,尾部危险 token 越容易出头。 也可以手动点选某个 token——观察后续条件分布如何被污染。
Prompt:「爱迪生发明了什么?」· 点击条形图可强制选择 token
Zhang et al.(2023)指出幻觉会 snowball:早期小错误被后续生成自我合理化。 你来扮演解码器——每一步从候选中选一个词。看看多快会把回答带进错误路径,或一路守住事实。
问题:「用两句话简要介绍爱迪生对电力系统的贡献,并给出一个关键年份。」
人类偏好标注若有系统偏差,奖励模型会把策略推向「讨好」。 你来扮演标注员:在几组回答里选出更愿意上线的那条。结束后看模型如何被你的偏好塑造。
对每个问题,在 A / B 里选更愿意「上线」的回答。没有标准答案——你的偏好就是奖励信号。
点击左侧问题或圆上的探针点。圆内 = 高频、多源印证的事实;越往外,长尾、时效盲区、私有信息越多——幻觉概率升高。 Anthropic 可解释性研究发现:模型内部有「不确定则拒答」电路,幻觉常来自该电路的误触发。
每个探针对应一类边界内 / 边界外问题。选中后查看模拟回答与机理解读。
单独调高温度不会让模型「变笨」;单独用脏数据也只是埋下种子。真实事故往往是: 有缺陷的先验 × 必须作答的策略 × 放大的采样。拖动四个滑杆,看风险如何非线性叠加。
风险分 = 数据质量 × 对齐策略 × 采样发散 × 上下文干扰 的耦合函数(教学模型)
下面是 6 段「模型回答」。有的含幻觉,有的只是不忠实或完全正确。选出你认为含事实性幻觉的那条。
从科学写作到法律文书,再到客服赔偿——公开事件说明:把幻觉当趣闻的代价可以很高。
Meta 科学模型生成虚构论文引用,附带真实作者名。不准确与冒犯性内容导致紧急撤回。
模型编造不存在的司法先例,并以真实格式呈现。法律界开始要求 AI 辅助写作的核查流程。
机器人虚构「购票后 90 天可补办丧亲优惠」。仲裁庭判定航空公司赔偿——不能以「机器人是独立实体」免责。
澳大利亚与加拿大两份咨询报告被发现引用不存在的学术论文。公司事后修订并部分退款。
没有银弹。分层干预,加上高风险场景的人工核查,是当前最务实的组合。
清洗语料;参数化知识编辑注入新事实;检索增强让答案锚定外部文档——「看着资料说话」。
对症:错误先验 / 知识过时在 SFT 中加入显式拒答样本;RLHF 标注准则应奖励诚实的不确定,而非自信的讨好。
对症:必须作答 / 讨好倾向降低温度、收紧 top-p;DoLa / 事实性核采样;Chain-of-Verification 在生成后自检关键事实句。
对症:采样发散 / 过度自信