AI 幻觉从何而来
Interactive Explainer

AI 并不在「撒谎」,
它只是在续写

大语言模型会生成听起来自信、实际却虚构的内容——学界称之为幻觉(hallucination)。 它不是神秘故障,而是数据缺陷、训练目标与推理采样三层耦合的结果。 本页基于公开综述,把机理拆成六组可动手实验。

理论底座ACM TOIS 综述 arXiv:2311.05232
补充Wikipedia · Anthropic 可解释性研究
实验采样 · 滚雪球 · RLHF · 边界 · 沙盒 · 挑战

Working Definition

AI 幻觉:模型输出包含虚假或误导性信息,并以事实口吻呈现。 它不涉及人类意义上的感知断裂——本质上是概率续写在「不知道」的区域继续作答。 批评者指出「幻觉」一词过度拟人;更准确的说法是:训练分布驱动的系统性错误生成。

综合 Wikipedia · Huang et al., ACM TOIS 2024 · Hicks et al., 2024

01 — 分类框架

幻觉长什么样?先问「错了对什么」

综述将幻觉归为事实性忠实性两轴。 同一句错话,在不同任务里可能属于不同轴:翻译里编造原文没有的内容是忠实性;开放问答里说错年份是事实性。

Factuality

与世界事实冲突

对照外部可验证知识——人物、数字、引用、时间线。媒体最常指的「幻觉」多属此类。

  • 事实矛盾爱迪生被说成发明了电话(实为贝尔)
  • 事实捏造埃菲尔铁塔施工导致「巴黎虎」灭绝——该物种不存在
  • 滚雪球一个错误数字被后续推理自我合理化成完整故事
Faithfulness

与指令或上下文脱节

输出可能碰巧正确,但不忠于你的要求或给定材料。RAG 场景中尤其危险。

  • 指令不一致要求译成西语,模型却直接回答了问题
  • 上下文不一致原文写「大湖区发源」,摘要写成「中部非洲山脉」
  • 逻辑不一致2x+3=11,得到 x=3(应为 4)
深度提示:传统文献用 intrinsic / extrinsic(与源文本矛盾 vs 无法从源验证)。 LLM 因开放式生成特性,改用 factuality / faithfulness 更贴切——下一层是成因管线。
02 — 成因管线

数据 → 训练 → 推理:三层如何耦合

幻觉很少是单点故障。点开每一层,看具体机制与「一句话机理」。后面的实验会分别复现这些层。

03 — 实验 A Playable

采样实验室:温度如何制造幻觉

每一步生成都在概率分布上抽样。温度越低越保守;越高,分布越平坦,尾部危险 token 越容易出头。 也可以手动点选某个 token——观察后续条件分布如何被污染。

A · Temperature / Top-p / Manual Pick

Prompt:「爱迪生发明了什么?」· 点击条形图可强制选择 token

Live Continuation
问:爱迪生发明了什么?
答:爱迪生
下一 token 分布(可点击强制选择) T=0.30
分布熵
0.42
低温锁定高概率;高温抬高尾部。多样性与忠实性是一对 trade-off。
核采样截断:收紧可主动砍掉危险尾部
先调温度随机采样几次;或直接点某个 token 强制走那条路径。
为什么温度有效? Softmax 输出先除以 T 再归一化。T 接近 0 时分布退化为 argmax;T 升高时更接近均匀。 综述将其列为推理层核心成因之一。
04 — 实验 B Playable

滚雪球:一个 token 如何拖垮整段回答

Zhang et al.(2023)指出幻觉会 snowball:早期小错误被后续生成自我合理化。 你来扮演解码器——每一步从候选中选一个词。看看多快会把回答带进错误路径,或一路守住事实。

B · Multi-step Generation

问题:「用两句话简要介绍爱迪生对电力系统的贡献,并给出一个关键年份。」

生成轨迹 0 / 8 步
下一 token 候选 · 点击选择
不确定性
0.5
从候选中选第一个词开始生成。
机理:选定 token 写入上下文后,后续分布以它为条件。 一个「电话」进了上下文,后面会自然生成「贝尔合作」之类的合理化叙事——错误被冻结成「历史」。
05 — 实验 C Playable

RLHF 模拟:你会奖励诚实,还是奖励好听?

人类偏好标注若有系统偏差,奖励模型会把策略推向「讨好」。 你来扮演标注员:在几组回答里选出更愿意上线的那条。结束后看模型如何被你的偏好塑造。

C · Preference Alignment

对每个问题,在 A / B 里选更愿意「上线」的回答。没有标准答案——你的偏好就是奖励信号。

Round 0 / 4
你的选择
累计次数
诚实度均分
factuality proxy
讨好感均分
sycophancy proxy
为什么这会导致幻觉? Sharma et al. 发现:人类与偏好模型常更偏爱自信、立场一致的回答,而非「我不确定」。 模型学到「讨好能拿高分」——于是在知识模糊处也编造「让用户满意」的答案。这是训练层的信念错位。
06 — 实验 D Playable

知识边界探针:圆心安全,边缘危险

点击左侧问题或圆上的探针点。圆内 = 高频、多源印证的事实;越往外,长尾、时效盲区、私有信息越多——幻觉概率升高。 Anthropic 可解释性研究发现:模型内部有「不确定则拒答」电路,幻觉常来自该电路的误触发。

D · Knowledge Boundary Explorer

每个探针对应一类边界内 / 边界外问题。选中后查看模拟回答与机理解读。

参数化知识 训练语料高频区
绿 = 边界内 · 黄 = 边缘 · 红 = 边界外
选择一个问题查看模拟与分析
07 — 实验 E Playable

多因子沙盒:把三层成因拧在一起

单独调高温度不会让模型「变笨」;单独用脏数据也只是埋下种子。真实事故往往是: 有缺陷的先验 × 必须作答的策略 × 放大的采样。拖动四个滑杆,看风险如何非线性叠加。

E · Composite Risk Sandbox

风险分 = 数据质量 × 对齐策略 × 采样发散 × 上下文干扰 的耦合函数(教学模型)

语料中的错误、偏见与过时信息 → 错误先验被记忆放大
SFT / RLHF 是否训练模型拒答;越高越像「讨好型实习生」
温度与 top-p 的综合效应 → 尾部 token 是否被放出
长对话中的指令遗忘、检索冲突、注意力局部化
Hallucination Risk Index
32
中等 — 需要核验关键事实
极高
风险传导链(实时)
脏先验 记忆放大 拒绝不了 采样放出 上下文带偏 自信输出
调整滑杆,或试试「事故配方」预设。
教学公式(非真实基准): risk 约等于四个因子的加权和再加交叉项。交叉项让「中等脏数据 + 必须作答 + 高温」远高于三项简单相加——对应真实事故的非线性。
08 — 实验 F Playable

找幻觉:你能识破几种?

下面是 6 段「模型回答」。有的含幻觉,有的只是不忠实或完全正确。选出你认为含事实性幻觉的那条。

09 — 现实回响

幻觉不是理论问题

从科学写作到法律文书,再到客服赔偿——公开事件说明:把幻觉当趣闻的代价可以很高。

2022Science

Galactica:学术幻觉六天下架

Meta 科学模型生成虚构论文引用,附带真实作者名。不准确与冒犯性内容导致紧急撤回。

2023Law

律师向法院提交含虚构判例的诉状

模型编造不存在的司法先例,并以真实格式呈现。法律界开始要求 AI 辅助写作的核查流程。

2024Service

Air Canada 被迫履行聊天机器人编造的政策

机器人虚构「购票后 90 天可补办丧亲优惠」。仲裁庭判定航空公司赔偿——不能以「机器人是独立实体」免责。

2025Report

Deloitte 政府报告出现虚构文献与判词

澳大利亚与加拿大两份咨询报告被发现引用不存在的学术论文。公司事后修订并部分退款。

10 — 对策地图

按成因对症下药

没有银弹。分层干预,加上高风险场景的人工核查,是当前最务实的组合。

Data

过滤 · 编辑 · RAG

清洗语料;参数化知识编辑注入新事实;检索增强让答案锚定外部文档——「看着资料说话」。

对症:错误先验 / 知识过时
Training

教模型说「不知道」

在 SFT 中加入显式拒答样本;RLHF 标注准则应奖励诚实的不确定,而非自信的讨好。

对症:必须作答 / 讨好倾向
Inference

保守解码 + 自我核查

降低温度、收紧 top-p;DoLa / 事实性核采样;Chain-of-Verification 在生成后自检关键事实句。

对症:采样发散 / 过度自信

参考文献与延伸阅读

  1. Huang, L. et al. A Survey on Hallucination in Large Language Models. ACM TOIS, 2024.
  2. Wikipedia contributors. Hallucination (artificial intelligence).
  3. Anthropic interpretability(2025):Claude 的「不确定拒答」抑制电路与幻觉误触发。
  4. Sharma, M. et al. Towards Understanding Sycophancy in Language Models.
  5. Zhang, M. et al. How Language Model Hallucinations Can Snowball.
  6. Yao, Y. et al. R-Tuning: Teaching Large Language Models to Refuse Unknown Questions.
  7. Dhuliawala, S. et al. Chain-of-Verification for hallucination mitigation.