LLM 的知识局限与幻觉机理
本文基于模型知识整理(生成时未联网核对),关键结论建议对照经典文献复核。
一句话定义
幻觉(hallucination)指 LLM 生成流畅但不真实的内容,根源在于它本质是"按概率续写下一段文字"而非"查证事实"——训练数据有截止且含错误,模型没有"我不知道"的可靠内省,只能流畅地填补空白。
为什么重要
RAG 的全部设计(检索、引用、拒答、评测)都是围绕压制幻觉展开的。不理解幻觉的两种类型与产生条件,就会开错药方:把"检索不到"误判为"模型不听话",或把"模型不忠实"误判为"知识库没内容"。
前置知识
kp-001、LLM 的自回归生成原理。
核心概念
- 事实性幻觉(factuality hallucination):与客观事实矛盾(编造不存在的论文、错误的日期数字)。
- 忠实性幻觉(faithfulness hallucination):与提供的上下文矛盾——即使给了正确资料,模型仍然"自由发挥"。这是 RAG 场景的主要敌人。
- 知识截止(knowledge cutoff):训练数据的时间上限;此后的事件模型只能靠参数里的间接痕迹瞎猜。
- 过度自信(overconfidence):模型对正确与编造的内容给出同样流畅笃定的语气,用户与评测者都难凭语气分辨。
- 诱导因素:要求回答不存在的信息、上下文与问题弱相关、提问方式暗示"必须给答案"、采样温度过高。
原理与机制
为什么模型必然幻觉:训练目标是"给定前文,预测最可能的下一个 token"——这个目标里没有"真实性"约束,只有"统计上像不像人话"。当知识缺失时,最可能的续写往往是"格式正确、细节编造"的模板化内容(例如编出一个像模像样的引用条目)。此外 RLHF 阶段"有帮助"的奖励会让模型倾向于给出确定答案而非拒答,进一步强化过度自信。
幻觉的分类治理(RAG 视角):
| 根因 | 症状 | 药方 |
|---|---|---|
| 检索召回失败 | 上下文里根本没有答案,模型硬编 | 改进分块/嵌入/混合检索/查询变换(kp-004~011) |
| 排序失败 | 答案在候选里但被噪音淹没 | 重排(kp-013)与上下文布局(kp-014) |
| 生成不忠实 | 上下文有正确答案却答错 | prompt 强化引用约束、降低温度、忠实度评测与拒答(kp-015/016) |
| 知识本身缺失 | 知识库里就没有 | 补文档、接入权威源;产品层面明示知识边界 |
拒答是被设计出来的,不是天生的:prompt 中必须显式授权"若上下文不足以回答,请回答不知道"并给出判断规则,否则 RLHF 过的模型会硬答。
图示
用户: "我们公司 Q3 退货率是多少?"
检索失败分支: 上下文无该数据 → 模型编一个"约 3.2%"(幻觉)
正确分支: 上下文无该数据 → prompt 允许拒答 → "知识库中未找到 Q3 退货数据"
直观类比
一个从不承认不知道的人,被问到陌生的题目时会即兴编一套听起来很专业的答案——语气和答对时一模一样。RAG 相当于把参考资料拍在他面前:有资料时他照着念(错误率大降),没资料时你得明确告诉他"这次允许说不知道"。
实例或案例
- 经典翻车:问模型"引用某领域的论文",它编造出作者、期刊、卷期俱全的假文献——格式完美,条目不存在。
- 企业 RAG 中最常见的复合事故:检索只召回一半相关文档,模型基于半份证据给出以偏概全的结论——两头都有责任,需分段评测定位(kp-016)。
常见误区
- 误区一:"模型说'根据资料'就真的用了资料"。那只是语言习惯;忠实性必须靠评测指标与引用核查验证,不能靠语气。
- 误区二:"温度调到 0 就不幻觉了"。低温消除随机性,不消除"训练目标本身无真实性约束"带来的系统性编造。
- 误区三:"幻觉率是模型属性,与系统无关"。检索质量与 prompt 设计对最终幻觉率的影响常常大于换模型;先修系统再换模型。
与其他知识点的关系
- kp-001:RAG 治理幻觉的架构级答案。
- kp-015:引用与拒答的 prompt 工程。
- kp-016:faithfulness/answer relevance 指标把幻觉变成可测量的数。
- kp-032:提示注入是"上下文本身有毒"的特例。
自测题
- 事实性幻觉与忠实性幻觉的区别?RAG 主要治哪个?
答:前者与客观事实矛盾,后者与所给上下文矛盾;RAG 通过检索+引用+评测主要治理忠实性幻觉,并借知识库更新缓解事实性幻觉。
- 为什么模型对不知道的问题也"流利作答"?
答:训练目标是统计上最可能的续写而非事实校验,缺失知识时最可能输出"格式正确、细节编造"的内容;RLHF 的帮助性奖励又抑制了拒答。
- 治理幻觉为什么必须分段定位?
答:召回失败、排序失败、生成不忠实、知识缺失四种根因的药方完全不同,笼统"换模型"既贵又不对症。
延伸阅读
- Ji 等, "Survey of Hallucination in Natural Language Generation"(ACM Computing Surveys 2023)。
- Liu 等, "Lost in the Middle"(TACL 2023,上下文位置对忠实性的影响)。
- OpenAI/Angelina Yang 等关于引用约束降低幻觉的实践文章。