RAG 评测:RAGAS 指标与评测集建设
本文基于模型知识整理(生成时未联网核对),关键结论建议对照经典文献复核。
一句话定义
RAG 评测把"好不好"拆成可归因的指标:检索侧看上下文精度/召回(找没找对),生成侧看忠实度(说的对不对)与答案相关性(答没答上)——用分段的指标定位失败环节,用固定评测集让每次改动有对比基线。
为什么重要
没有评测的 RAG 调优是玄学:改分块、换嵌入、加重排、调模板,每个改动都"感觉好了点",实际可能更差。评测把系统变成可工程化迭代的对象——先有 50 条评测集再谈优化,是 RAG 项目的第一原则。
前置知识
kp-002(流水线分段)、kp-013(检索与生成的分界)。
核心概念
检索侧指标(给定问题与标准答案块):
- 上下文精度(context precision):检索到的块中,相关块是否排在前面——衡量排序质量。
- 上下文召回(context recall):标准答案所需的信息是否都被检索到——衡量召回上限,是"答不对"的第一嫌疑人。
生成侧指标(给定检索上下文与答案):
- 忠实度(faithfulness):答案中的论断能否被上下文支持——直接对应幻觉治理。
- 答案相关性(answer relevancy):答案是否切题完整。
RAGAS 框架把这四项标准化为 LLM-as-judge 的自动评测(用强模型当裁判逐项打分),是事实上的开源标准;配套实现还有 TruLens、DeepEval 等。传统 IR 指标(MRR、NDCG@k)在有人工标注排序时仍是金标准。
评测集:一组(问题,标准答案,标准来源块)三元组。规模经验:50–200 条起步,覆盖主要文档类型与查询类型(事实/多跳/时效/无答案四类必备),其中"无答案"类专测拒答。
原理与机制
分段定位法(评测的核心价值):
答案错 + context recall 低 → 检索问题: 修分块/嵌入/混合检索/查询变换
答案错 + recall 高 + precision 低 → 排序问题: 修重排/上下文组装
答案错 + 上下文好 + faithfulness 低 → 生成问题: 修 prompt/引用约束/换模型
答非所问 + 各项都好 → 查询理解/评测集本身问题
LLM-as-judge 的可靠性边界:裁判模型有偏(偏好长答案、位置效应、自我偏好),且对"忠实度"这类定义敏感的指标,prompt 措辞变化会显著影响分数。纪律:① 裁判模型固定且与被测生成模型不同源;② 评测 prompt 版本化;③ 定期抽人工复核 10–20% 校准裁判偏差。
评测集怎么来:冷启动可用 LLM 从文档自动生成 QA 对(快但有分布偏差),必须人工修订;上线后把真实 badcase 持续回灌评测集——评测集是活的资产,不是一次性交付物。
公式或模型
- Recall@k = 命中的标准块数 / 标准块总数;MRR = 平均(1/首个相关块排名)。
- RAGAS faithfulness:答案拆成原子论断 → 逐条判"上下文可支持?" → 可支持比例。
- RAGAS context precision:相关块在排名中的加权命中比例。
实例或案例
- 某团队调优三周"感觉更好",建立评测后基线:faithfulness 0.62 / recall 0.58——问题主因在检索召回;加混合检索与改写后 recall 0.81、faithfulness 随之 0.84,证明此前"感觉"不可靠。
- 无答案类评测发现:20% 该拒答的问题被硬答——加拒答分支后该类通过率翻倍,且正常类指标不降。
常见误区
- 误区一:"只看端到端准确率"。无法归因就无法优化;四指标分段是最低配置。
- 误区二:"用生成模型自己评自己"。自我偏好与知识共享偏差会系统性高估;裁判必须独立且版本固定。
- 误区三:"评测集一次性生成不维护"。文档与查询分布持续漂移,不回灌 badcase 的评测集会在半年内失去代表性。
与其他知识点的关系
自测题
- 四个核心指标分别定位流水线哪一段?
答:context recall→检索召回;context precision→排序;faithfulness→生成忠实性;answer relevancy→切题性;组合可把失败归因到具体环节。
- 为什么裁判模型不能与被测模型同源?
答:同源模型共享偏好与知识盲区,自我偏好会系统性抬高分数;固定第三方裁判并人工抽检校准才有可比性。
- 评测集里为什么要放"无答案"类问题?
答:专测拒答能力——真实使用中大量问题超出知识库范围,只会硬答的系统会在这类问题上制造幻觉事故。
延伸阅读
- Es 等, "RAGAS: Automated Evaluation of Retrieval Augmented Generation"(EACL 2024 demo)。
- Saad-Falcon 等, "AFS: AI Feedback for Adapting LLM Evaluators"(裁判可靠性)。
- TruLens / DeepEval 文档:RAG triad 指标。