RAG 评测:RAGAS 指标与评测集建设

03-重排与上下文工程 核心 约 25 分钟 #评测#RAGAS#忠实度#评测集 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照经典文献复核。

一句话定义

RAG 评测把"好不好"拆成可归因的指标:检索侧看上下文精度/召回(找没找对),生成侧看忠实度(说的对不对)与答案相关性(答没答上)——用分段的指标定位失败环节,用固定评测集让每次改动有对比基线。

为什么重要

没有评测的 RAG 调优是玄学:改分块、换嵌入、加重排、调模板,每个改动都"感觉好了点",实际可能更差。评测把系统变成可工程化迭代的对象——先有 50 条评测集再谈优化,是 RAG 项目的第一原则。

前置知识

kp-002(流水线分段)、kp-013(检索与生成的分界)。

核心概念

检索侧指标(给定问题与标准答案块):

  • 上下文精度(context precision):检索到的块中,相关块是否排在前面——衡量排序质量。
  • 上下文召回(context recall):标准答案所需的信息是否都被检索到——衡量召回上限,是"答不对"的第一嫌疑人。

生成侧指标(给定检索上下文与答案):

  • 忠实度(faithfulness):答案中的论断能否被上下文支持——直接对应幻觉治理。
  • 答案相关性(answer relevancy):答案是否切题完整。

RAGAS 框架把这四项标准化为 LLM-as-judge 的自动评测(用强模型当裁判逐项打分),是事实上的开源标准;配套实现还有 TruLens、DeepEval 等。传统 IR 指标(MRR、NDCG@k)在有人工标注排序时仍是金标准。

评测集:一组(问题,标准答案,标准来源块)三元组。规模经验:50–200 条起步,覆盖主要文档类型与查询类型(事实/多跳/时效/无答案四类必备),其中"无答案"类专测拒答。

原理与机制

分段定位法(评测的核心价值):

答案错 + context recall 低 → 检索问题: 修分块/嵌入/混合检索/查询变换
答案错 + recall 高 + precision 低 → 排序问题: 修重排/上下文组装
答案错 + 上下文好 + faithfulness 低 → 生成问题: 修 prompt/引用约束/换模型
答非所问 + 各项都好 → 查询理解/评测集本身问题

LLM-as-judge 的可靠性边界:裁判模型有偏(偏好长答案、位置效应、自我偏好),且对"忠实度"这类定义敏感的指标,prompt 措辞变化会显著影响分数。纪律:① 裁判模型固定且与被测生成模型不同源;② 评测 prompt 版本化;③ 定期抽人工复核 10–20% 校准裁判偏差。

评测集怎么来:冷启动可用 LLM 从文档自动生成 QA 对(快但有分布偏差),必须人工修订;上线后把真实 badcase 持续回灌评测集——评测集是活的资产,不是一次性交付物。

公式或模型

  • Recall@k = 命中的标准块数 / 标准块总数;MRR = 平均(1/首个相关块排名)。
  • RAGAS faithfulness:答案拆成原子论断 → 逐条判"上下文可支持?" → 可支持比例。
  • RAGAS context precision:相关块在排名中的加权命中比例。

实例或案例

  • 某团队调优三周"感觉更好",建立评测后基线:faithfulness 0.62 / recall 0.58——问题主因在检索召回;加混合检索与改写后 recall 0.81、faithfulness 随之 0.84,证明此前"感觉"不可靠。
  • 无答案类评测发现:20% 该拒答的问题被硬答——加拒答分支后该类通过率翻倍,且正常类指标不降。

常见误区

  • 误区一:"只看端到端准确率"。无法归因就无法优化;四指标分段是最低配置。
  • 误区二:"用生成模型自己评自己"。自我偏好与知识共享偏差会系统性高估;裁判必须独立且版本固定。
  • 误区三:"评测集一次性生成不维护"。文档与查询分布持续漂移,不回灌 badcase 的评测集会在半年内失去代表性。

与其他知识点的关系

  • kp-003/015:faithfulness 与拒答是这两条的直接度量。
  • kp-012:召回掉点的切片分析定位嵌入问题。
  • kp-017:所有调优动作以本条的指标为准绳。

自测题

  1. 四个核心指标分别定位流水线哪一段?

答:context recall→检索召回;context precision→排序;faithfulness→生成忠实性;answer relevancy→切题性;组合可把失败归因到具体环节。

  1. 为什么裁判模型不能与被测模型同源?

答:同源模型共享偏好与知识盲区,自我偏好会系统性抬高分数;固定第三方裁判并人工抽检校准才有可比性。

  1. 评测集里为什么要放"无答案"类问题?

答:专测拒答能力——真实使用中大量问题超出知识库范围,只会硬答的系统会在这类问题上制造幻觉事故。

延伸阅读

  • Es 等, "RAGAS: Automated Evaluation of Retrieval Augmented Generation"(EACL 2024 demo)。
  • Saad-Falcon 等, "AFS: AI Feedback for Adapting LLM Evaluators"(裁判可靠性)。
  • TruLens / DeepEval 文档:RAG triad 指标。