端到端调优方法论:先测量,再动刀

03-重排与上下文工程 进阶 约 20 分钟 #调优#方法论#基线#归因 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照经典文献复核。

一句话定义

RAG 调优的正确顺序是"建评测基线 → 分段归因 → 单变量改动 → 指标验证 → 固化",任何跳过测量的改动都是赌博;杠杆排序通常是:分块/检索质量 > 重排 > 上下文工程 > 换生成模型。

为什么重要

RAG 的可调参数多到令人麻痹:块大小、overlap、嵌入模型、k 值、重排窗口、模板措辞、温度……没有方法论,团队会在参数空间里随机游走数周;有方法论,多数问题的定位与修复可在数天内完成。本条把前面所有单点技术串成可执行的工程流程。

前置知识

kp-016(指标体系)、kp-002(流水线分段)。

核心概念

  • 基线先行:最朴素配置(固定分块 512 + 单一向量检索 top-5 + 一个模板)跑通全链路并建立评测基线——没有基线就没有"改进"的可定义性。
  • 分段归因:用四指标把失败定位到环(recall→检索,precision→排序,faithfulness→生成)。
  • 单变量原则:一次只改一处,跑同一评测集对比;多变量齐改无法归因。
  • 杠杆排序(投入产出比从高到低):① 解析与分块质量(天花板);② 检索召回(混合检索/查询变换);③ 重排;④ 上下文组装与模板;⑤ 换生成模型(最贵,放最后)。
  • 评测集守护:调优过程中评测集只增不改,防止"为过拟合评测集而调参";定期用新 badcase 扩充。

原理与机制

为什么杠杆是这个排序:生成模型只能在"给到的上下文"里做阅读理解——上下文没有答案(召回失败)时换任何模型都无济于事,这就是"检索质量是天花板"的含义。反之,上下文完美而模型弱,输出是"保守但可救"的;上下文残缺而模型强,输出是"自信的错误"——更危险。因此资源优先砸在检索侧。

调优决策树(可直接照做):

  1. faithfulness 低且 context recall 低 → 检索侧:检查解析→分块→混合检索→查询变换,按序实验。
  2. recall 高但 precision 低 → 排序侧:加重排/调窗口/上下文布局。
  3. 上下文好但 faithfulness 低 → 生成侧:引用约束、压缩指令、降低温度、换指令遵循更强的模型。
  4. 全指标尚可但用户不满意 → 看评测集覆盖盲区(问题类型没测到),补评测集而不是继续调参。

实验管理:每次改动记录(假设、改动、四指标变化、人工抽检结论);用 git 管理配置与 prompt 版本。RAG 实验的可复现性依赖固定数据、固定裁判、固定随机种子。

图示

                ┌─ recall 低 ─► 解析/分块/混合检索/查询变换 (杠杆①②)
指标异常 ─归因─┼─ precision 低 → 重排/组装/布局           (杠杆③④)
                ├─ faithfulness 低 → 引用约束/模板/换模型   (杠杆④⑤)
                └─ 全好但用户不满 → 评测盲区, 补数据而非调参
每步: 单变量改动 → 同一评测集 → 指标对比 → 固化或回滚

实例或案例

典型两周优化轨迹:基线(faithfulness 0.62)→ 归因 recall 低 → 换混合检索(0.71)→ 修分块类型感知(0.78)→ 加重排(0.83)→ 模板加引用校验(0.86)。全程五次改动、五次评测、可回滚——与"边感觉边调"形成鲜明对比。

常见误区

  • 误区一:"先换最强的模型再说"。最贵的杠杆常常不是瓶颈;在检索残缺的系统上换模型是花大钱买"自信的错误"。
  • 误区二:"多改几处一起上,效率高"。无法归因,出问题不知道回滚哪个;单变量是纪律不是洁癖。
  • 误区三:"评测集调到指标好看就完事"。对评测集过拟合后线上照样翻车;守护集(不参与调优的封存样本)定期开盲验证。

与其他知识点的关系

  • 汇总条目:把 kp-004~016 的全部单点技术纳入统一流程。
  • kp-016:方法论的数据基础。
  • kp-031:指标之外还要看成本与延迟的联合优化。

自测题

  1. 为什么"换更强的生成模型"排最后?

答:生成只能消化给到的上下文,检索残缺时强模型输出"自信的错误"更难发现且更危险;便宜杠杆(检索/分块)未用尽前换模型性价比最低。

  1. 单变量原则怎么落实?

答:一次只改一处、同一评测集对比、记录假设与结果、可回滚;多变量齐改=无法归因。

  1. 指标全好但用户仍不满,下一步做什么?

答:怀疑评测盲区——分析真实 badcase 的类型分布,补充对应类型评测样本,而不是继续调已有参数。

延伸阅读

  • LlamaIndex 博客:optimizing RAG / "MODULE" 调优指南。
  • Chroma Research, "Evaluating RAG Pipelines"系列实验。
  • Google SRE 式的实验记录表(假设-改动-指标)模板。