混合架构与选型:向量、图、关键词的融合路由

05-GraphRAG与图增强检索 进阶 约 20 分钟 #混合架构#路由#LightRAG#选型 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照经典文献复核。

一句话定义

生产级 RAG 的主流形态是"多路混合 + 查询路由":向量/BM25 负责语义片段、图负责结构与多跳、社区摘要负责全局,路由器(规则或 LLM)按问题类型分发或并行融合——选型的本质是按业务问题分布给三条路分配投资。

为什么重要

kp-022 论证了三条路各有不可替代的强项,没有一条能通吃。工程难题因此变成:怎么判断一个查询该走哪条路、多路结果怎么合并、构建与维护预算怎么分——这就是融合路由与选型框架要回答的。LightRAG 等轻量方案则证明"混合"不必以 GraphRAG 级成本为代价。

前置知识

kp-010(RRF 融合)、kp-022(三盲区)、kp-025(图检索模式)。

核心概念

  • 查询路由(query routing):分类问题类型后分发——事实片段→向量/BM25;关系/多跳→图;全局综述→社区摘要。实现从简到繁:关键词规则("谁的/哪些供应商"触发图)→ 小模型分类器 → LLM 判断。
  • 并行融合:不路由,多路全跑,结果 RRF/加权融合进上下文——延迟高但无路由错误风险;适合问题类型混合、延迟不敏感的场景。
  • LightRAG(2024):GraphRAG 的轻量对照——简化抽取、双层检索(实体级 low-level + 主题级 high-level)、关键词抽取驱动双路,免去 Leiden+全社区摘要的重成本;适合中等规模语料的图增强入门。
  • 选型四问:① 问题分布三类占比?② 文档更新频率(图增量成本)?③ 预算(索引 token/维护人力)?④ 延迟要求(图查询与全局摘要的延迟档位不同)?

原理与机制

路由器的实现阶梯(按可靠性×成本排):

  1. 规则优先:高频问题模式(含"的……的"链、聚合词"哪些/共有/排名")正则触发图路,零成本零延迟,覆盖 60–80% 显意图查询。
  2. 小模型分类:三类(片段/结构/全局)分类器,训练数据从真实查询标注;几毫秒延迟。
  3. LLM 路由:最准最贵,且可与查询改写(kp-011)合并成一次调用省成本。

兜底原则:路由不确定时并行多路(宁可贵不可错)。

结果融合的上下文预算分配:多路结果进入同一上下文时要分区标注来源([向量]、[图谱]、[摘要]),防模型混淆证据性质;预算按路的可靠性与问题类型动态分配(结构问题给子图 60% 预算,片段问题反之)。

成本结构对比(选型的量化基础):

方案索引成本更新成本查询成本覆盖盲区
纯向量+BM25低低低多跳/全局
+图(LightRAG 级)中中低-中全局弱
GraphRAG 全家桶高(数量级)高全局查询高无(三条全占)

图示

查询 ─► 路由器(规则/分类器/LLM)
   ├─ 片段型 ──► 向量+BM25(混合检索) ─┐
   ├─ 结构型 ──► 实体链接→Cypher/遍历 ─┼─► 分区融合 → LLM 生成
   └─ 全局型 ──► 社区摘要(global)     ─┘
不确定 → 并行多路 → RRF 融合

实例或案例

  • 中型企业知识库(10 万文档):向量+BM25 为主干,图只建核心实体(产品/部门/政策)与两跳关系,LightRAG 级实现——多跳与部分全局需求覆盖,索引成本约为 GraphRAG 全量方案的 1/10。
  • 金融研报平台:问题分布全局类占比高(综述/对比),GraphRAG 式社区摘要值得投入;客服场景全局类 <5%,纯混合检索即可。

常见误区

  • 误区一:"上 GraphRAG = 技术先进"。不按问题分布选型是成本灾难;客服/政策类场景 80% 收益来自分块与混合检索这些便宜组件(kp-017 杠杆排序)。
  • 误区二:"路由用 LLM 一把梭"。规则先行的路由便宜、可解释、可调试;LLM 路由只处理规则覆盖不了的模糊地带。
  • 误区三:"多路结果直接堆进上下文"。不加来源分区会诱导模型把摘要当原文引、把子图当段落读;证据必须带性质标签。

与其他知识点的关系

  • kp-010:RRF 是融合的工具箱。
  • kp-011/025:路由与查询理解/图检索的衔接。
  • kp-017:选型服从调优方法论——先评测问题分布再投资。
  • kp-024:重方案的对照物。

自测题

  1. 路由器的三级实现与适用场景?

答:规则(高频显式模式,零成本覆盖大头)→ 小模型分类(毫秒级,处理规则外)→ LLM(最准最贵,模糊地带);不确定时并行兜底。

  1. 选型四问是什么?

答:问题类型分布、文档更新频率、预算(索引与维护)、延迟要求——四问决定三条路各投多少。

  1. 多路结果进上下文为什么要分区标注?

答:向量块、子图、社区摘要是性质不同的证据,不标注会导致模型混用(把摘要引用为原文、把关系链当叙述),影响忠实度与可核查性。

延伸阅读

  • Guo 等, "LightRAG: Simple and Fast Retrieval-Augmented Generation"(arXiv 2024)。
  • Edge 等 Microsoft GraphRAG(重方案对照)。
  • Anthropic/LlamaIndex 关于 query routing 与 multi-retriever 融合的工程文章。