Microsoft GraphRAG:社区发现与全局摘要

05-GraphRAG与图增强检索 进阶 约 20 分钟 #GraphRAG#社区发现#Leiden#全局摘要#Map-Reduce 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),关键结论建议对照经典文献复核。

一句话定义

微软 GraphRAG(2024)在实体—关系图上跑层次化社区发现(Leiden 算法),让 LLM 为每个社区生成摘要,形成"局部片段 → 社区摘要 → 大区摘要 → 全库摘要"的层次结构;查询时对全库性问题沿社区摘要做 Map-Reduce 式归纳——这是"盲区二:全局聚合"的代表作解法。

为什么重要

GraphRAG 论文首次系统回答了"RAG 如何做全局性总结":传统向量 RAG 只能 top-k 局部,GraphRAG 用社区层次把全库组织成可逐层消费的摘要树,在"数据集整体主题"类问题上显著优于基线向量 RAG。它也定义了图构建→社区→摘要→映射归约的完整参考实现,是本方向的事实蓝本。

前置知识

kp-022(全局盲区)、kp-023(图构建管线)。

核心概念

  • 索引阶段:文本 → 实体/关系抽取(LLM + gleaning 多轮补抽)→ 实体协现图(实体为节点、同块共现为边,边可带权重与描述)→ Leiden 层次化社区发现(把紧密关联的实体聚成社区,递归细分出多层级)→ 每个社区生成 LLM 摘要(高层社区摘要综合子社区)。
  • 局部查询(local search):与实体相关的问题——从问题抽实体,找相关社区/实体邻域,连同原始文本块一起进上下文。
  • 全局查询(global search):与全库主题相关的问题——Map 阶段:每轮抽样一批社区摘要,LLM 生成"部分答案+关键点评分";Reduce 阶段:汇总所有部分答案按重要性排序生成最终答案。
  • 成本特征:索引阶段按全库 token 数消耗 LLM 调用(比向量索引贵一个数量级以上),社区摘要与全局查询都持续烧 token——这是它最大的工程门槛。

原理与机制

为什么社区发现是关键一步:全库摘要不可能一次生成(超窗口),必须分层。社区=主题的自然聚类(Leiden 保证模块度最优的紧密子图),"社区摘要"就是"主题摘要"的天然单元;层次结构让"看全局"(顶层摘要)与"钻细节"(下钻子社区→原文)共用一棵树。

Map-Reduce 的意义:全局问题被拆成"每社区局部观点 → 归纳全局",每步都在窗口内;关键点评分让 Reduce 阶段优先采纳高价值局部结论。这本质是把 kp-014 的上下文工程上移到"摘要层":喂给模型的是压缩过的结构化视角而非原始片段。

两种查询模式的适配:local search 复杂度低、延迟小,适合日常问答;global search 需要遍历大量社区摘要(贵、慢、可并发),适合"报告/盘点/趋势"类低频深问题。生产上应按查询类型路由(kp-026)。

图示

索引: 文本 ─抽取(gleaning)─► 实体协现图 ─Leiden─► 层次社区树
      每社区 ─LLM─► 社区摘要(高层摘要综合低层)
全局查询: [社区摘要×N] ─Map(评分+部分答案)─► ─Reduce─► 全局答案
局部查询: 问题实体 ─► 相关社区+邻域+原文块 ─► 答案

实例或案例

  • 论文实测(公开数据集如播客转录、新闻语料):全局类问题上 GraphRAG 的答案全面性/多样性被 LLM 评委显著排在向量 RAG 之上;局部类问题两者相当。
  • 企业实践:全库级"年报风险综述""规章制度主题盘点"用 global search;单点事实问答走 local 或普通向量路。

常见误区

  • 误区一:"GraphRAG 全面取代向量 RAG"。它的优势面是全局综合;日常片段问答向量路更快更便宜——混合路由才是正确姿势(kp-026)。
  • 误区二:"跑一遍索引就完了"。文档更新要重算受影响社区与摘要(增量策略是选型时就要问的问题);索引成本按 token 计费需预算。
  • 误区三:"社区摘要一定忠实"。摘要是 LLM 生成的二手信息,可能带偏;关键决策链路仍需下钻到原文块核查。

与其他知识点的关系

  • kp-022:解的就是全局盲区。
  • kp-023:上游构建管线(gleaning 出处)。
  • kp-026:LightRAG 等轻量化对照。
  • kp-014:摘要层上下文工程的思想同源。

自测题

  1. Leiden 社区发现在 GraphRAG 里的作用?

答:把实体协现图聚成层次化主题社区,社区成为"可被 LLM 摘要的全局视角单元",支撑逐层归纳的全局问答。

  1. global search 的 Map-Reduce 怎么工作?

答:Map 对各社区摘要生成部分答案并给关键点打分,Reduce 汇总按分排序合成最终答案——每步控制在窗口内。

  1. GraphRAG 最大的工程代价是什么?

答:索引与查询的 LLM token 成本(全库抽取+逐社区摘要+全局遍历),及文档更新时的增量重算复杂度。

延伸阅读

  • Edge 等, "From Local to Global: A Graph RAG Approach to Query-Focused Summarization"(arXiv 2024)。
  • Microsoft GraphRAG 官方仓库与文档(索引/查询配置)。
  • Leiden 算法:Traag 等, "From Louvain to Leiden"(2019)。