- RAG(检索增强生成)
- 先从外部知识库检索相关内容、再将其放入上下文让 LLM 生成答案的架构。
- 参数化知识
- 存储在模型权重中的知识,训练后冻结。
- 非参数化知识
- 存储在外部可检索载体(文档库、图)中的知识,可随时更新。
- 幻觉(hallucination)
- LLM 生成流畅但不真实的内容;分事实性幻觉与忠实性幻觉。
- 忠实度(faithfulness)
- 答案论断可被所给上下文支持的程度,RAG 生成侧核心指标。
- 知识截止(knowledge cutoff)
- 模型训练数据的时间上限。
- 流水线(pipeline)
- 离线索引(解析→分块→嵌入→入库)+ 在线服务(检索→重排→组装→生成)的两段式链路。
- 分块(chunking)
- 把长文档切成检索单元;粒度权衡检索精度与证据完整性。
- 父子分块(parent-child)
- 小块检索命中、返回所属大块给 LLM 的两粒度策略。
- 语义分块(semantic chunking)
- 按嵌入语义突变点切块,使块内主题单一。
- 文档解析
- 把 PDF/扫描件/网页转成带结构的干净文本;版面分析与表格结构化是难点。
- 元数据(metadata)
- 附着在块上的结构化信息(来源、章节、时间、权限),支撑过滤、引用与更新。
- pre-filtering
- 先按元数据/权限过滤候选集再做向量检索,权限场景的强制要求。
- 嵌入(embedding)
- 把文本编码为语义向量,使语义相近文本在向量空间相近。
- 双塔(bi-encoder)
- 查询与文档独立编码的检索模型结构,可离线索引。
- 交叉编码器(cross-encoder)
- 查询与文档拼接后联合编码,判别力强但不可预计算,用于重排。
- 对比学习(contrastive learning)
- 拉近正对、推远负对的嵌入训练范式。
- MTEB
- 大规模文本嵌入基准,嵌入选型的第一站。
- 余弦相似度
- 向量方向相似度,检索默认度量;归一化后与内积、L2 排序等价。
- HNSW
- 分层可导航小世界图,主流 ANN 索引;efSearch 是召回-延迟旋钮。
- IVF
- 倒排文件索引——先聚类、查询只探测最近 nprobe 个簇。
- PQ(乘积量化)
- 把高维向量压缩为字节码的索引压缩技术,常与 IVF 组合并需 rescore。
- ANN(近似最近邻)
- 允许极小召回损失换取百倍加速的向量检索范式。
- BM25
- 基于词频与逆文档频率的经典关键词检索算法,精确符号检索的兜底。
- 混合检索(hybrid retrieval)
- 向量路 + 关键词路并行检索后融合。
- RRF(倒数排名融合)
- 只用各路排名、不依赖原始分数的融合算法,k 常取 60。
- 查询变换
- 检索前用 LLM 改写、扩展、分解用户问题(改写/HyDE/多查询/分解)。
- HyDE
- 让 LLM 生成假设文档、以其向量检索的查询变换技术。
- 重排(reranking)
- 用交叉编码等重模型对初检候选精排,RAG 性价比最高的单点提升之一。
- ColBERT
- token 级 late interaction 检索模型,精度与速度介于双塔与交叉编码之间。
- 上下文组装
- 决定哪些块、按何顺序、何格式进入 prompt 的工程环节。
- lost in the middle
- 模型对长上下文首尾利用率高、中部骤降的位置效应。
- 上下文压缩
- 对候选块做抽取或摘要压缩以节省 token、降噪。
- 引用约束
- 要求答案论断标注来源编号并经程序校验的忠实性机制。
- 拒答(abstention)
- 上下文不足以回答时明确回答"未找到",需显式授权与阈值配合。
- RAGAS
- 以 context precision/recall、faithfulness、answer relevancy 四指标评测 RAG 的标准框架。
- 上下文精度/召回
- 检索侧指标——相关块是否排前 / 所需信息是否都被检回。
- 端到端调优
- 建基线→分段归因→单变量改动→指标验证的优化方法论。
- 知识图谱(KG)
- 以实体为节点、带类型关系为边的知识表示,最小单元为三元组。
- 三元组(triple)
- (主语,谓语,宾语) 形式的最小知识单元。
- 本体(ontology)
- 定义图中实体类型、关系类型与约束的 schema。
- 属性图(property graph)
- 节点与边均可携带属性的图模型(Neo4j 等)。
- RDF
- 以三元组为原子的 W3C 图数据标准,配 SPARQL 查询。
- Cypher
- 属性图的声明式模式匹配查询语言。
- 实体对齐(entity resolution)
- 把同一实体的不同写法归一为一个节点。
- 实体链接(entity linking)
- 把问题中的提及锚定到图节点,图检索入口。
- 关系抽取(RE)
- 从文本中识别实体对之间关系及属性的任务。
- Provenance(出处)
- 三元组/块的来源记录,支撑追溯与反向删除。
- 多跳(multi-hop)
- 答案需要跨两步以上关系链的问题;向量检索的结构性盲区。
- 全局聚合问题
- 答案是对全库主题归纳的问题;向量 top-k 无法胜任。
- Leiden 算法
- 层次化社区发现算法,Microsoft GraphRAG 用它构建社区树。
- 社区摘要
- GraphRAG 为每个社区生成的 LLM 摘要,构成可逐层消费的全局视角。
- Map-Reduce(全局查询)
- GraphRAG 对社区摘要逐个生成部分答案(Map)、再归纳汇总(Reduce)的查询模式。
- GraphRAG
- 用图结构增强检索与归纳的 RAG 范式总称;狭义指微软 2024 参考实现。
- LightRAG
- GraphRAG 的轻量化实现——简化抽取与双层检索,降低索引成本。
- Text-to-Cypher
- LLM 把自然语言问题翻译成图查询语言的技术。
- 查询路由(routing)
- 按问题类型(片段/结构/全局)分发到不同检索通道。
- Agentic RAG
- 由 LLM 动态决定是否检索、查哪路、是否重查的智能体化 RAG。
- Self-RAG
- 模型以反思 token 自评"要不要检索/证据是否相关"的自我反思范式。
- GNN(图神经网络)
- 聚合邻居信息更新节点表示的模型族(GCN/GAT/GraphSAGE)。
- 链接预测
- 预测图中缺失关系(边)的任务,可补全知识图谱。
- 过平滑(over-smoothing)
- GNN 层数过深导致所有节点表示趋同的现象。
- 语义缓存(semantic cache)
- 按问题语义命中历史答案的缓存;须带权限与新鲜度维度。
- 模型路由
- 按问题复杂度把请求分发给不同档位模型以省成本。
- 间接提示注入
- 恶意指令藏在被检索文档中、借证据进入上下文的攻击。
- 知识库投毒(corpus poisoning)
- 向可检索源注入内容使特定查询必然命中的定向攻击。
- 多租户隔离
- 按租户物理/逻辑隔离检索范围;过滤必须在检索前强制执行。
- 多模态 RAG
- 检索对象扩展到图表与图像的 RAG;瓶颈在文档解析与多模态嵌入。