术语表 (68 条)

RAG(检索增强生成)
先从外部知识库检索相关内容、再将其放入上下文让 LLM 生成答案的架构。
参数化知识
存储在模型权重中的知识,训练后冻结。
非参数化知识
存储在外部可检索载体(文档库、图)中的知识,可随时更新。
幻觉(hallucination)
LLM 生成流畅但不真实的内容;分事实性幻觉与忠实性幻觉。
忠实度(faithfulness)
答案论断可被所给上下文支持的程度,RAG 生成侧核心指标。
知识截止(knowledge cutoff)
模型训练数据的时间上限。
流水线(pipeline)
离线索引(解析→分块→嵌入→入库)+ 在线服务(检索→重排→组装→生成)的两段式链路。
分块(chunking)
把长文档切成检索单元;粒度权衡检索精度与证据完整性。
父子分块(parent-child)
小块检索命中、返回所属大块给 LLM 的两粒度策略。
语义分块(semantic chunking)
按嵌入语义突变点切块,使块内主题单一。
文档解析
把 PDF/扫描件/网页转成带结构的干净文本;版面分析与表格结构化是难点。
元数据(metadata)
附着在块上的结构化信息(来源、章节、时间、权限),支撑过滤、引用与更新。
pre-filtering
先按元数据/权限过滤候选集再做向量检索,权限场景的强制要求。
嵌入(embedding)
把文本编码为语义向量,使语义相近文本在向量空间相近。
双塔(bi-encoder)
查询与文档独立编码的检索模型结构,可离线索引。
交叉编码器(cross-encoder)
查询与文档拼接后联合编码,判别力强但不可预计算,用于重排。
对比学习(contrastive learning)
拉近正对、推远负对的嵌入训练范式。
MTEB
大规模文本嵌入基准,嵌入选型的第一站。
余弦相似度
向量方向相似度,检索默认度量;归一化后与内积、L2 排序等价。
HNSW
分层可导航小世界图,主流 ANN 索引;efSearch 是召回-延迟旋钮。
IVF
倒排文件索引——先聚类、查询只探测最近 nprobe 个簇。
PQ(乘积量化)
把高维向量压缩为字节码的索引压缩技术,常与 IVF 组合并需 rescore。
ANN(近似最近邻)
允许极小召回损失换取百倍加速的向量检索范式。
BM25
基于词频与逆文档频率的经典关键词检索算法,精确符号检索的兜底。
混合检索(hybrid retrieval)
向量路 + 关键词路并行检索后融合。
RRF(倒数排名融合)
只用各路排名、不依赖原始分数的融合算法,k 常取 60。
查询变换
检索前用 LLM 改写、扩展、分解用户问题(改写/HyDE/多查询/分解)。
HyDE
让 LLM 生成假设文档、以其向量检索的查询变换技术。
重排(reranking)
用交叉编码等重模型对初检候选精排,RAG 性价比最高的单点提升之一。
ColBERT
token 级 late interaction 检索模型,精度与速度介于双塔与交叉编码之间。
上下文组装
决定哪些块、按何顺序、何格式进入 prompt 的工程环节。
lost in the middle
模型对长上下文首尾利用率高、中部骤降的位置效应。
上下文压缩
对候选块做抽取或摘要压缩以节省 token、降噪。
引用约束
要求答案论断标注来源编号并经程序校验的忠实性机制。
拒答(abstention)
上下文不足以回答时明确回答"未找到",需显式授权与阈值配合。
RAGAS
以 context precision/recall、faithfulness、answer relevancy 四指标评测 RAG 的标准框架。
上下文精度/召回
检索侧指标——相关块是否排前 / 所需信息是否都被检回。
端到端调优
建基线→分段归因→单变量改动→指标验证的优化方法论。
知识图谱(KG)
以实体为节点、带类型关系为边的知识表示,最小单元为三元组。
三元组(triple)
(主语,谓语,宾语) 形式的最小知识单元。
本体(ontology)
定义图中实体类型、关系类型与约束的 schema。
属性图(property graph)
节点与边均可携带属性的图模型(Neo4j 等)。
RDF
以三元组为原子的 W3C 图数据标准,配 SPARQL 查询。
Cypher
属性图的声明式模式匹配查询语言。
实体对齐(entity resolution)
把同一实体的不同写法归一为一个节点。
实体链接(entity linking)
把问题中的提及锚定到图节点,图检索入口。
关系抽取(RE)
从文本中识别实体对之间关系及属性的任务。
Provenance(出处)
三元组/块的来源记录,支撑追溯与反向删除。
多跳(multi-hop)
答案需要跨两步以上关系链的问题;向量检索的结构性盲区。
全局聚合问题
答案是对全库主题归纳的问题;向量 top-k 无法胜任。
Leiden 算法
层次化社区发现算法,Microsoft GraphRAG 用它构建社区树。
社区摘要
GraphRAG 为每个社区生成的 LLM 摘要,构成可逐层消费的全局视角。
Map-Reduce(全局查询)
GraphRAG 对社区摘要逐个生成部分答案(Map)、再归纳汇总(Reduce)的查询模式。
GraphRAG
用图结构增强检索与归纳的 RAG 范式总称;狭义指微软 2024 参考实现。
LightRAG
GraphRAG 的轻量化实现——简化抽取与双层检索,降低索引成本。
Text-to-Cypher
LLM 把自然语言问题翻译成图查询语言的技术。
查询路由(routing)
按问题类型(片段/结构/全局)分发到不同检索通道。
Agentic RAG
由 LLM 动态决定是否检索、查哪路、是否重查的智能体化 RAG。
Self-RAG
模型以反思 token 自评"要不要检索/证据是否相关"的自我反思范式。
GNN(图神经网络)
聚合邻居信息更新节点表示的模型族(GCN/GAT/GraphSAGE)。
链接预测
预测图中缺失关系(边)的任务,可补全知识图谱。
过平滑(over-smoothing)
GNN 层数过深导致所有节点表示趋同的现象。
语义缓存(semantic cache)
按问题语义命中历史答案的缓存;须带权限与新鲜度维度。
模型路由
按问题复杂度把请求分发给不同档位模型以省成本。
间接提示注入
恶意指令藏在被检索文档中、借证据进入上下文的攻击。
知识库投毒(corpus poisoning)
向可检索源注入内容使特定查询必然命中的定向攻击。
多租户隔离
按租户物理/逻辑隔离检索范围;过滤必须在检索前强制执行。
多模态 RAG
检索对象扩展到图表与图像的 RAG;瓶颈在文档解析与多模态嵌入。