附录A GraphRAG 术语表 本附录:系统整理 GraphRAG 领域核心术语,按类别分组,每个术语包含中英文名称、定义和简明说明。 基础概念 检索增强生成(Retrieval-Augmented Generation, RAG) 一种结合信息检索与大语言模型生成的技术范式,先从知识库检索相关文档,再将检索结果作为上下文注入 LLM 提示词,从而生成更准确、更有依据的回答。RAG 解决了大模型知识滞后和幻觉问题。 知识图谱(Knowledge Graph, KG) 以图结构表示知识的语义网络,由实体(节点)和关系(边)组成,每个节点和边可附带属性。知识图谱的核心价值在于将碎片化的信息组织为结构化的语义网络,支持高效的关系查询和多跳推理。
本附录:系统整理 GraphRAG 领域核心术语,按类别分组,每个术语包含中英文名称、定义和简明说明。
一种结合信息检索与大语言模型生成的技术范式,先从知识库检索相关文档,再将检索结果作为上下文注入 LLM 提示词,从而生成更准确、更有依据的回答。RAG 解决了大模型知识滞后和幻觉问题。
以图结构表示知识的语义网络,由实体(节点)和关系(边)组成,每个节点和边可附带属性。知识图谱的核心价值在于将碎片化的信息组织为结构化的语义网络,支持高效的关系查询和多跳推理。
知识图谱的基本存储单元,格式为(头实体, 关系, 尾实体),例如(腾讯, 总部位于, 深圳)。三元组是知识图谱中最小的事实表达单元。
知识图谱中的节点,代表现实世界中的具体对象或抽象概念,如人物、组织、技术、地点等。实体通常附带类型标签和属性集。
连接两个实体的语义边,描述实体之间的关联性质,如"属于""开发了""位于"等。关系是知识图谱推理的基础。
将知识图谱中的实体和关系映射到低维向量空间的技术,使语义相近的实体在向量空间中也更接近。常用方法包括 TransE、DistMult、GraphSAGE 等。
衡量图中节点重要性的经典算法,核心思想是"被重要节点指向的节点也重要"。在知识图谱中用于实体排序和重要性评估。
PageRank 的扩展,允许指定偏好节点集,使排序结果偏向与偏好节点相关的实体。GraphRAG 中用于以查询实体为中心的相关实体排序。
从非结构化文本中识别并分类命名实体的技术,如识别人名、组织名、地名、技术术语等。NER 是知识图谱构建的第一步。
从文本中识别实体之间语义关系的技术,如从"张三在腾讯工作"中抽取(张三, 工作于, 腾讯)。RE 构建知识图谱的边。
图遍历算法,从起始节点逐层向外扩展。GraphRAG 中用于获取查询实体的多跳邻域信息。
多路检索结果融合算法,对每路结果的排名取倒数后求和,消除不同检索器分数尺度的差异。RRF 因其简单有效,成为混合检索的主流融合策略。
专门存储和查询图结构数据的数据库系统,支持节点、边和属性的图数据模型。主流产品包括 Neo4j、NebulaGraph、JanusGraph、TigerGraph 等。
存储和检索高维向量嵌入的专用数据库,支持近似最近邻搜索(ANN)。主流产品包括 FAISS、Milvus、Pinecone、Weaviate、Chroma 等。
加速向量相似度搜索的数据结构,包括 FLAT(暴力搜索)、IVF(倒排索引)、HNSW(分层可导航小世界图)等。不同索引在精度和速度之间有不同权衡。
GraphRAG 系统中负责从知识库查找相关信息的组件,包括图检索器、向量检索器和文本检索器。检索器的质量直接决定最终生成效果。
在初筛结果基础上进行精细排序的模型,通常使用交叉编码器(Cross-Encoder)对 query-document 对进行精确相关性打分。Reranker 可显著提升 Top-K 结果质量。
前 K 个检索结果中包含相关文档的比例,衡量检索的召回能力。Recall@10=0.8 表示前 10 个结果中有 80% 的相关文档被召回。
第一个相关结果排名的倒数均值,衡量检索结果排序质量。MRR 越高说明相关结果排在越前面。
考虑相关性等级的归一化折扣累积增益指标,不仅关注是否检索到相关结果,还关注相关结果的排序位置和相关性程度。
图 A-1 GraphRAG 核心术语关系图
关键词:GraphRAG, 术语表, 知识图谱, RAG, PageRank, NER, 向量数据库
难度:参考