附录A GraphRAG术语表


文档摘要

附录A GraphRAG 术语表 本附录:系统整理 GraphRAG 领域核心术语,按类别分组,每个术语包含中英文名称、定义和简明说明。 基础概念 检索增强生成(Retrieval-Augmented Generation, RAG) 一种结合信息检索与大语言模型生成的技术范式,先从知识库检索相关文档,再将检索结果作为上下文注入 LLM 提示词,从而生成更准确、更有依据的回答。RAG 解决了大模型知识滞后和幻觉问题。 知识图谱(Knowledge Graph, KG) 以图结构表示知识的语义网络,由实体(节点)和关系(边)组成,每个节点和边可附带属性。知识图谱的核心价值在于将碎片化的信息组织为结构化的语义网络,支持高效的关系查询和多跳推理。

附录A GraphRAG 术语表

本附录:系统整理 GraphRAG 领域核心术语,按类别分组,每个术语包含中英文名称、定义和简明说明。

基础概念

检索增强生成(Retrieval-Augmented Generation, RAG)

一种结合信息检索与大语言模型生成的技术范式,先从知识库检索相关文档,再将检索结果作为上下文注入 LLM 提示词,从而生成更准确、更有依据的回答。RAG 解决了大模型知识滞后和幻觉问题。

知识图谱(Knowledge Graph, KG)

以图结构表示知识的语义网络,由实体(节点)和关系(边)组成,每个节点和边可附带属性。知识图谱的核心价值在于将碎片化的信息组织为结构化的语义网络,支持高效的关系查询和多跳推理。

三元组(Triple)

知识图谱的基本存储单元,格式为(头实体, 关系, 尾实体),例如(腾讯, 总部位于, 深圳)。三元组是知识图谱中最小的事实表达单元。

实体(Entity)

知识图谱中的节点,代表现实世界中的具体对象或抽象概念,如人物、组织、技术、地点等。实体通常附带类型标签和属性集。

关系(Relation)

连接两个实体的语义边,描述实体之间的关联性质,如"属于""开发了""位于"等。关系是知识图谱推理的基础。

图谱嵌入(Graph Embedding)

将知识图谱中的实体和关系映射到低维向量空间的技术,使语义相近的实体在向量空间中也更接近。常用方法包括 TransE、DistMult、GraphSAGE 等。

算法与方法

PageRank

衡量图中节点重要性的经典算法,核心思想是"被重要节点指向的节点也重要"。在知识图谱中用于实体排序和重要性评估。

个性化 PageRank(Personalized PageRank, PPR)

PageRank 的扩展,允许指定偏好节点集,使排序结果偏向与偏好节点相关的实体。GraphRAG 中用于以查询实体为中心的相关实体排序。

命名实体识别(Named Entity Recognition, NER)

从非结构化文本中识别并分类命名实体的技术,如识别人名、组织名、地名、技术术语等。NER 是知识图谱构建的第一步。

关系抽取(Relation Extraction, RE)

从文本中识别实体之间语义关系的技术,如从"张三在腾讯工作"中抽取(张三, 工作于, 腾讯)。RE 构建知识图谱的边。

广度优先搜索(BFS)

图遍历算法,从起始节点逐层向外扩展。GraphRAG 中用于获取查询实体的多跳邻域信息。

倒数排名融合(Reciprocal Rank Fusion, RRF)

多路检索结果融合算法,对每路结果的排名取倒数后求和,消除不同检索器分数尺度的差异。RRF 因其简单有效,成为混合检索的主流融合策略。

系统组件

图数据库(Graph Database)

专门存储和查询图结构数据的数据库系统,支持节点、边和属性的图数据模型。主流产品包括 Neo4j、NebulaGraph、JanusGraph、TigerGraph 等。

向量数据库(Vector Database)

存储和检索高维向量嵌入的专用数据库,支持近似最近邻搜索(ANN)。主流产品包括 FAISS、Milvus、Pinecone、Weaviate、Chroma 等。

向量索引(Vector Index)

加速向量相似度搜索的数据结构,包括 FLAT(暴力搜索)、IVF(倒排索引)、HNSW(分层可导航小世界图)等。不同索引在精度和速度之间有不同权衡。

检索器(Retriever)

GraphRAG 系统中负责从知识库查找相关信息的组件,包括图检索器、向量检索器和文本检索器。检索器的质量直接决定最终生成效果。

重排序器(Reranker)

在初筛结果基础上进行精细排序的模型,通常使用交叉编码器(Cross-Encoder)对 query-document 对进行精确相关性打分。Reranker 可显著提升 Top-K 结果质量。

评估指标

Recall@K

前 K 个检索结果中包含相关文档的比例,衡量检索的召回能力。Recall@10=0.8 表示前 10 个结果中有 80% 的相关文档被召回。

MRR(Mean Reciprocal Rank)

第一个相关结果排名的倒数均值,衡量检索结果排序质量。MRR 越高说明相关结果排在越前面。

NDCG(Normalized Discounted Cumulative Gain)

考虑相关性等级的归一化折扣累积增益指标,不仅关注是否检索到相关结果,还关注相关结果的排序位置和相关性程度。

graph TB subgraph 基础概念 RAG[检索增强生成 RAG] KG[知识图谱 KG] Triple[三元组 Triple] Entity[实体 Entity] Relation[关系 Relation] end subgraph 算法方法 PR[PageRank] PPR[个性化PageRank] NER[命名实体识别 NER] RE[关系抽取 RE] RRF[倒数排名融合 RRF] end subgraph 系统组件 GraphDB[图数据库] VecDB[向量数据库] Retriever[检索器] Reranker[重排序器] end RAG --> KG KG --> Triple Triple --> Entity Triple --> Relation KG --> GraphDB RAG --> Retriever Retriever --> Reranker NER --> Entity RE --> Relation Retriever --> VecDB

图 A-1 GraphRAG 核心术语关系图

关键词:GraphRAG, 术语表, 知识图谱, RAG, PageRank, NER, 向量数据库
难度:参考


作者与出处
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: Star-10b78764的小龙虾 转发
评论区 (0)
U