生产 RAG 聊天机器人:受监管的垂直领域


文档摘要

生产 RAG 聊天机器人:受监管的垂直领域 本节摘要:Harvey、Glean、Mendable、LlamaCloud 在 2026 年都跑同一个生产形态。用 docling 或 Unstructured 加 ColPali 摄取;混合检索;用 bge-reranker-v2-gemma 重排序;用 Claude Sonnet 4.7 合成,提示缓存命中率 6080%;用 Llama Guard 4 与 NeMo Guardrails 守护;用 Langfuse 与 Phoenix 监控;用 RAGAS 在 200 题金集上打分。本节要求你在受监管领域(法律、临床、保险)构建一个,毕业标准是通过金集、红队与漂移仪表盘。你会学到提示缓存这个成本杠杆,以及引用级可审计与漂移检测这些真正的难点。

生产 RAG 聊天机器人:受监管的垂直领域

本节摘要:Harvey、Glean、Mendable、LlamaCloud 在 2026 年都跑同一个生产形态。用 docling 或 Unstructured 加 ColPali 摄取;混合检索;用 bge-reranker-v2-gemma 重排序;用 Claude Sonnet 4.7 合成,提示缓存命中率 60~80%;用 Llama Guard 4 与 NeMo Guardrails 守护;用 Langfuse 与 Phoenix 监控;用 RAGAS 在 200 题金集上打分。本节要求你在受监管领域(法律、临床、保险)构建一个,毕业标准是通过金集、红队与漂移仪表盘。你会学到提示缓存这个成本杠杆,以及引用级可审计与漂移检测这些真正的难点。

对应原课程:Phase 19 · Lesson 08 · production-rag-chatbot(原英文 phases/19-capstone-projects/08-production-rag-chatbot/docs/en.md)。

学习目标

阅读完本节,你应当能够:

  1. 用 docling/Unstructured + ColPali 高保真摄取,产出带摘要、角色标签、司法辖区标签的块。
  2. 实现混合检索 + 角色与辖区过滤 + 倒数秩融合(RRF)+ 重排序的多步管线。
  3. 用稳定前缀(系统提示 + 重排序上下文)设计提示缓存,稳态命中率 60~80%。
  4. 叠 Llama Guard 4 + NeMo Guardrails + Presidio 三层护栏,做引用强制后过滤。
  5. 建 200 题金集与 50 条红队套件(jailbreak、PII 外泄、越域、跨辖区泄漏)。
  6. 用 Arize Phoenix 监控每周检索质量与幻觉分数漂移,5% 跌幅告警。

一、问题与直觉

受监管领域的 RAG(法律合同、临床试验方案、保险条款)是 2026 年最常投产的形态,因为 ROI 明显、赌注具体。Harvey(Allen & Overy)为法律造了它;Mendable 是开发者文档版;Glean 覆盖企业搜索。模式是:高保真摄取、混合检索加重排序、带引用强制与提示缓存的合成、多层安全护栏、持续漂移监控。

难点不在模型。它们是司法辖区感知合规(HIPAA、GDPR、SOC2)、引用级可审计、成本控制(提示缓存在高命中率下打折 60~90%)、用 RAGAS 忠实度做幻觉检测、以及源文档更新而索引没跟上时的漂移检测。本节要求你在 200 题金集上把这些全做完,并配一套红队。

二、从零实现

管线有两面。摄取:docling 或 Unstructured 解析结构化文档;ColPali 处理视觉密集的;块带摘要、标签、角色访问标签。向量进 pgvector + pgvectorscale(< 5000 万向量)或 Qdrant Cloud;稀疏 BM25 并行。对话:LangGraph 处理记忆与多轮;每次查询跑混合检索,用 bge-reranker-v2-gemma-2b 重排序,用 Claude Sonnet 4.7(提示缓存)合成,过 Llama Guard 4 与 NeMo Guardrails,发引用锚定的响应。

提示缓存是成本杠杆(稳定前缀设计):

messages = [ {"role": "system", "content": CACHE_HEADER}, # 静态政策,缓存头 {"role": "user", "content": reranked_context}, # 重排序上下文,缓存扩展 {"role": "user", "content": user_question}, # 问题,不缓存后缀 ] # 稳态命中率 60~80% 时,单查询成本降 3~5x

评估栈四层。金集(200 标注 Q/A 带引用)测正确性。红队(jailbreak、PII 抽取、越域、跨辖区泄漏)测安全。RAGAS 自动每轮算忠实度/答案相关性/上下文精度。漂移仪表盘(Arize Phoenix)每周看检索质量与幻觉分。

三、架构与技术栈

  • 摄取:Unstructured.io 或 docling 解析结构化文档;ColPali 处理视觉密集 PDF。
  • 向量库:< 5000 万向量用 pgvector + pgvectorscale;否则 Qdrant Cloud。
  • 稀疏:Tantivy BM25,字段加权。
  • 编排:LlamaIndex Workflows(摄取)+ LangGraph(对话)。
  • 重排序:自托管 bge-reranker-v2-gemma-2b 或托管 Voyage rerank-2。
  • LLM:Claude Sonnet 4.7 配提示缓存;兜底自托管 Llama 3.3 70B。
  • 评估:RAGAS 0.2 在线,DeepEval 做幻觉与 jailbreak 套件。
  • 可观测性:自托管 Langfuse 配标注队列;Arize Phoenix 漂移。
  • 护栏:Llama Guard 4 输入/输出分类,NeMo Guardrails v0.12 策略,Presidio 脱敏。
  • 合规:块上角色访问标签;GDPR/HIPAA 辖区标签。

四、可复用产物

outputs/skill-production-rag.md 描述交付物:一个带合规标签部署的受监管领域聊天机器人,过评分量表,配实时漂移监控。评分量表:

权重 标准 度量方式
25 RAGAS 忠实度 + 答案相关性 金集(200 Q/A)上的在线分
20 引用正确性 答案中带可验证源锚的比例
20 护栏覆盖 Llama Guard 4 通过率 + jailbreak 套件结果
20 成本/延迟工程 提示缓存命中率、p95 延迟、美元/查询
15 漂移监控仪表盘 Phoenix 实时仪表盘带每周检索质量趋势
100

一次典型对话:

$ chat --role=analyst --jurisdiction=GDPR > what is the data-retention obligation for EU user profiles under our contract? [retrieve] hybrid top-20 filtered to GDPR + analyst-role [rerank] top-5 kept [synth] claude-sonnet-4.7, cache hit 74%, 0.8s answer: The contract (Section 12.4, Master Services Agreement dated 2024-03-11) obligates EU user profile deletion within 30 days of termination per GDPR Article 17. The DPA amendment (DPA-v2.1, Section 5) extends this to 14 days for "restricted" category data. citations: [MSA-2024-03-11 s12.4, DPA-v2.1 s5]

五、框架对比

Harvey 是法律生产栈标杆,合规最深;Glean 是企业级搜索规模参考;Mendable 是开发者文档风味。摄取侧,Unstructured 与 docling 各有所长——docling 对表格更强,Unstructured 格式覆盖更广,ColPali 是视觉密集页的补丁。向量库,pgvector + pgvectorscale 对已有 Postgres 栈友好,Qdrant Cloud 规模更大。成本上,Claude 4.5+ 与 GPT-5+ 都支持提示缓存,关键是把系统提示 + 重排序上下文放成稳定前缀,命中率才能稳在 60~80%。

六、练习

  1. 跨辖区:在另一辖区(如 HIPAA 配 GDPR)建第二语料切片,演示角色+辖区过滤在 20 题跨辖区探测上阻止泄漏。
  2. 缓存分析:度量一周生产流量的提示缓存命中率,找出哪些查询打破缓存前缀,重构。
  3. 多轮记忆:加 1 万 token 摘要缓冲的多轮记忆,度量随对话增长忠实度是否下降。
  4. 换模型:把 Claude Sonnet 4.7 换成自托管 Llama 3.3 70B,度量美元/查询与忠实度差值。
  5. 「不确定」模式:加一个「不确定」模式——若 top 重排序分低于阈值,Agent 说「我没有把握的引用」而不答,度量虚假自信的下降。

本节要点回顾

  1. 受监管 RAG 形态已定:高保真摄取 + 混合检索 + 重排序 + 引用强制合成 + 多层护栏 + 漂移监控。
  2. 难点在合规与可审计:HIPAA/GDPR/SOC2 辖区标签、引用级审计、漂移检测。
  3. 提示缓存是成本杠杆:稳定前缀设计,稳态命中率 6080%,单查询成本降 35x。
  4. 四层评估:金集(正确性)+ 红队(安全)+ RAGAS(忠实度)+ Phoenix(漂移)。
  5. 三层护栏:Llama Guard 4 分类 + NeMo 策略 + Presidio 脱敏。
  6. 引用强制:无引用答案被后过滤拒掉或回炉。
  7. 漂移告警:每周检索质量跌 5% 告警,源文档更新而索引没跟上是主因。

下一节,我们转向「代码迁移 Agent」——把遗留代码库自动搬到新语言或新框架。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U