本节摘要:客服是智能体最成熟的生产场景,也是最严苛的——高并发、强 SLA、错误直达真实用户。本节讲清这类系统的三条工程主线:用意图分诊削峰、用知识边界守真、用转人工设计兜底,并给出关键指标体系与一次退换货流程的完整走查。
个人助理服务一个人,客服智能体同时服务成千上万个会话,而且每个会话背后都是付了钱或正在生气的真实用户。场景的迁移把工程重心从"个人信任"换成了三样东西:并发的稳定、回答的真、兜底的快。
客服问题高度长尾又高度重复——订单查询、物流进度、退换货政策占了流量的绝对大头。分诊层的任务是把会话按意图与复杂度分流:高频标准问题走预置的检索式回答(快、便宜、稳),需要推理与多步执行才进智能体循环,情绪激烈或投诉倾向的直接快速通道转人工。分诊模型不必聪明,要的是快与稳——轻量分类模型加规则兜底,成本只有大模型的几十分之一。
def triage(session) -> str: intent = light_classifier(session.text) # 轻量模型,毫秒级 if intent.confidence < 0.6: return "agent_loop" # 看不准,交给智能体细看 if intent.name in STANDARD_INTENTS: # 查单、查物流等高频类 return "retrieval_reply" # 检索式直答,不进循环 if sentiment(session.text) == "angry" or intent.name == "complaint": return "human_fast_lane" # 情绪与投诉:快转人工 return "agent_loop"
客服回答错误的代价是真金白银的(答错退款政策 = 纠纷),所以这类系统的知识纪律最严:商品与政策类事实只从受控知识库出(第 6 章 RAG,带条款引用),库存与订单状态只从工具实时查(第 2 章),模型的语言能力只负责把事实组织得清楚易懂——不负责提供任何事实。话术模板与 RAG 结合的形态很常见:骨架是审核过的话术,事实字段由检索与工具填入,语言模型负责把两者缝合自然。
优惠与承诺类内容的特殊纪律:涉及"能不能退""赔多少"的回答,属于对用户的实质承诺,必须来自明确命中的政策条款(命中不到就承认需要确认),并在第二闸加高敏感分级——这类回答发出去就是合同。
转人工不是失败的逃逸口,是产品设计的一部分。三个要点:
判据明确。转人工触发器分三类:用户明确要求(一句话触发,不挽留不盘问)、意图与情绪判据(分诊层已覆盖)、智能体侧的置信信号(连续澄清超过两轮、检索证据不足、7.3 节护栏升级的动作)。
交接带全上下文。最招人烦的体验是转了人工还要从头再讲一遍。交接包必须包含:会话摘要、已核实的信息(订单号、问题类别)、已尝试的方案——这些在轨迹里都有,拼装成人工坐席的初诊面板即可。
等待有交代。人工排队不可避免,但排队要有预期管理("当前约需等待五分钟")、转回选项("继续由智能体协助")与进度可见。
背景:用户在客服入口发问:"上个月买的鞋开胶了,要退货。"
操作:分诊判为标准退换货意图,进智能体循环。第一轮工具查单核实:订单属实、在三十天质保期内、非人为损坏类目——证据齐全。第二轮按政策生成方案:免费退货加全额退款,引用政策条款编号。第三闸抽检(涉及退款承诺,退款类动作全量人工确认):坐席面板显示订单证据、政策依据、拟回复话术,一键批准。
结果:从提问到方案送达用时四十秒,用户按指引完成退货;人工只参与了四秒的批准动作。
解读:走查里每个组件都在岗:分诊削掉了进入循环的流量、RAG 保证政策引用准确、工具核实订单事实、护栏第三闸守住退款承诺、轨迹支撑了坐席面板。客服智能体没有单点魔法,是全册组件的合奏。
变式:销售场景(导购、线索资格判断)把"守真"的压力换个方向——夸大承诺同样要拦,但话术要更有引导性。合规红线(不得承诺疗效、收益)在知识层与第二闸都要显式建模,销售智能体的评测集里必须有红线用例专项。
⚠️ 常见坑:用满意度问卷作为唯一质量信号。不满意的用户早已流失或转向人工,问卷回收的是幸存者偏差;真实的质量信号是转人工率、二次进线率与问题一次解决率的组合——三者都要进日常监控。
下一节看另一个成熟场景:软件开发与测试——当"干活的对象"本身是代码,沙箱与审查门就成了主角。
客服流量的特点是脉冲式的——大促、故障、舆情事件都能让会话量在一小时内翻几倍。容量预案的三个层级:弹性层,分诊模型与检索服务按并发水平自动扩缩容,智能体循环的并发上限随模型服务的配额动态调整;排队层,超出容量的会话进入诚实排队(告知预计等待),排队期间智能体先把自助方案发过去(很多用户在等待中就自助解决了);弃保层,极端过载时按预设优先级保高价值会话(付费用户、投诉升级单),其余引导至异步留言——优先级策略要提前与业务方谈定写进配置,事故现场不是谈优先级的地方。成本侧与容量联动:脉冲期的模型调用费会同步冲高,8.5 的预算守卫要按大促口径单独设一条临时额度,避免正常业务被日常熔断线误伤。
客服场景还有一类容易被忽略的质量信号:会话开头的前两轮。大量无效会话在这里产生——用户粘了截图没配文字、输入了订单号以外的乱码、或者走错了入口(想咨询售前却进了售后)。前两轮做前置校验的收益是双重的:省掉无效会话进入循环的成本,更早给出正确的引导。具体做法很朴素:入口处结构化收集关键槽位(订单号、问题类型),收集不到的给补选菜单而不是硬启动循环;识别到情绪信号立即加权转人工,避免智能体在用户火气上再浇一轮机械回复。客服场景的体验分水岭,往往不在智能体答得多好,而在它多快识别出"这个会话不该由我来"。