政务AI的两个主要形态是政务问答(办事指南、政策咨询的对话机器人)与审批辅助(材料预审、资格初筛)。本节审计它的成色:问答机器人的幻觉治理、审批辅助的程序正义底线、以及"非关键路径先行"的落地智慧。
一位市民在政务问答机器人里问"灵活就业社保断缴三个月补缴有影响吗",机器人流畅作答,条款编号说得清清楚楚——但那是它编的。政务领域的幻觉不只是丢脸,它可能被截图传播、被当成官方口径。所以政务问答的成色几乎完全取决于一件事:回答能不能被钉在政策原文上。工程上可行的形态与2.3节法律AI的锚定设计同构——检索到具体政策条文,回答只做条文的改写与组合,答不上来就明确说"未找到依据"并转人工。审计政务机器人最有效的一个测试:连续问十个具体到条款的问题,数一数有几条回答带原文引用、有几条在裸答。
POLICY_DB = { "社保断缴补缴": "依据城镇社保经办规程,断缴三个月内可申请补缴,逾期按规定处理", "居住证续签": "依据居住证管理条例,到期前三十日内可申请签注", } def answer(query, retriever_match): """锚定式政务问答:无依据则不回答——宁可转人工,不可编。""" if retriever_match is None: return {"text": "未在现行政策库中找到依据,已为您转人工坐席。", "cited": False} return {"text": POLICY_DB[retriever_match], "cited": True} print(answer("断缴补缴", "社保断缴补缴")["text"]) print(answer("学区房划片", None)["text"]) # 关键设计不是检索多强,而是"找不到就不答"的克制。 # 一个敢说不知道的政务机器人,成色高于一个什么都敢答的。
审批是另一个量级的问题:它直接影响个人权利(补贴资格、执照发放、落户积分)。这里有一条不可妥协的审计底线:AI只能做辅助,判定必须留给人,且申请人必须有申诉通道。具体拆成三个检查项。第一,材料预审可以自动化——识别缺件、格式错误这类无争议判断,机器做没有问题。第二,资格初筛只能做排序与提示——系统可以标记"此件疑似不符",但不能直接生成拒绝决定。第三,拒绝决定书上不能出现"系统判定"作为理由——法定理由必须是人类可理解、可辩论的政策依据。
def review_application(doc): """演示合规的分工:机器管缺件,人管裁决。""" machine_notes = [] if not doc.get("身份证复印件"): machine_notes.append("缺件:身份证复印件") if doc.get("收入证明日期", "") < "2025-08": machine_notes.append("提示:收入证明超出有效期,需人工确认") decision = "转人工裁决" # 机器永远不出终局决定 return {"机器备注": machine_notes or ["材料齐全,进入人工审核"], "处理流向": decision} case = {"收入证明日期": "2025-06"} print(review_application(case)) # 机器的输出全部是"事实性备注",没有一个词是"同意"或"拒绝"。
落地节奏上,成色好的政务AI项目几乎都从非关键路径切入:先做内部知识检索(公务员查政策)、会议纪要整理、热线工单分类,再对外做问答,最后才碰审批辅助。反过来一上来就改造审批流的项目,往往在一个复杂业务还没数字化清楚时就引入算法,结果两头不靠。审计时看项目的切入点在哪条路径上,基本能预判它的存活率。

这张路线图不只是实施建议,也是审计的分类尺:拿到一个政务AI项目,先看它站在哪一格、有没有越级——从第一格直接跳到第三格的项目,几乎都栽在业务本身还没数字化清楚的沟里。反过来,老老实实从第一格走起的团队,到第三格时已经攒够了政策库、口径表和内部信任,审批辅助只是水到渠成的延伸。技术在这条路上是次要变量,路径顺序才是主要变量。
背景(咨询台前的幻觉)、操作(锚定问答与合规分工原型)、结果(三条程序正义检查项)完整。解读:政务AI的成色公式里"误伤可申诉"权重最高——覆盖一百万人但申诉无门,不如覆盖十万人但件件可纠正。变式:法院的类案推送、税务的风险提示、社保的反冒领核查都是同构场景,程序正义三检查项原样可用。下一节看本章最后一个现场:工地上的估价与巡检。
政务问答上线后的评测也值得立规矩。常规的"满意度评分"几乎没有区分度——不满的用户早已离开。更有效的三个指标:转人工率及其原因分布(哪些问题机器人答不了)、重复提问率(用户没得到答案的信号)、引用命中率(回答附带了有效条文的比例)。按月看这三个数的趋势,比任何问卷都诚实。评测样本的抽取也有讲究:要包含方言表述、错别字、口语化的追问,政务用户的真实输入远比测试集里的标准问句粗糙,而恰恰是这些粗糙输入上的表现决定了系统在市民心中的口碑。
政务AI还有一个别处没有的复杂性:数据孤岛是制度设计的产物而非技术欠账。公安、民政、税务的数据分割有其正当理由,AI项目要跨部门取数时,走的不是技术接口而是权责协议。审计时看到"打通数据壁垒"的宏大方案,先问法律依据与授权链条——多数项目卡在这一步不是因为技术做不到,而是应该做不到。诚实的政务AI方案应该在数据边界内做优化,把跨部门的想象留给制度演进的节奏。
政务数字化的终局诉求不是"问得清"而是"办得成",问答机器人之后的下一跳是办事引导:把"我要办这件事"翻译成材料清单加流程路径。这一跳的审计要点与审批辅助不同——它不碰权利判定,难点在流程知识库的维护。各部门的办事指南更新频繁,机器人引用的流程过期一天就是一次群众白跑。成色好的系统给流程知识库设了保鲜机制:每条流程带生效日期与责任科室,到期自动提醒复核。这种细节不会出现在发布会上,却决定了系统第二年还活着与否。