能力越强责任越大。多智能体系统把"多个角色的自主决策"串起来,出错时责任链比单 Agent 更难追。这一节讲三类风险(偏见、失控、滥用)和对应的兜底设计。
单个模型有偏见,多 Agent 互相"确认偏误"会把偏见放大——一个说"应该这样",另一个附和,没人挑刺。对策是刻意放一个"唱反调"角色(4.3 裁判 Agent),并给评估 Agent 加偏见检测提示。
# 刻意设一个异议角色,打破群体附和 skeptic = ConversableAgent("skeptic", llm_config=cfg, system_message="你专门找结论里的偏见和漏洞,即使别人都同意也要质疑。") # 加入 group,避免群体思维把偏见固化
auto 群聊 + NEVER + 无沙箱(4.5/5.4)组合,可能让危险操作自动发生。对策是"危险操作分级":只读自动,写操作人工确认,删除类强制双确认。
# 危险操作单独函数,且只在 TERMINATE 模式 Agent 注册,需人确认 def purge_data(tag: str) -> str: """清空某批数据,需人工在终端确认。""" return f"已清空 {tag}" # 不进全自动 Agent 的 functions 列表
系统可能被人诱导去生成有害内容或越权操作。对策是输入侧加守门钩子(3.2)、输出侧加合规检查(5.4 脱敏),并留全量审计日志(5.3)。
多 Agent 出错时,谁负责?我们建议:每个关键决策点都让某个 Agent 显式"署名"(在消息里标注自己做了什么决定),配合日志,审计时能还原责任链,而非笼统归咎"AI 干的"。
无论自动化多深,高风险场景保留人工终审(4.5)。负责任的 AI 不是"全自动不用人",而是"人知道在哪能用、在哪必须拦"。
刻意放一个唱反调的 Agent,打破群体附和,让偏见在冒头时就被质疑。
from autogen import ConversableAgent, GroupChat, GroupChatManager import os cfg = {"model": "gpt-4o-mini", "api_key": os.environ.get("OPENAI_API_KEY")} skeptic = ConversableAgent("skeptic", llm_config=cfg, system_message="你专门找结论里的偏见和漏洞,即使别人都同意也要质疑。") writer = ConversableAgent("writer", llm_config=cfg, system_message="你写方案。") group = GroupChat(agents=[writer, skeptic], messages=[], max_round=6) mgr = GroupChatManager(group=group, llm_config=cfg) # skeptic 的存在让"大家都说好"时仍有人挑刺,偏见更难固化
每个关键决策点让相关 Agent 在消息里"署名"——说明自己做了什么决定、依据什么。配合 5.3 的日志,审计时能还原"这一步是谁定的",而不是笼统归咎系统。下面示意署名格式。
# 决策署名:消息里标注决策者与依据 decision_msg = {"role": "user", "content": "[裁决] arbitrator 裁定用字典结构,依据 tester 测试基于字典。"} # 进历史后,任何回放都能看到这一决定的来源
无论自动化多深,高风险场景保留人工终审。负责任 AI 不是"全自动不用人",而是"人知道在哪能用、在哪必须拦"。把这条写进设计文档,比上线后补救便宜太多。
假设一个招聘 Agent 基于有偏历史数据,倾向于某类候选人。单 Agent 可能直接输出偏见结论;三个 Agent 里若两个都"顺着说",偏见会被包装成"共识"。这正是多智能体特有的风险——群体智能可能放大而非抵消个体偏差。所以异议角色(skeptic)不是锦上添花,而是必需的安全阀。我们在高风险决策场景里,会强制要求至少一个角色专门挑战结论的公平性。
把每个 Agent 的潜在风险列成表:风险是什么、触发条件、缓解措施、谁负责。比如"检索 Agent 可能返回过期政策"→缓解是"检索时带时间过滤"→负责人是检索模块 owner。这张表随系统迭代更新,是负责任 AI 的落地动作,比空谈原则有用。
光说"要负责"没用,得有指标。我们给每个高风险系统加两条:偏见命中率(异议 Agent 拦下多少有偏结论)、人工干预率(多少决策最终由人定)。这两条随版本追踪,下降要报警。度量让"负责任"从口号变成可管理的数字,也方便向业务方证明系统可信。
守门钩子能拦明显违规,但拦不住精心包装的诱导。所以单靠输入侧不够,输出侧也要合规检查(见 5.4 脱敏),再加审计留痕。三层叠起来,滥用难度才够高。我们提醒:任何"完全防滥用"的宣称都夸大,目标是把门槛提到不值得绕过,而非绝对杜绝。
出了事谁负责?我们的原则是:系统设计者对人机边界负责,操作者对人工确认的那一步负责,自动化部分的责任追溯到它的设计记录。把这三层写清,监管问起来不慌,团队也不会互相推。负责任 AI 落到最后,是责任链条清晰,而非"全自动无责"。
能力越大责任越大,对多智能体尤其如此。把安全边界、责任链条、人工兜底写进设计,系统才值得托付。负责任 AI 不是附加项,是地基。
⚠️ auto 群聊 + NEVER + 无沙箱三者叠加,是负责任 AI 的红灯组合,严禁于高风险场景。
💡 风险管理是"对话即编排"的伦理底座——编排越自动,越要留人能拦、能追的绳。