本节摘要:辅助智能体是 OWL 会议的实际操盘者:它接收甲方代表转写的议题,拆解成子任务,分派给工具专家,监控进度,最后汇总兜底。本节拆解它的"拆解—分派—监控—汇总"四拍循环,用日志片段展示一轮真实的议程推进,并给出主持人失控的两种典型症状与治疗手段。
本节承接 2.1:甲方代表把"活儿是什么"钉死了,现在轮到主持人回答"活儿怎么流转"。在全册知识地图上,这是与会名册的中枢一站——后面 2.3 的专家、2.4 的议题机制,都由主持人在会场上实际调度。
把辅助智能体的行为抽象成一个循环,每轮对话走四拍:

看一段抽象自 OWL 运行日志的对话片段(贯穿案例的竞品调研),观察主持人怎么走四拍。发言人标注在行首,缩进表示轮次:
[轮次03] 辅助智能体(拆解): 议题"调研竞品定价"拆为3个子任务: T1 打开竞品A官网定价页并提取三档价格(验收:含币种与周期) T2 打开竞品B官网定价页并提取三档价格(同上) T3 对两份价格表折算月付口径并计算差价(验收:给出百分比) [轮次04] 辅助智能体(分派): T1、T2 派给浏览器专家;T3 等 T1 T2 齐备后派给代码专家 [轮次05] 浏览器专家: T1 完成。竞品A:基础版99元/月,专业版299元/月,企业版定制 [轮次06] 辅助智能体(监控): T1 验收:含币种与周期,通过。继续 T2 [轮次07] 浏览器专家: T2 受阻:竞品B定价页需要点击"切换地区",当前会话看不到价格 [轮次08] 辅助智能体(监控与改派): 指令未含地区切换步骤,属指令缺陷。补充指令:先切换至中国大陆地区 [轮次09] 浏览器专家: T2 完成。竞品B:入门版79元/月,团队版499元/月,旗舰版定制
三个细节值得圈出来。轮次 06,主持人明确宣布验收通过及理由,而不是默默进入下一步——这让日志事后可审计。轮次 07,专家受阻时如实上报而不是编造,这是工具智能体的纪律,2.3 节会讲怎么养成。轮次 08,主持人把失败归因为指令缺陷而非专家无能,选择补充指令重派——归因习惯决定了兜底质量。
主持人最讨人喜欢的失败模式是把议题切成十几个碎片子任务,每个都开一轮对话。token 消耗翻倍,会议却更慢——因为轮次间的"表态成本"固定存在。治疗手段是给拆解定一条粒度守则:
def check_granularity(subtasks: list) -> str: """拆解粒度自检:子任务既不能大到无法验收,也不能碎到徒增轮次。 经验规则:单场会子任务数不超过5,每个子任务预估轮次不超过3。""" if len(subtasks) > 5: return f"子任务数 {len(subtasks)} 超过5,考虑合并同类项" if any(t.get("est_turns", 0) > 3 for t in subtasks): return "存在预估超过3轮的子任务,考虑再拆或降级验收标准" return "粒度合格" # 输出: # check_granularity([{"id": f"T{i}", "est_turns": 2} for i in range(1, 8)]) # -> '子任务数 7 超过5,考虑合并同类项'
主持人最常见的失守是"礼貌放行":专家回报含糊("已获取相关信息"),主持人不追问细节直接汇总。错误数据一旦进入下一轮,修正成本按轮次指数增长。治疗手段是把验收从"看语气"改成"查字段":
def strict_check(report: dict, required: set) -> tuple: """对专家回报做字段级核验。 report: 专家回报的结构化内容 required: 该子任务的验收字段集合 返回(是否通过,缺失项)""" missing = required - set(report.keys()) # 额外拦截空值与占位词 hollow = [k for k in report if report[k] in (None, "", "相关信息")] if missing or hollow: return False, {"缺字段": sorted(missing), "空值字段": hollow} return True, None # 输出: # strict_check({"价格": "已获取相关信息", "周期": "月付"}, {"价格", "周期", "币种"}) # -> (False, {'缺字段': ['币种'], '空值字段': ['价格']})
💡 关键直觉:主持人不是"更聪明的执行者",而是"更冷静的核对者"。它的价值九成来自验收纪律,一成来自调度技巧——写系统提示词时,把篇幅按这个比例分配。
背景:第 4 章完整跑会时,主持人将经历三次兜底时刻。操作与结果:第一次,浏览器专家连续两轮抓不到某竞品价格页(反爬限制),主持人判定"该专家在此议题无解",改派搜索专家从第三方比价页获取数据;第二次,代码专家算出的差价百分比没写基期,监控对表发现缺"基期"字段,退回单点重算;第三次,所有子任务完成后,主持人发现汇总纪要遗漏了"定价结构反映的功能取舍"这半个议题,主动补一轮分析再交差。解读:三次兜底分别是换人兜底、字段兜底、议题完整性兜底,正好覆盖监控环节的三个失败面。
变式:若你的任务里专家产出天然不确定(比如创意写作),字段级验收会过度僵化。此时把"验收字段"换成"验收问题清单"(这份产出回答了议题里的哪个问题?),保留追问纪律,放宽格式要求。