Agent 工作台工程:有能力的模型为何仍失败 本节摘要:一个有能力的模型,不够。可靠的 Agent 需要一个工作台(workbench)——指令、状态、范围、反馈、验证、审查、交接。把这些剥掉,即便是前沿模型产出的工作也不安全到可交付。诊断很扎心:你把一个前沿模型丢进真实仓库,让它「加输入校验」,它打开四个文件、写出看起来合理的代码、宣布成功、停下。你跑测试——两个失败;第三个被改的文件和校验毫无关系;没有任何记录说明 Agent 假设了什么、先试了什么、还剩什么没做。模型没在 Python 上犯错,它在「工作」上犯错——它不知道什么算「完成」、哪里允许写、哪些测试是权威的、下一次会话该怎么接手。这不是模型 bug,是工作台 bug。