源文件:book/chapter6.md Agent 的评估 构建 Agent 系统时,开发者面对大量设计选择,而它们往往没有显而易见的正确答案: 用什么模型? 让模型能调用哪些工具? 知识库该存什么数据、以什么结构来构建? 用户记忆该怎么做? 模型的提示词和 Skills 该如何组织? Harness 中需要加上哪些约束? 这个 Agent 的自我进化和自迭代该怎么做? 评估为我们提供了科学的决策依据:通过系统性的对比实验(改变一个变量,观察效果变化)和消融实验(逐一关闭某个组件,观察整体性能变化,从而判断该组件的真实贡献),区分真正的能力提升与表面的波动,避免“捡了芝麻,丢了西瓜”。正如软件工程中“没有度量就没有改进”的说法,不建立可重复的评估体系,Agent 的迭代方向就只能靠直觉。