评估驱动的 Agent 开发


文档摘要

评估驱动的 Agent 开发 本节摘要:Anthropic 的指引一针见血:「从简单提示开始,用全面评估来优化它们,只在需要时才加多步智能体系统。」评估不是最后一步——它是驱动第 15 章(Agent 工程)其他所有选择的外层循环。Agent 能过 demo,却以 demo 预测不到的方式在生产失败;基准回答的是「这个模型整体有多强」,而非「我的产品里这个 Agent 在交付对的补丁吗」。答案是三层评估,持续运行,且每条护栏、每条学到的规则都映射到一个评估用例。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U