第 6 章 · 实验教程:Agent 的评估


文档摘要

第 6 章 · 实验教程:Agent 的评估 本章对应正文:第 6 章 · Agent 的评估 核心命题:把"表现"变成"可比较的信号"——评估环境、指标、统计显著性,用评估驱动选型而非凭感觉。 "我的 Agent 到底好不好?"是工程中最常被回避的问题。这一章给出系统化的答案:先搭一个能让 Agent 真实执行任务的环境(终端、OS、Android、Web),再设计可校验的指标与统计显著性检验,把主观印象变成可比较、可复现的数字。评估既是选型的依据,也是优化的反馈信号。

第 6 章 · 实验教程:Agent 的评估

本章对应正文:第 6 章 · Agent 的评估

核心命题:把"表现"变成"可比较的信号"——评估环境、指标、统计显著性,用评估驱动选型而非凭感觉。

"我的 Agent 到底好不好?"是工程中最常被回避的问题。这一章给出系统化的答案:先搭一个能让 Agent 真实执行任务的环境(终端、OS、Android、Web),再设计可校验的指标与统计显著性检验,把主观印象变成可比较、可复现的数字。评估既是选型的依据,也是优化的反馈信号。

本章 6 个实验分两类:一类是介绍主流外部评测基准的复现指南(SWE-bench、GAIA、OSWorld、AndroidWorld 等,需自行 clone),另一类是本仓库自带的、配好即可运行的评估工具(Elo 排行榜、模型基准压测、成本分析、TTS 质量评估、公共卫生上报评测)。建议先跑自带的评估工具建立"评估长什么样"的直觉,再按需深入外部基准。

实验列表

实验 类型 难度 说明
elo-leaderboard ★★ 从零实现 Elo 评分系统,基于 Chatbot Arena 投票数据用 Bradley-Terry 模型构建模型排行榜
model-benchmark ★★ 对多家 OpenAI 兼容 API 横向压测 TTFT、p50/p95/p99 延迟、吞吐与成功率,一条命令出对比表
agent-cost-analysis 多轮 Agent 任务(客服退款)全链路成本拆解 + KV-cache 友好设计/上下文压缩的 A/B 节省量化
tts-quality-eval ★★ 多种 TTS 配置合成挑战文本,LLM-as-a-Judge 按 Rubric 逐维度打分,输出可复现对比表
public-health-reporting-eval ★★ 基于合成 DHIS2 风格汇总数据,评估公共卫生上报 Agent 的工具调用、计算准确性、证据引用与无依据声明
android-world 📖 ★★ T3A Agent 在 AndroidWorld 基准上一次完整运行的评估报告与失败案例分析(阅读材料,非基准代码)

类型与难度说明

标记 含义
可独立运行:自带完整代码,配好 API Key 即可跑
📖 复现指南:依赖需自行 git clone 的外部仓库
🚧 设计文档:仅含架构方案,可运行代码仍在完善
★ ~ ★★★ 从易到难,★ 为入门级、★★★ 为进阶挑战

阅读建议

  • 入门读者:从 agent-cost-analysis(难度 ★,支持离线模式)和 model-benchmark 开始,最快建立"用数字衡量 Agent/模型"的直觉。
  • 关注评估方法论:elo-leaderboard 演示如何从两两对比提取相对能力,tts-quality-eval 展示 LLM-as-a-Judge 的 Rubric 打分,public-health-reporting-eval 给出带证据落地与无依据惩罚的完整评测范式。
  • 关注真实基准:android-world 是一份真实的 AndroidWorld 评估案例分析,可作为阅读材料理解真实评估运行的轨迹与失败根因;其余外部基准(SWE-bench、GAIA、OSWorld 等)的克隆命令见章节索引附录。

← 返回总目录 · 📖 读本章正文 · 📑 本章索引


发布者: 作者: bojieli 转发
评论区 (0)
U