第 6 章 · 实验教程:Agent 的评估 本章对应正文:第 6 章 · Agent 的评估 核心命题:把"表现"变成"可比较的信号"——评估环境、指标、统计显著性,用评估驱动选型而非凭感觉。 "我的 Agent 到底好不好?"是工程中最常被回避的问题。这一章给出系统化的答案:先搭一个能让 Agent 真实执行任务的环境(终端、OS、Android、Web),再设计可校验的指标与统计显著性检验,把主观印象变成可比较、可复现的数字。评估既是选型的依据,也是优化的反馈信号。
本章对应正文:第 6 章 · Agent 的评估
核心命题:把"表现"变成"可比较的信号"——评估环境、指标、统计显著性,用评估驱动选型而非凭感觉。
"我的 Agent 到底好不好?"是工程中最常被回避的问题。这一章给出系统化的答案:先搭一个能让 Agent 真实执行任务的环境(终端、OS、Android、Web),再设计可校验的指标与统计显著性检验,把主观印象变成可比较、可复现的数字。评估既是选型的依据,也是优化的反馈信号。
本章 6 个实验分两类:一类是介绍主流外部评测基准的复现指南(SWE-bench、GAIA、OSWorld、AndroidWorld 等,需自行 clone),另一类是本仓库自带的、配好即可运行的评估工具(Elo 排行榜、模型基准压测、成本分析、TTS 质量评估、公共卫生上报评测)。建议先跑自带的评估工具建立"评估长什么样"的直觉,再按需深入外部基准。
| 实验 | 类型 | 难度 | 说明 |
|---|---|---|---|
| elo-leaderboard | ✅ | ★★ | 从零实现 Elo 评分系统,基于 Chatbot Arena 投票数据用 Bradley-Terry 模型构建模型排行榜 |
| model-benchmark | ✅ | ★★ | 对多家 OpenAI 兼容 API 横向压测 TTFT、p50/p95/p99 延迟、吞吐与成功率,一条命令出对比表 |
| agent-cost-analysis | ✅ | ★ | 多轮 Agent 任务(客服退款)全链路成本拆解 + KV-cache 友好设计/上下文压缩的 A/B 节省量化 |
| tts-quality-eval | ✅ | ★★ | 多种 TTS 配置合成挑战文本,LLM-as-a-Judge 按 Rubric 逐维度打分,输出可复现对比表 |
| public-health-reporting-eval | ✅ | ★★ | 基于合成 DHIS2 风格汇总数据,评估公共卫生上报 Agent 的工具调用、计算准确性、证据引用与无依据声明 |
| android-world | 📖 | ★★ | T3A Agent 在 AndroidWorld 基准上一次完整运行的评估报告与失败案例分析(阅读材料,非基准代码) |
| 标记 | 含义 |
|---|---|
| ✅ | 可独立运行:自带完整代码,配好 API Key 即可跑 |
| 📖 | 复现指南:依赖需自行 git clone 的外部仓库 |
| 🚧 | 设计文档:仅含架构方案,可运行代码仍在完善 |
| ★ ~ ★★★ | 从易到难,★ 为入门级、★★★ 为进阶挑战 |
← 返回总目录 · 📖 读本章正文 · 📑 本章索引