章节摘要:"这个模型好不好"是大模型工程里被问得最多、也最难回答的问题。本章建立一套完整的评估方法论:先理解评估为什么难、需要哪些维度(8.1);再配备具体弹药——生成与理解类指标、主流基准数据集及其陷阱(8.2);最后把评估跑成体系——评测框架、人工评估与 LLM 裁判、错误分析方法,形成"评估—改进"闭环(8.3)。评估不是发奖状,是指南针。
阅读完本章,你应当能够:
本章一句话:评估的正确姿势是"多维指标 + 自动基准 + 自建场景集 + 人工抽检"的组合拳,而所有评估的最终问题是——它在你的任务上表现如何。
评估的三重难点(通用性、开放性、主观性)、六维质量指标(准确、流畅、有用、安全、忠实、效率)、自动与人工评估的分工、LLM-as-Judge 的能力与偏差。
BLEU/ROUGE 的字面重合原理与语义盲区、Accuracy/F1 的适用前提、主流基准地图(知识/代码/数学/推理/真实性/对话)、数据污染与刷榜的识别方法。
评测框架的标准化价值、人工评估三法(排序、量表、盲测)、自建评测集的方法、错误归类的改进映射,以及评估—改进闭环的运转节奏。
8.1 回答"评什么"(维度框架),8.2 回答"用什么评"(工具弹药),8.3 回答"怎么评、评完怎么办"(流程与闭环)。顺序不可倒:没有维度框架就选指标会瞎选,没有指标与数据集就跑流程是空转。
┌──────────────┐ 选定维度 ┌──────────────┐ 选定工具 ┌──────────────┐ │ 8.1 评什么 │ ─────────▶ │ 8.2 用什么评 │ ─────────▶ │ 8.3 怎么评 │ │ 六维指标体系 │ │ 指标与基准 │ │ 框架与闭环 │ └──────────────┘ └──────────────┘ └──────┬───────┘ 错误分析 ▼ 改进(数据/微调/提示/RAG) │ └──▶ 再评估(循环)
评估章节的价值以"可带走的资产"衡量,本章沉淀了三份,按获取成本排序:
资产一:一份评估方案模板(8.1 节末尾)。填空即用的评估设计框架,从场景定义到责任节奏,一页纸防止"凭感觉决策"。获取成本半小时,是三份中最便宜的。
资产二:一张基准地图与读榜清单(8.2 节)。主流基准各考什么科、消费榜单新闻的五查口径。它决定你从公开信息里能提取多少真实信号——在模型选型季,这份清单每周都会用到。
资产三:一套自建评测集(8.3 节四步法)。两百条真实问题加可执行判分标准,是三份中成本最高、价值也最高的——选型、验收、回归三处复用,且随业务滚动增值。建议本周就启动第一步(选题),一个季度后它将成为团队最可靠的质量基础设施。
三份资产的共同特点:都不依赖更多算力或更强模型,只依赖纪律。评估这件事的门槛从来不在技术,在于开始做并坚持做。如果本章只能记住一句话,记住这句。
最后再强调一次评估与监控的关系:评估集是"发版前的闸门",监控是"上线后的雷达",两者共用同一套维度定义(延迟、忠实、安全、有用),但方法不同——前者跑固定题目集,后者看真实流量分布。不少团队只建其一,结果要么上线后才发现质量漂移(只有闸门),要么天天救火却无法定位是哪次变更引入(只有雷达)。两件套齐备,质量保障才成闭环。
如果本章只落实一件事,落实这件:本周内启动自建评测集——收集三十条真实业务问题(本周先到三十条,滚动到两百条),为每条写一句判分标准,选两个候选模型跑一遍对比。整个过程两天内可完成,产出的那张对比表,将是你第一份真正属于自己的模型评估报告。万事开头难,评估这件事开头尤其容易——三十条问题而已。
评估章的立场全教程最强硬:没有评估的迭代是赌博,没有基线的提升是错觉,没有归类的错误是浪费。把这套纪律带进第 9 章的应用现场,你会发现每个落地方法论的第一步都是"先建评测"——这不是巧合,是工程成熟度的共同底座。评估做得好的团队,运气都会好一些,因为他们的"好运"都有据可查。