固定评估集最可靠的用途,是回答“这次改动是否破坏了已知能力”。它不能证明系统已经足够好,也不能覆盖真实流量中的全部任务。把评估集当作防回归门禁,才能正确理解它的价值和边界。
手动运行几个例子的问题不仅是样本少,还在于每次挑选的例子、观察标准和随机输出都可能不同。没有固定任务与评分规则,就无法区分真实改进和一次偶然的好结果。
Agent 评估是测量,不是单元测试
单元测试对确定性输入给出明确断言;Agent 输出可能存在多种正确形式,模型与评审者也可能波动。因此评估结果更接近带噪声的测量:
- 同一任务需要重复运行或控制随机性;
- 能用确定性规则判断的部分不交给模型评分;
- 主观质量使用成对比较比绝对打分更稳定;
- 一次分数变化需要结合样本量与失败分布解释。
这并不意味着评估没有工程价值。只要样本、运行环境和评分方式保持一致,评估就能比较两个版本在相同条件下的相对变化。
“好”必须先被定义
评估工具不会自动告诉团队什么是好系统。标准需要先由产品和工程共同确定,再转换为可测量信号:
| 定义方式 | 示例 |
|---|---|
| 业务结果 | 任务完成率、人工接管率、用户重试率 |
| 与人工基线比较 | 同一任务的质量、时间和成本 |
| 与现状比较 | 使用 Agent 是否比原流程带来净收益 |
实践中可以先定义失败:改错文件、测试未通过却声明完成、超过轮次仍无进展、用户必须重复说明。失败清单更容易形成检测规则,也自然成为评估集的骨架。
标准由人选择不等于测量过程必须主观。及格线是人为设定的,但是否达到可以客观计算。对于文案质量等无法完全结构化的部分,可以使用独立评审、成对偏好和低频人工校准提高可复现性。
离线、线上和人工校准承担不同职责
完整评估体系至少包含三层:
- 离线固定集:发布前快速发现已知能力回归;
- 线上真实任务:发现分布变化、长尾问题和业务影响;
- 人工校准:检查自动评分是否仍与真实质量一致。
Harness 已经掌握工具结果、退出码、轮次、耗时和终局验证,这些数据可以直接形成大量评估信号。真实失败还应在脱敏后进入回归集,让评估内容随线上问题演化,而不是长期停留在最初几个示例。
我的选择:相对门禁加绝对校准
日常改动使用固定集做配对比较:同一批任务分别运行旧版本和新版本,观察成功率、成本与失败类型。只有确认没有已知回归,才进入线上小流量验证;绝对质量则定期用业务指标和人工样本校准。
这套方案不能证明“系统已经足够好”,也会产生维护数据集和评分器的成本。但它能够把“感觉这版更好”转换为可复查证据。若任务量太小或业务标准尚未确定,应先定义失败和收集真实样本,而不是先建设复杂评估平台。