第 4 课|把“感觉不错”变成评估体系
用代表性样本、清晰评分规则和产品指标,建立团队共同的质量语言。
快速回顾
问题定义告诉我们为什么做,体验设计告诉用户如何与系统协作。评估体系要回答另一件事:这次改动是否真的更好,而且好到可以让真实用户承担后果?
评估不是最后一次考试,而是开发方向盘
模型输出具有概率性。同一功能在常见样本上很好,遇到长文本、歧义、方言或越权请求就可能失败。产品经理要在开发早期建立一套小而有代表性的评估集,每次更换模型、Prompt、检索策略或工具时都重复运行。
定义任务输入是什么,期望输出服务哪个决策?
收集样本覆盖常见、边界、失败与高风险案例。
写评分规则什么算好、差在哪里、谁来判断?
持续回归每次改动都比较质量、成本与时延。
四层指标,不能只看“准确率”
任务质量
90%
可用体验
76%
业务结果
62%
风险门槛
硬门槛
| 层级 | 典型问题 | 示例指标 |
|---|---|---|
| 任务质量 | 输出本身对不对? | 召回率、事实一致性、评分量表 |
| 体验 | 用户能否高效核验和使用? | 编辑率、采纳率、完成时长、失败恢复率 |
| 业务 | 是否改变目标结果? | 成本、转化、响应时间、留存 |
| 风险 | 不可接受错误是否被挡住? | 隐私泄露率、越权率、严重幻觉率 |
为客服回复助手选上线门槛
场景
助手生成客服回复草稿,客服提交前必须确认。下列哪组指标最适合作为首轮试点门槛?
等待选择想想质量、体验、业务和风险是否都被覆盖。
怎样构造第一版评估集
不要从网上随便找 100 条漂亮样本。先从真实工作流收集 30–50 条,按场景、输入难度、用户类型和失败风险分层;为每条写清参考输出或评分维度;再把线上失败持续加入回归集。评估集不是静态题库,而是产品经验的累积。
一个实用配比
60% 常见主流程 + 20% 边界情况 + 10% 已知历史失败 + 10% 高风险对抗样本。比例可变,但高风险样本即使低频,也必须单独设门槛。
自动评分也要被评估:LLM-as-judge 很方便,但评分标准、顺序偏差与领域知识都可能影响结果。抽样人工复核,并定期检查自动评分与专家判断的一致性。
快速测验
1. 评估集最重要的特征是?
正确。代表性比盲目追求数量更重要。
评估的目标是预测真实产品表现。
2. 哪个指标最能反映用户实际采用输出?
正确。它连接了模型输出与用户真实行为。
想想用户拿到输出后实际做了什么。
3. 严重隐私泄露率应该怎样处理?
正确。严重风险不能被其他好指标抵消。
某些风险必须零容忍或单独设上限。
思考练习:写一张评估卡
为你的 AI 功能定义四层指标
各写一个:任务质量指标、体验指标、业务结果指标、风险硬门槛。每项都写明样本、测量方法和通过阈值。
避免“准确率高”“用户满意”这类模糊词。写成:在 50 条分层样本上,关键字段召回率 ≥ 95%;试点用户中位编辑时长 ≤ 2 分钟。
延伸阅读
Evaluation best practices
从目标、数据集、指标和持续评估建立可靠的评估流程。
Working with evals
了解任务定义、测试输入、结果分析和迭代的基本流程。