AI PM 实战课
6 课 · 约 3 小时
第 4 / 6 课评估与指标

第 4 课|把“感觉不错”变成评估体系

用代表性样本、清晰评分规则和产品指标,建立团队共同的质量语言。

0

快速回顾

问题定义告诉我们为什么做,体验设计告诉用户如何与系统协作。评估体系要回答另一件事:这次改动是否真的更好,而且好到可以让真实用户承担后果?

1

评估不是最后一次考试,而是开发方向盘

模型输出具有概率性。同一功能在常见样本上很好,遇到长文本、歧义、方言或越权请求就可能失败。产品经理要在开发早期建立一套小而有代表性的评估集,每次更换模型、Prompt、检索策略或工具时都重复运行。

定义任务输入是什么,期望输出服务哪个决策?
收集样本覆盖常见、边界、失败与高风险案例。
写评分规则什么算好、差在哪里、谁来判断?
持续回归每次改动都比较质量、成本与时延。
2

四层指标,不能只看“准确率”

任务质量
90%
可用体验
76%
业务结果
62%
风险门槛
硬门槛
层级典型问题示例指标
任务质量输出本身对不对?召回率、事实一致性、评分量表
体验用户能否高效核验和使用?编辑率、采纳率、完成时长、失败恢复率
业务是否改变目标结果?成本、转化、响应时间、留存
风险不可接受错误是否被挡住?隐私泄露率、越权率、严重幻觉率
3

为客服回复助手选上线门槛

场景

助手生成客服回复草稿,客服提交前必须确认。下列哪组指标最适合作为首轮试点门槛?

4

怎样构造第一版评估集

不要从网上随便找 100 条漂亮样本。先从真实工作流收集 30–50 条,按场景、输入难度、用户类型和失败风险分层;为每条写清参考输出或评分维度;再把线上失败持续加入回归集。评估集不是静态题库,而是产品经验的累积。

一个实用配比

60% 常见主流程 + 20% 边界情况 + 10% 已知历史失败 + 10% 高风险对抗样本。比例可变,但高风险样本即使低频,也必须单独设门槛。

自动评分也要被评估:LLM-as-judge 很方便,但评分标准、顺序偏差与领域知识都可能影响结果。抽样人工复核,并定期检查自动评分与专家判断的一致性。
5

快速测验

1. 评估集最重要的特征是?

正确。代表性比盲目追求数量更重要。

评估的目标是预测真实产品表现。

2. 哪个指标最能反映用户实际采用输出?

正确。它连接了模型输出与用户真实行为。

想想用户拿到输出后实际做了什么。

3. 严重隐私泄露率应该怎样处理?

正确。严重风险不能被其他好指标抵消。

某些风险必须零容忍或单独设上限。

6

思考练习:写一张评估卡

为你的 AI 功能定义四层指标

各写一个:任务质量指标、体验指标、业务结果指标、风险硬门槛。每项都写明样本、测量方法和通过阈值。

避免“准确率高”“用户满意”这类模糊词。写成:在 50 条分层样本上,关键字段召回率 ≥ 95%;试点用户中位编辑时长 ≤ 2 分钟。

延伸阅读

Evaluation best practices
OpenAI · 官方指南
从目标、数据集、指标和持续评估建立可靠的评估流程。
Working with evals
OpenAI · 官方文档
了解任务定义、测试输入、结果分析和迭代的基本流程。