第 5 课|从原型走到真实上线
把一次好看的 Demo,变成可试点、可监控、可降级、可持续迭代的产品。
快速回顾
到这里,你已经有问题、体验与评估标准。上线阶段要保证这些判断真的进入系统:谁能用、数据如何流动、失败如何被发现、什么情况下暂停或回滚。
Demo 到产品,差的是运行闭环
| Demo 常忽略 | 产品必须回答 |
|---|---|
| 只展示理想输入 | 空输入、长输入、敏感数据、越权请求怎么办? |
| 结果由团队现场挑选 | 真实流量下质量分布、长尾错误如何监控? |
| 不计调用代价 | 单任务成本、峰值时延、配额与缓存策略是什么? |
| 失败后刷新页面 | 用户如何恢复,系统如何降级,团队如何回滚? |
PRD 的变化:除了用户故事,还要写能力边界、数据权限、评估集、上线门槛、日志字段、人工兜底、降级体验和模型变更策略。
把试点步骤排成正确顺序
使用上下按钮调整顺序,再与下方原则核对。
1用历史数据做离线评估,先找明显失败
2影子模式:系统运行但不影响用户,只比较结果
3少量自愿试点用户,结果必须人工确认
4达到门槛后逐步扩大流量,持续监控回归
基本原则是:先离线、再无影响地观察、再小范围有控制地使用、最后逐步放量。每一步都要有进入条件、退出条件和负责人。
一次上线决策
试点报告
总结助手总体采纳率 72%,但涉及数字的回答有 3% 严重错误;当前界面不显示来源,也没有一键回退。
等待选择高采纳率能否抵消严重错误?还缺哪些产品控制?
上线清单:能力、运行、治理
能力门槛评估集通过;已知失败有清晰边界。
运行门槛时延、成本、限流、超时、降级可用。
安全门槛权限、隐私、内容安全、审计日志到位。
组织门槛告警负责人、人工兜底、暂停与回滚清晰。
产品经理的职责不是亲自实现所有基础设施,而是确保上线决策有证据、有负责人、有止损线。上线后的线上失败必须回流评估集,形成“监控 → 归因 → 修复 → 回归”的循环。
模型变更也要当作产品变更
更换模型、系统提示、检索索引或工具权限,都可能改变行为。记录版本,在代表性评估集上对比,再逐步发布;不要把供应商升级当作无感基础设施更新。
快速测验
1. 影子模式的主要作用是?
正确。它连接离线测试与真实流量,又不直接改变用户结果。
影子模式会运行系统,但不把结果作用于真实用户。
2. 哪项应该成为上线前的明确产出?
正确。上线是一组可控制的决策,不是一个日期。
真实系统必须知道何时停止和如何恢复。
3. 模型或 Prompt 变更后应该?
正确。任何影响行为的改动都需要可比较、可回滚。
概率系统的小改动也可能造成不可预期回归。
思考练习:写一张试点卡
为你的产品规划两周试点
写出试点用户、核心任务、流量范围、人工兜底、每日监控、进入门槛和暂停条件。
试点不是把功能发给 10% 用户就结束。先说明为什么选择这批人、他们如何反馈、谁每天看失败、什么错误出现一次就暂停。
延伸阅读
AI Risk Management Framework
将可信与风险管理纳入 AI 系统的设计、开发、使用和评估。
Safety best practices
覆盖红队、人工审查、输入输出约束与安全标识等实践。