课程 292 / 365
80%
正文已完成
L292用约束和证据比较两个可行方案
建立决策标准、权重、证据和不确定项,避免结论先行的方案评审。
方案对比最常见的问题是标准随结论变化是喜欢 A 时强调速度,喜欢 B 时又强调成本。先冻结决策标准和权重,再收集同口径证据,才能让评审可复查。
能用同一组标准公平比较两个候选方案,并保留尚未验证的假设。
核心概念
先把关键判断说清楚
标准先于评分
先由业务约束确定延迟、成本、可靠性、维护等标准,再观察候选方案,减少偏好驱动。
证据与假设分栏
实测数据、官方限制和团队经验的可信度不同;尚未测量的结论必须标为假设。
敏感性揭示脆弱结论
改变一个关键权重或假设后结论就反转,说明应先补证据而非立即下注。
案例拆解
自建检索与托管服务的同口径比较
产品准备选择检索方案,一方只谈托管服务速度,另一方只谈自建可控,讨论没有共同标准。
- 01
冻结标准是中文召回、p95 延迟、月成本、数据边界、两人团队维护负担。
- 02
对同一数据集和 30 个查询测召回与延迟,成本按同一流量估算。
- 03
把未来数据增长标为假设,并分别按 3 倍和 10 倍做敏感性比较。
案例结果
团队看见当前托管更合适,但也记录了流量达到何种阈值后重新评估自建。
提交前练习
现在轮到你
用同一组约束比较两个候选方案,并写出重评条件。
内容会自动保存在当前设备
查看参考答案与评分标准
参考答案
A 本地推理、B 云 API;标准是隐私40%、质量25%、延迟20%、维护15%;用同一 50 条样本测质量和 p95;本地并发能力仍未知;当日请求超过 5 万或数据不得出域时重评。
评分标准
- 标准在对比前可说明来源
- 证据口径一致
- 不确定项与重评条件明确
本课收口 · 学习证据
完成,不等于随手打一个勾。
确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。
资料来源
继续核对与延伸阅读
本课内容最近更新于 。
- NIST AI Risk Management Framework↗standard · 核对日期 2026-08-23
- Evals↗official-docs · 核对日期 2026-08-23