1. 题目与使用场景
团队准备上线一个会总结客服对话的 AI 功能。摘要可能有多种合理写法,人工标注昂贵,单一自动评分又无法代表客户是否真的解决了问题。请设计一套评估方法,回答“是否值得上线、对谁上线以及失败时如何收敛”。
2. 面试官考察点
- 是否先定义用户任务和不可接受的失败,而不是先报一个模型分数。
- 是否能组合离线测试、人工评审、线上行为和安全监控。
- 是否区分领先指标、滞后结果与护栏指标,并说明互相冲突时如何决策。
- 是否把评估集、风险容忍度、人工升级和回滚写成产品机制。
3. 回答前需要澄清的问题
- AI 输出服务的是草稿、建议,还是会自动触发不可逆操作?
- “成功”是节省处理时间、提高一次解决率,还是降低错误投诉?
- 哪些错误会造成隐私、合规或客户伤害,必须零容忍或人工拦截?
- 目标用户、语言、行业和数据分布是否与评估样本一致?
4. 30 秒回答框架
我会先定义任务和风险,再建立代表性评估集。评估分四层:任务结果、输出质量、信任与安全、成本与延迟。没有单一标签时,用领域专家的成对偏好或通过/不通过规则校准自动指标,并把线上实验、用户反馈和人工升级纳入持续监控。上线采用分层门槛:硬护栏不达标就停止,质量与业务收益达到目标才扩大流量。
5. 分步深入解答
第一步:把“好答案”改写成可观察任务
先写清输入、用户动作和期望结果。例如摘要功能的任务不是“文字像不像参考答案”,而是客服能否在有限时间内找到客户诉求、正确承诺下一步,并避免泄露敏感信息。为每项结果定义可接受范围和明确的失败样例。
第二步:建立多层评估集
抽取覆盖语言、客户类型、长短对话和边缘案例的样本。用领域专家制定 rubric,允许多个合理答案,并对关键事实、遗漏、语气和隐私分别评分。保留一份冻结的回归集,另设近期样本检测分布变化;标注不足时记录“不确定”而不是强行制造标签。
第三步:组合指标与护栏
核心指标可以是任务完成率、一次解决率或人工编辑后采纳率;质量层测事实正确、覆盖要点和引用完整;护栏层监控有害内容、隐私泄露、偏差、升级率和投诉。成本、延迟和人工审核工时决定可持续性。每个指标都要写清分母、采样窗口和失效条件。
第四步:把评估连接到发布决策
先离线回归,再让小规模、可回滚的用户看到功能。硬护栏触发立即停用;质量或业务指标不足则回到提示、检索、模型或界面层定位原因。线上数据与人工反馈定期更新评估集,监控评估指标本身是否仍能代表真实风险。对高风险动作保留人工确认和关闭开关。
6. 高品质示范回答
我不会把一个自动分数当成答案。先定义用户要完成的任务、允许的错误和不可逆风险,再建立覆盖真实分布的冻结评估集。专家用 rubric 评估事实、覆盖、语气和隐私,并用成对比较处理多个合理答案。
>
上线前同时看任务结果、输出质量、信任安全、成本和延迟。任务完成率是主要指标;隐私泄露、有害内容和关键事实错误是硬护栏。先做离线回归和小流量实验,给高风险动作加人工确认。结果不达标时按错误类型定位到数据、检索、模型或界面,更新评估集后再决定扩大、回滚或停止。
7. 常见错误
- 只报准确率或平均评分,却没有定义用户任务和失败后果。
- 用一套方便的样本代表所有语言、客户和边缘场景。
- 把用户点击上升当成成功,忽略错误答案带来的投诉或人工返工。
- 只在发布前评估,不监控线上分布、反馈和评估集老化。
- 将“模型不确定”直接自动执行,缺少人工升级、回滚和停用机制。
8. 追问及应对
追问一:人工标注预算只有原来的十分之一怎么办?
先按风险分层,把预算给高影响场景和最容易误判的样本;低风险样本可用抽样审核、成对比较和用户反馈补充。保留不确定标签,并监控抽样误差,不能用更少标注假装获得同等确定性。
追问二:线上任务完成率上升,但隐私风险也上升呢?
隐私护栏优先于收益指标。暂停扩大流量,隔离受影响的输入和输出,修复脱敏、检索权限或提示策略;只有硬护栏恢复并完成回归后才重新上线。
追问三:如何证明评估指标没有过时?
定期把线上失败、人工升级和用户申诉回灌到评估集,按语言、用户群和版本切片比较。让领域专家复核 rubric,并记录指标与真实结果的偏离;偏离扩大时调整指标或暂停使用旧门槛。