题干与适用场景
你负责一款面向企业客户的 AI 助手。它有时应直接回答,有时应先澄清,有时应拒答或转人工。请定义分流策略、目标用户和成功指标,说明如何处理错误回答、过度拒答、隐私风险与人工容量约束,并设计上线验证。
近期公开的 Copilot 产品经理面试资料把 AI 深度、产品判断和评估框架放在同一轮考察;OpenAI 的 Model Spec 也把“何时表达不确定性”与用户行为影响、错误代价和信息不足联系起来。因此这道题的核心不是挑一个模型,而是把不确定性转成用户可理解、团队可运营的产品决策。
面试官考察点
- 能否先界定用户任务、风险等级和可接受错误,而不是直接讨论模型参数。
- 能否把回答、澄清、拒答、人工升级设计成互斥且可观测的状态。
- 能否区分模型内部信号、答案质量和用户是否应当采取行动。
- 能否同时衡量帮助率、错误伤害、过度拒答、转人工成本和等待时间。
- 能否用分层发布、离线评估和真实反馈验证策略,而不是只看平均满意度。
回答前需要澄清的问题
- 主要用户是谁?默认是企业员工,助手可访问组织知识,但不能替用户做高风险决策。
- 哪些任务允许自动完成?默认允许低风险的信息检索和草稿生成,高风险动作需要确认或人工复核。
- 人工团队容量是多少?默认有明确班次和响应目标,不能把所有不确定请求都转人工。
- 公司更怕哪类错误?应让面试官在“错误回答”和“过度拒答”之间给出优先级;若未给出,按风险等级分层。
- 是否保存对话用于改进?需要先说明脱敏、权限、保留期限和退出机制。
30 秒回答框架
我会先按任务风险和信息充分度建立四路分流:低风险且证据充分时回答;缺少关键上下文时澄清;高风险、越权或无法可靠验证时拒答并给出安全下一步;需要专业判断或复杂纠纷时转人工。策略不能把模型自报的概率当真值,而要用经过标注的风险分层和校准评估。核心指标包括正确帮助率、严重错误率、澄清后解决率、过度拒答率、人工转接率与响应时间,再按用户和任务切片做灰度实验。
分步骤深入解答
第一步:定义任务和风险矩阵
先把任务按影响分为低、中、高风险,再标出是否需要组织权限、最新事实或不可逆动作。低风险检索可以容忍较小的表达瑕疵;付款、合规、医疗或权限变更则必须有更高证据门槛。风险矩阵决定分流,而不是产品经理主观觉得“模型很聪明”。
第二步:设计四种结果契约
answer 需要给出依据范围、时效和可编辑结果;clarify 只询问会改变答案的最少问题;refuse 说明不能做什么,并提供安全替代;escalate 交代转接原因、已收集的信息和人工响应目标。四种结果都要带可追踪的原因码,便于评估和申诉。
第三步:建立证据和不确定性信号
证据可以来自权限内的检索结果、结构化业务状态或人工确认。不要把模型输出的置信度直接展示成“正确率百分比”;先用带标签的数据评估校准、覆盖率和不同风险层的错误代价。没有足够证据时,澄清或升级是产品行为,不是模型失败的隐藏方式。
第四步:处理澄清成本
每个澄清问题都应能缩小关键不确定性。可先问对象、时间范围或权限范围,再重新检索;不要连续追问无关细节。设置问题上限,超过上限就给出可选路径或转人工。指标同时观察澄清轮数、澄清后解决率和用户放弃率。
第五步:设计拒答和人工升级
拒答要分清不安全、越权、信息不足和服务故障,原因不同,下一步也不同。人工升级需要携带最小必要上下文,并让用户知道预计等待时间;当人工队列拥塞时,优先处理高影响事件,低风险请求可返回可编辑草稿或帮助中心入口。
第六步:建立评估集和指标树
离线集应覆盖正常请求、模糊请求、对抗请求、权限边界和高风险长尾。指标树的顶层是“有用且不造成不可接受伤害”,下层拆成正确帮助率、严重错误率、过度拒答率、澄清后解决率、转人工成功率、人工处理时长和成本。所有指标按任务、用户、语言和权限切片。
第七步:安排灰度、回滚和申诉
先在低风险任务和内部用户中灰度,预先写好严重错误阈值、过度拒答阈值和人工容量阈值。触发阈值就停放量或回滚策略版本。用户可以标记“错误”“没解决”“不该拒答”,高影响案例进入人工复核并回写评估集。
第八步:处理隐私与持续改进
记录策略版本、原因码和脱敏后的必要证据,限制谁能查看原始对话。训练或评估数据应有保留期限、删除流程和访问审计。每次策略调整都要在固定回归集上比较帮助、伤害、拒答和人工成本,避免只优化一个局部指标。
高质量示范回答
我会把产品定义成风险分层的决策系统。低风险且有权限证据时直接回答;缺少会改变答案的关键上下文时只问最少澄清问题;高风险、越权或无法验证时拒答并给出安全下一步;需要专业判断或队列处理时转人工并传递最小必要上下文。内部概率只能作为一个信号,不能直接向用户承诺正确率。我会建立包含正常、模糊、对抗和高风险请求的评估集,按任务和用户切片观察正确帮助率、严重错误率、过度拒答率、澄清后解决率、转人工等待和成本。先做低风险灰度,设置停放量阈值、回滚版本和用户申诉入口,所有策略与证据都按权限和保留期限记录。
常见错误
- 一上来比较模型大小,却没有定义用户任务和错误代价。
- 把模型自报置信度直接展示成正确率承诺。
- 用一次澄清解决所有问题,导致追问过长、用户流失。
- 把所有不确定请求都转人工,忽略人工容量和优先级。
- 只测平均满意度,不测严重错误、过度拒答和不同用户切片。
- 拒答没有原因和下一步,用户既无法完成任务也无法申诉。
- 为了训练方便无限期保存原始对话,忽视权限、脱敏和删除。
追问及应对
如果业务方要求把转人工率降到最低,你如何回应?
先确认目标是降低无价值转接,还是压低所有转接。可以在低风险、证据充分的任务上扩大自动回答,在高风险任务上保留升级底线;用严重错误率和人工后续补救成本证明单看转接率会制造隐性损失。
用户说“我不需要解释,直接替我执行”,怎么办?
把不可逆动作与可编辑建议分开。低风险动作可以先展示摘要和确认点;付款、权限变更或外部发送需要明确确认和可追踪授权。用户偏好不能绕过权限、风险和审计边界。
如何判断澄清问题真的有价值?
在离线数据上比较提问前后答案质量和解决率,并记录每个问题带来的信息增益、额外轮数和放弃率。若问题不改变分流或答案,就删除;若高价值但难回答,提供选项而非开放式长问句。
模型升级后正确率上升但投诉也上升,如何排查?
先按任务风险、用户群、语言、权限和策略版本切片,区分错误回答、语气变化、过度拒答和转人工延迟。冻结扩量,回放高影响样本,比较旧新版本的评估集与真实反馈,再决定回滚、局部放量或调整分流门槛。