題幹與適用場景
你負責一款面向企業客戶的 AI 助手。它有時應直接回答,有時先釐清,有時拒答或轉人工。請定義分流策略、目標使用者與成功指標,說明如何處理錯誤回答、過度拒答、隱私風險與人工容量,並設計上線驗證。
近期公開的 Copilot 產品經理面試資料把 AI 深度、產品判斷與評估框架放在同一輪考察;OpenAI 的 Model Spec 也把「何時表達不確定性」與使用者行為影響、錯誤代價和資訊不足連結。因此題目核心不是挑一個模型,而是把不確定性轉成使用者能理解、團隊能營運的產品決策。
面試官考察重點
- 先界定使用者任務、風險等級與可接受錯誤,而非直接討論模型參數。
- 把回答、釐清、拒答、人工升級設計成互斥且可觀測的狀態。
- 區分模型內部訊號、答案品質與使用者是否應採取行動。
- 同時衡量有用率、錯誤傷害、過度拒答、轉人工成本與等待時間。
- 用分層發布、離線評估與真實回饋驗證策略,而非只看平均滿意度。
回答前需要釐清的問題
- 主要使用者是誰?預設為企業員工,助手可存取組織知識,但不能代替使用者做高風險決策。
- 哪些任務允許自動完成?低風險檢索和草稿可自動,高風險動作需確認或人工複核。
- 人工團隊容量多少?應有班次和回應目標,不能把所有不確定請求轉人工。
- 公司更怕哪類錯誤?若未指定,按風險等級分層處理錯誤回答與過度拒答。
- 是否保存對話改進?先說明去識別、權限、保存期限與退出機制。
30 秒回答框架
我會依任務風險與資訊充分度建立四路分流:低風險且證據充分時回答;缺少關鍵上下文時釐清;高風險、越權或無法可靠驗證時拒答並提供安全下一步;需要專業判斷或複雜爭議時轉人工。策略不能把模型自報機率當真值,而要用標註資料評估校準與風險。核心指標包括正確有用率、嚴重錯誤率、釐清後解決率、過度拒答率、轉人工率與回應時間,再按使用者和任務切片灰度。
分步驟深入解答
第一步:定義任務與風險矩陣
先把任務按影響分成低、中、高風險,再標出是否需要組織權限、最新事實或不可逆動作。低風險檢索可容忍小幅表達瑕疵;付款、合規、醫療或權限變更則需要更高證據門檻。風險矩陣決定分流,不由主觀的「模型很聰明」決定。
第二步:設計四種結果契約
answer 要給出證據範圍、時效與可編輯結果;clarify 只詢問會改變答案的最少問題;refuse 說明不能做什麼並提供安全替代;escalate 交代轉接原因、已收集資訊與人工回應目標。四種結果都要帶可追蹤原因碼。
第三步:建立證據與不確定性訊號
證據可來自權限內檢索、結構化業務狀態或人工確認。不要把模型輸出的信心直接顯示成「正確率百分比」;先用標註資料評估校準、覆蓋率與不同風險層的錯誤代價。證據不足時,釐清或升級是產品行為,不是隱藏模型失敗。
第四步:處理釐清成本
每個釐清問題都應縮小關鍵不確定性。先問對象、時間範圍或權限範圍,再重新檢索;不要連續追問無關細節。設定問題上限,超過後提供選項或轉人工,同時觀察釐清輪數、解決率和放棄率。
第五步:設計拒答與人工升級
拒答要區分不安全、越權、資訊不足與服務故障,原因不同,下一步也不同。人工升級只攜帶必要上下文並告知預計等待時間;隊列擁塞時優先處理高影響事件,低風險請求可回傳可編輯草稿或說明入口。
第六步:建立評估集與指標樹
離線集覆蓋正常、模糊、對抗、權限邊界與高風險長尾請求。頂層目標是「有用且不造成不可接受傷害」,下層拆成正確有用率、嚴重錯誤率、過度拒答率、釐清後解決率、轉人工成功率、人工處理時間與成本。所有指標按任務、使用者、語言與權限切片。
第七步:安排灰度、回滾與申訴
先在低風險任務與內部使用者灰度,預先寫好嚴重錯誤、過度拒答與人工容量門檻。觸發門檻就停放量或回滾策略版本。使用者可標記錯誤、未解決或不該拒答,高影響案例進人工複核並回寫評估集。
第八步:處理隱私與持續改進
記錄策略版本、原因碼與去識別後的必要證據,限制原始對話存取者。訓練或評估資料要有保存期限、刪除流程與存取稽核。每次策略調整都在固定回歸集比較有用、傷害、拒答與人工成本,避免只優化單一指標。
高品質示範回答
我會把產品定義成風險分層的決策系統。低風險且有權限證據時直接回答;缺少會改變答案的關鍵上下文時只問最少釐清問題;高風險、越權或無法驗證時拒答並提供安全下一步;需要專業判斷或隊列處理時轉人工並傳遞必要上下文。內部機率只能是一個訊號,不能直接向使用者承諾正確率。我會建立正常、模糊、對抗與高風險評估集,按任務和使用者切片觀察正確有用率、嚴重錯誤率、過度拒答率、釐清後解決率、轉人工等待和成本。先做低風險灰度,設置停放量門檻、回滾版本與申訴入口,策略和證據依權限與保存期限記錄。
常見錯誤
- 一開始比較模型大小,卻沒有定義使用者任務和錯誤代價。
- 把模型自報信心直接展示成正確率承諾。
- 用一次釐清解決所有問題,造成追問過長與流失。
- 把所有不確定請求轉人工,忽略人工容量和優先級。
- 只測平均滿意度,不測嚴重錯誤、過度拒答與使用者切片。
- 拒答沒有原因和下一步,使用者無法完成任務也無法申訴。
- 為了訓練無限期保存原始對話,忽略權限、去識別與刪除。
追問及應對
如果業務方要求把轉人工率降到最低,你如何回應?
先確認目標是降低無價值轉接,還是壓低所有轉接。可在低風險、證據充分任務擴大自動回答,高風險任務保留升級底線;用嚴重錯誤與人工補救成本說明只看轉接率會製造隱性損失。
使用者說「不用解釋,直接替我執行」,怎麼辦?
把不可逆動作與可編輯建議分開。低風險動作可先展示摘要與確認點;付款、權限變更或外部傳送需要明確確認和可追蹤授權。使用者偏好不能繞過權限、風險與稽核邊界。
如何判斷釐清問題真的有價值?
在離線資料比較提問前後的答案品質與解決率,記錄每個問題的資訊增益、額外輪數與放棄率。問題不改變分流或答案就刪除;高價值但難回答時提供選項而非開放式長問句。
模型升級後正確率上升但投訴也上升,如何排查?
按任務風險、使用者群、語言、權限與策略版本切片,區分錯誤回答、語氣變化、過度拒答和轉人工延遲。先凍結擴量,回放高影響樣本,比較新舊版本評估集與真實回饋,再決定回滾、局部放量或調整門檻。