1. 題目與使用情境
團隊準備推出一個摘要客服對話的 AI 功能。摘要可能有多種合理寫法,人工標註昂貴,單一自動評分也不能代表客戶是否真的解決問題。請設計一套評估方法,回答「是否值得上線、對誰上線,以及失敗時如何收斂」。
2. 面試官考察重點
- 是否先定義使用者任務與不可接受的失敗,而不是先報一個模型分數。
- 能否組合離線測試、人工評審、線上行為與安全監控。
- 是否區分領先指標、落後結果與護欄指標,並說明互相衝突時如何決策。
- 是否把評估集、風險容忍度、人工升級與回滾寫成產品機制。
3. 回答前需要釐清的問題
- AI 輸出是草稿、建議,還是會自動觸發不可逆操作?
- 「成功」是節省處理時間、提高一次解決率,還是降低錯誤申訴?
- 哪些錯誤會造成隱私、合規或客戶傷害,必須零容忍或人工攔截?
- 目標使用者、語言、產業與資料分布是否和評估樣本一致?
4. 30 秒回答框架
我會先定義任務與風險,再建立具代表性的評估集。評估分四層:任務結果、輸出品質、信任與安全、成本與延遲。沒有單一標籤時,使用領域專家的成對偏好或通過/不通過規則校準自動指標,並把線上實驗、使用者回饋與人工升級納入持續監控。上線採分層門檻:硬護欄不達標就停止,品質與業務收益達標才擴大流量。
5. 分步深入解答
第一步:把「好答案」改寫成可觀察任務
先寫清楚輸入、使用者動作與期望結果。例如摘要功能的任務不是「文字像不像參考答案」,而是客服能否在有限時間找到客戶訴求、正確承諾下一步,並避免洩漏敏感資訊。為每項結果定義可接受範圍和明確失敗樣例。
第二步:建立多層評估集
抽取涵蓋語言、客戶類型、對話長短與邊緣案例的樣本。由領域專家制定 rubric,允許多個合理答案,分別評分關鍵事實、遺漏、語氣與隱私。保留一份凍結的回歸集,另設近期樣本偵測分布變化;標註不足時記錄「不確定」,不要硬造標籤。
第三步:組合指標與護欄
核心指標可以是任務完成率、一次解決率或人工編輯後採用率;品質層測量事實正確、要點覆蓋與引用完整;護欄層監控有害內容、隱私洩漏、偏差、升級率與申訴。成本、延遲與人工審核工時決定可持續性。每個指標都要寫清分母、抽樣窗口和失效條件。
第四步:把評估連接到發布決策
先做離線回歸,再讓小規模、可回滾的使用者看到功能。硬護欄觸發就立即停用;品質或業務指標不足,則回到提示、檢索、模型或介面層定位原因。線上資料和人工回饋定期更新評估集,監控評估指標本身是否仍能代表真實風險。高風險動作保留人工確認與關閉開關。
6. 高品質示範回答
我不會把單一自動分數當成答案。先定義使用者要完成的任務、允許的錯誤和不可逆風險,再建立涵蓋真實分布的凍結評估集。專家用 rubric 評估事實、覆蓋、語氣與隱私,並用成對比較處理多個合理答案。
>
上線前同時看任務結果、輸出品質、信任安全、成本與延遲。任務完成率是主要指標;隱私洩漏、有害內容和關鍵事實錯誤是硬護欄。先做離線回歸和小流量實驗,為高風險動作加入人工確認。結果不達標時按錯誤類型定位到資料、檢索、模型或介面,更新評估集後再決定擴大、回滾或停止。
7. 常見錯誤
- 只報準確率或平均分數,卻沒有定義使用者任務與失敗後果。
- 用一套方便樣本代表所有語言、客戶與邊緣情境。
- 把使用者點擊上升當成成功,忽略錯誤答案帶來的申訴或人工返工。
- 只在發布前評估,不監控線上分布、回饋與評估集老化。
- 將「模型不確定」直接自動執行,缺少人工升級、回滾和停用機制。
8. 追問及應對
追問一:人工標註預算只剩原來十分之一怎麼辦?
先按風險分層,把預算給高影響場景和最容易誤判的樣本;低風險樣本可用抽樣審核、成對比較與使用者回饋補充。保留不確定標籤並監控抽樣誤差,不能用較少標註假裝得到同等確定性。
追問二:線上任務完成率上升,但隱私風險也上升呢?
隱私護欄優先於收益指標。暫停擴大流量,隔離受影響的輸入和輸出,修復脫敏、檢索權限或提示策略;只有硬護欄恢復並完成回歸後才重新上線。
追問三:如何證明評估指標沒有過時?
定期把線上失敗、人工升級和使用者申訴回灌到評估集,按語言、使用者群與版本切片比較。讓領域專家複核 rubric,並記錄指標與真實結果的偏離;偏離擴大時調整指標或暫停使用舊門檻。