題幹與適用場景
一次 A/B 實驗讓核心轉化率顯著上升,但頁面載入時間和客服投訴率下降。你會如何判斷實驗是否可信,並決定繼續、暫停、回滾或擴大發布?
Microsoft 的實驗平台實踐把成功指標、護欄指標和資料品質指標分開持續監控;護欄回歸不應被單一主指標上升掩蓋。題目考察預先定義規則、診斷因果和承擔使用者風險的能力。
面試官考察點
候選人應先確認隨機化、樣本比、埋點和統計功效,再區分護欄嚴重性、持續時間和使用者影響。答案需要停止門檻、調查動作、利害關係人溝通和後續實驗設計,不是只說「看更多資料」。
30 秒回答框架
「我不會直接發布。先檢查 SRM、埋點遺失、樣本量、分層和時間窗口,確認護欄回歸是真實且集中在處理組。若載入和投訴超過預設硬門檻,立即暫停或回滾;若是輕微且不確定,縮小流量並延長預先承諾的觀察期,同時做分群和機制分析。只有主指標收益在可接受護欄範圍內、資料品質可信且風險可逆,才逐步擴大。」
分步驟深入解答
第一步:回到實驗協議
檢查假設、主要指標、護欄、最小可偵測差異、樣本量、執行時間、隨機化單位和停止規則。實驗開始後不能因看到結果才修改成功標準。
第二步:先驗證資料品質
檢查樣本比例不匹配、曝光日誌、事件遺失、版本混流、機器人流量和埋點變更。若資料品質異常,先標記結果不可決策,不能把「顯著」當真實效果。
第三步:判斷護欄嚴重性
為載入時間、錯誤率、投訴和退款等護欄定義硬門檻、軟門檻和持續時間。性能或安全硬門檻越界時自動暫停;輕微噪聲可調查,但不能無限延長風險暴露。
第四步:做分層與機制分析
按裝置、網路、地區、新舊使用者和關鍵流程分層,尋找回歸集中位置。檢查頁面性能、漏斗摩擦、客服觸發原因和功能路徑,判斷主指標上升是否犧牲長期體驗。
第五步:選擇動作
硬門檻越界:停止實驗並回滾。中等風險且證據不確定:降低流量、修復後重啟。護欄穩定且收益可重現:按預設階段逐步擴大。每個動作寫入實驗決策記錄。
第六步:處理多指標統計
主指標、護欄和品質指標用途不同,不要把所有指標簡單平均。護欄可用非劣效或門檻判斷,主指標使用預先指定的信賴區間和效應大小,同時報告不確定性。
第七步:溝通使用者與團隊風險
向工程、設計、客服和合規說明影響範圍、證據、停止條件和恢復計畫。若收益來自傷害少數分群,要寫清楚分群結果和補救方案。
第八步:沉澱後續實驗
修復問題後重新註冊實驗,保留原實驗不可變結果。必要時拆分機制實驗、增加長期留存和投訴護欄,並為告警、暫停和回滾建立責任人。
設計取捨與邊界
立即回滾還是繼續收集證據
硬門檻和不可逆傷害要求立即停止;輕微且可逆回歸可在縮小流量下收集證據。門檻必須在實驗前確定。
統計顯著還是業務重要
大樣本能讓微小差異顯著,決策還要看效應大小、成本和分群影響。護欄的「不顯著下降」在樣本不足或風險高時仍值得關注。
總體收益還是分群公平
總體主指標上升不代表每群受益。對關鍵群體設定獨立護欄和最低效果要求,避免平均數掩蓋集中傷害。
失敗演練與演進計畫
SRM 或埋點遺失
故意改變曝光日誌,確認品質告警阻止自動發布,修復後重新分析。
低階網路性能惡化
讓低階裝置載入時間超過硬門檻,驗證自動暫停或回滾。
護欄輕微下降但持續
設定軟門檻和最長觀察期,到期前若無機制解釋就停止或重做實驗。
常見誤區與追問
誤區一:主指標顯著就發布
追問:哪些護欄是硬停止條件?分群是否出現相反結果?
誤區二:把所有指標平均成一個分數
追問:為什麼性能、安全和投訴不能被轉化率簡單抵消?
誤區三:發現結果後才改樣本量
追問:如何避免提前停止和選擇性報告?
誤區四:只看總體平均
追問:低階裝置、新使用者或關鍵地區是否有集中回歸?
誤區五:沒有責任人和回滾路徑
追問:誰在夜間暫停實驗,多久能恢復安全版本?
延伸追問與參考答案
什麼時候允許繼續實驗?
資料品質通過、護欄未越硬門檻、風險可逆且已降低流量時,可按預先承諾的觀察期繼續。
如何解釋「主指標漲、投訴漲」?
先驗證資料和分群,再判斷體驗摩擦是否換來短期轉化。使用者傷害超過護欄時應暫停修復。
如何讓規則可執行?
把門檻、告警、暫停、回滾、審批人和記錄模板寫入實驗平台,減少依賴臨場判斷。