題目與情境
目前結果只統計有觀測結果的使用者。面試官希望你判斷流失、遙測失敗或被過濾的使用者是否系統性不同,並說明如何恢復可信的決策人群。
面試官在考察什麼
- 辨識把倖存使用者作為條件所造成的倖存者偏差。
- 讀取轉化率前重建分派分母。
- 區分缺失、曝光與處理效果。
作答前的釐清問題
- 主要估計量是所有隨機分派使用者的意向性分析,還是遵循協議使用者的效果?
- 使用者何時以及為何會流失、關閉遙測或失去資格?
- 兩組是否都有分派、曝光和結果計數,且能按分組查看?
- 留存過濾條件是在上線前定義,還是看到結果後加入的?
30 秒回答框架
我會先暫停決策,重建從分派、曝光到結果的漏斗,並比較兩組流失率。主要分析應保留所有隨機分派使用者,明確處理缺失結果。接著檢查樣本比例失配、遙測遺失和處理前分組,對可能的缺失結果給出敏感性邊界。只看倖存者的提升可以作為描述性結果,但沒有更強假設時不能代表上線效果。
分步深挖
1. 定義人群
明確分析單位、分派時間、資格規則和觀察窗口。意向性分析人群應保留每個分派使用者,不能悄悄改成開啟功能或持續活躍的使用者。
2. 重建漏斗
按實驗組統計分派、曝光、活躍、觀測結果和缺失結果人數,同時給出比例與絕對數。處理可能造成更多早期退出時,倖存者轉化率上升仍可能伴隨總體轉化下降。
3. 診斷選擇機制
檢查樣本比例失配、發布規則、客戶端版本、地區、裝置、延遲和事件投遞。比較留存與缺失使用者的處理前行為。若缺失與處理或結果風險有關,完整案例分析就會產生偏差。
4. 選擇主要估計
上線決策使用意向性分析,按預先規定的規則或邊界處理缺失結果。遵循協議或只看倖存者的結果作為次要分析,並寫明假設。若隨機化或遙測損壞,應修復流程或重跑實驗。
5. 表達不確定性
展示兩組人數、流失差異、區間和敏感性情境。只按處理前變數分層並預先規定分析;若結論會隨合理的缺失結果假設改變,應升級決策風險。
高品質示範回答
「我會暫停上線,重建兩組從分派到結果的完整漏斗。主要估計保留每個隨機分派使用者,只看倖存者的轉化率作為次要結果。我會檢查樣本比例失配、遙測遺失和兩組流失差異,並比較缺失與觀測使用者的處理前風險。最後報告意向性分析區間和敏感性邊界;若結論依賴無法驗證的缺失假設或隨機化鏈路損壞,就先修復或重跑。」
常見失誤
- 只用活躍使用者 → 處理造成的流失被隱藏 → 意向性分析保留所有分派使用者。
- 假定缺失隨機 → 遙測遺失可能與分組或結果有關 → 診斷缺失機制並做敏感性分析。
- 自動把曝光當分母 → 曝光可能是處理後變數 → 先聲明估計量再過濾。
- 只報百分比 → 不同人數會反轉決策 → 同時展示絕對數和組間差異。
追問與回答
缺失結果可以直接插補嗎?
只有在明確模型和敏感性分析的前提下才可以。多重插補可能適用於隨機缺失假設,但不能證明該假設;最壞情形或臨界點邊界可以揭示結論是否脆弱。
遵循協議結果什麼時候有用?
它可以描述遵循明確協議的使用者效果,但依從性通常受處理影響。應作為次要結果,並解釋假設,或使用針對依從性的因果方法。
如何區分倖存者偏差和樣本比例失配?
樣本比例失配關注分派人數偏離計畫比例;倖存者偏差關注分派後對選定子集進行條件化。兩者可能同時存在,因此要同時稽核隨機化分母和後續留存。