題目與情境
點擊發生在分派之後,且受處理影響。只分析點擊者看似是在做細分比較,實際上可能破壞識別總體處理效果所依賴的隨機化。
面試官在考察什麼
- 區分處理前調節變數與處理後中介變數。
- 用因果圖解釋碰撞點和選擇偏差。
- 選擇與產品決策相匹配的估計量。
作答前的釐清問題
- 點擊是在分派前、分派後,還是兩個時間點都測量?
- 決策關注總體影響、依從使用者效果,還是面板產生的機制?
- 是否存在同時預測點擊和購買的處理前變數?
- 點擊過濾是否在實驗前規劃,並有有效識別策略支持?
30 秒回答框架
我不會把觀測到的點擊者作為主要分析人群。點擊是處理後的中介,也可能受到未觀測購買傾向影響。對點擊者條件化會開啟非因果路徑並破壞兩組的隨機化平衡。上線估計使用所有分派使用者的意向性分析;中介或主要分層分析只能在明確假設下作為次要結果。
分步深挖
1. 畫出時間順序
分派先於點擊,點擊先於購買。處理前特徵可能同時影響點擊與購買,處理也會影響點擊,因此點擊者子集由處理後變數選出。
2. 聲明因果問題
總體效果回答產品對分派人群上線會怎樣。機制問題回答多少效果透過面板產生。反應者問題關注在兩組下點擊行為都相同的人。它們是不同估計量。
3. 說明過濾為何失效
在點擊者子集中,處理組與對照組的潛在購買傾向可能不同,因為處理改變了誰能進入子集。隨機化保護的是完整分派人群,不是任意處理後切片。
4. 選擇可辯護的分析
上線估計使用意向性分析。中介分析要預先規定處理前共變數、中介和結果窗口,並寫明中介與結果混雜的假設。依從性問題可考慮主要分層或工具變數方法,但前提是其假設可信。
5. 表達限制
同時展示總體估計、兩組點擊率和次要分析。樣本很大或點擊可觀測,都不能把點擊者比較稱為因果結果。說明哪些結論可識別,哪些依賴假設。
高品質示範回答
「點擊發生在分派後並且受處理改變,因此點擊者是按中介變數篩選的子集。處理可能改變其中潛在購買傾向,隨機化保護也就不再自動成立。我會用所有分派使用者的意向性分析做上線決策,同時展示點擊率和總體購買效果;機制或反應者分析作為次要結果,並在使用中介或主要分層方法前預先寫明因果圖與假設。」
常見失誤
- 只比較點擊者 → 處理改變了納入人群 → 主要分析保留所有分派使用者。
- 把點擊當處理前分組 → 點擊發生在分派之後 → 先記錄時間順序。
- 調整所有可觀測行為 → 處理後條件化可能開啟偏差路徑 → 使用有依據的處理前共變數。
- 認為大樣本就有因果性 → 精確度不能恢復識別 → 聲明估計量與假設。
追問與回答
還能報告點擊者結果嗎?
可以作為描述性或明確依賴假設的次要結果。標註它是觀測點擊者內的關聯,並展示過濾如何改變兩組構成。
為什麼不能在回歸中控制點擊?
回歸調整不會把處理後變數變成處理前變數。它可能截斷部分處理效果;當未觀測原因同時影響點擊和購買時,還可能產生碰撞點偏差。
如果產品只服務點擊者怎麼辦?
應把目標定義為主要分層,例如兩組下都會點擊的使用者,並使用假設可辯護的識別方法。觀測點擊者不自動等於該分層。