具代表性的面試主題

資料科學面試:為什麼調整處理後變數會造成實驗偏差?

資料困難
Offer.cc 編輯團隊發佈 更新

題幹

處理改變了使用者是否點擊面板,你想只比較點擊使用者的購買。這會有什麼問題?你會報告什麼?

題目與情境

點擊發生在分派之後,且受處理影響。只分析點擊者看似是在做細分比較,實際上可能破壞識別總體處理效果所依賴的隨機化。

面試官在考察什麼

  • 區分處理前調節變數與處理後中介變數。
  • 用因果圖解釋碰撞點和選擇偏差。
  • 選擇與產品決策相匹配的估計量。

作答前的釐清問題

  • 點擊是在分派前、分派後,還是兩個時間點都測量?
  • 決策關注總體影響、依從使用者效果,還是面板產生的機制?
  • 是否存在同時預測點擊和購買的處理前變數?
  • 點擊過濾是否在實驗前規劃,並有有效識別策略支持?

30 秒回答框架

我不會把觀測到的點擊者作為主要分析人群。點擊是處理後的中介,也可能受到未觀測購買傾向影響。對點擊者條件化會開啟非因果路徑並破壞兩組的隨機化平衡。上線估計使用所有分派使用者的意向性分析;中介或主要分層分析只能在明確假設下作為次要結果。

分步深挖

1. 畫出時間順序

分派先於點擊,點擊先於購買。處理前特徵可能同時影響點擊與購買,處理也會影響點擊,因此點擊者子集由處理後變數選出。

2. 聲明因果問題

總體效果回答產品對分派人群上線會怎樣。機制問題回答多少效果透過面板產生。反應者問題關注在兩組下點擊行為都相同的人。它們是不同估計量。

3. 說明過濾為何失效

在點擊者子集中,處理組與對照組的潛在購買傾向可能不同,因為處理改變了誰能進入子集。隨機化保護的是完整分派人群,不是任意處理後切片。

4. 選擇可辯護的分析

上線估計使用意向性分析。中介分析要預先規定處理前共變數、中介和結果窗口,並寫明中介與結果混雜的假設。依從性問題可考慮主要分層或工具變數方法,但前提是其假設可信。

5. 表達限制

同時展示總體估計、兩組點擊率和次要分析。樣本很大或點擊可觀測,都不能把點擊者比較稱為因果結果。說明哪些結論可識別,哪些依賴假設。

高品質示範回答

「點擊發生在分派後並且受處理改變,因此點擊者是按中介變數篩選的子集。處理可能改變其中潛在購買傾向,隨機化保護也就不再自動成立。我會用所有分派使用者的意向性分析做上線決策,同時展示點擊率和總體購買效果;機制或反應者分析作為次要結果,並在使用中介或主要分層方法前預先寫明因果圖與假設。」

常見失誤

  • 只比較點擊者 → 處理改變了納入人群 → 主要分析保留所有分派使用者。
  • 把點擊當處理前分組 → 點擊發生在分派之後 → 先記錄時間順序。
  • 調整所有可觀測行為 → 處理後條件化可能開啟偏差路徑 → 使用有依據的處理前共變數。
  • 認為大樣本就有因果性 → 精確度不能恢復識別 → 聲明估計量與假設。

追問與回答

還能報告點擊者結果嗎?

可以作為描述性或明確依賴假設的次要結果。標註它是觀測點擊者內的關聯,並展示過濾如何改變兩組構成。

為什麼不能在回歸中控制點擊?

回歸調整不會把處理後變數變成處理前變數。它可能截斷部分處理效果;當未觀測原因同時影響點擊和購買時,還可能產生碰撞點偏差。

如果產品只服務點擊者怎麼辦?

應把目標定義為主要分層,例如兩組下都會點擊的使用者,並使用假設可辯護的識別方法。觀測點擊者不自動等於該分層。

公開來源

同類題目