代表性面试主题

数据科学面试:为什么调整处理后变量会造成实验偏差?

数据困难
Offer.cc 编辑团队发布 更新

题干

处理改变了用户是否点击面板,你想只比较点击用户的购买。这样会出什么问题?你会报告什么?

题目与场景

点击发生在分配之后,并且受处理影响。只分析点击者看似是在做细分比较,实际上可能破坏识别总体处理效果所依赖的随机化。

面试官在考察什么

  • 区分处理前调节变量与处理后中介变量。
  • 用因果图解释碰撞点和选择偏差。
  • 选择与产品决策相匹配的估计量。

作答前的澄清问题

  • 点击是在分配前、分配后还是两个时间点都测量?
  • 决策关注总体影响、依从用户效果,还是面板产生的机制?
  • 是否存在同时预测点击和购买的处理前变量?
  • 点击过滤是否在实验前规划,并有有效的识别策略支持?

30 秒回答框架

我不会把观测到的点击者作为主要分析人群。点击是处理后的中介,也可能受到未观测购买倾向的影响。对点击者条件化会打开非因果路径并破坏两组的随机化平衡。上线估计使用所有分配用户的意向性分析;中介或主要分层分析只能在明确假设下作为次要结果。

分步深挖

1. 画出时间顺序

分配先于点击,点击先于购买。处理前特征可能同时影响点击与购买,处理也会影响点击,因此点击者子集由处理后的变量选出。

2. 声明因果问题

总体效果回答产品对分配人群上线会怎样。机制问题回答多少效果通过面板产生。响应者问题关注在两组下点击行为都相同的人。它们是不同的估计量。

3. 说明过滤为何失效

在点击者子集中,处理组与对照组的潜在购买倾向可能不同,因为处理改变了谁能进入子集。随机化保护的是完整分配人群,不是任意处理后切片。

4. 选择可辩护的分析

上线估计使用意向性分析。中介分析要预先规定处理前协变量、中介和结果窗口,并写明中介与结果混杂的假设。依从性问题可考虑主要分层或工具变量方法,但前提是其假设可信。

5. 表达限制

同时展示总体估计、两组点击率和次要分析。样本很大或点击可观测,都不能把点击者比较称为因果结果。说明哪些结论可识别,哪些依赖假设。

高质量示范回答

“点击发生在分配后并且受处理改变,因此点击者是按中介变量筛选的子集。处理可能改变其中潜在购买倾向,随机化保护也就不再自动成立。我会用所有分配用户的意向性分析做上线决策,同时展示点击率和总体购买效果;机制或响应者分析作为次要结果,并在使用中介或主要分层方法前预先写明因果图与假设。”

常见失误

  • 只比较点击者 → 处理改变了纳入人群 → 主要分析保留所有分配用户。
  • 把点击当处理前分组 → 点击发生在分配之后 → 先记录时间顺序。
  • 调整所有可观测行为 → 处理后条件化可能打开偏差路径 → 使用有依据的处理前协变量。
  • 认为大样本就有因果性 → 精确度不能恢复识别 → 声明估计量与假设。

追问与回答

还能报告点击者结果吗?

可以作为描述性或明确依赖假设的次要结果。标注它是观测点击者内的关联,并展示过滤如何改变两组构成。

为什么不能在回归中控制点击?

回归调整不会把处理后变量变成处理前变量。它可能截断部分处理效果;当未观测原因同时影响点击和购买时,还可能产生碰撞点偏差。

如果产品只服务点击者怎么办?

应把目标定义为主要分层,例如两组下都会点击的用户,并使用假设可辩护的识别方法。观测点击者不自动等于该分层。

公开来源

同类题目