题目与场景
点击发生在分配之后,并且受处理影响。只分析点击者看似是在做细分比较,实际上可能破坏识别总体处理效果所依赖的随机化。
面试官在考察什么
- 区分处理前调节变量与处理后中介变量。
- 用因果图解释碰撞点和选择偏差。
- 选择与产品决策相匹配的估计量。
作答前的澄清问题
- 点击是在分配前、分配后还是两个时间点都测量?
- 决策关注总体影响、依从用户效果,还是面板产生的机制?
- 是否存在同时预测点击和购买的处理前变量?
- 点击过滤是否在实验前规划,并有有效的识别策略支持?
30 秒回答框架
我不会把观测到的点击者作为主要分析人群。点击是处理后的中介,也可能受到未观测购买倾向的影响。对点击者条件化会打开非因果路径并破坏两组的随机化平衡。上线估计使用所有分配用户的意向性分析;中介或主要分层分析只能在明确假设下作为次要结果。
分步深挖
1. 画出时间顺序
分配先于点击,点击先于购买。处理前特征可能同时影响点击与购买,处理也会影响点击,因此点击者子集由处理后的变量选出。
2. 声明因果问题
总体效果回答产品对分配人群上线会怎样。机制问题回答多少效果通过面板产生。响应者问题关注在两组下点击行为都相同的人。它们是不同的估计量。
3. 说明过滤为何失效
在点击者子集中,处理组与对照组的潜在购买倾向可能不同,因为处理改变了谁能进入子集。随机化保护的是完整分配人群,不是任意处理后切片。
4. 选择可辩护的分析
上线估计使用意向性分析。中介分析要预先规定处理前协变量、中介和结果窗口,并写明中介与结果混杂的假设。依从性问题可考虑主要分层或工具变量方法,但前提是其假设可信。
5. 表达限制
同时展示总体估计、两组点击率和次要分析。样本很大或点击可观测,都不能把点击者比较称为因果结果。说明哪些结论可识别,哪些依赖假设。
高质量示范回答
“点击发生在分配后并且受处理改变,因此点击者是按中介变量筛选的子集。处理可能改变其中潜在购买倾向,随机化保护也就不再自动成立。我会用所有分配用户的意向性分析做上线决策,同时展示点击率和总体购买效果;机制或响应者分析作为次要结果,并在使用中介或主要分层方法前预先写明因果图与假设。”
常见失误
- 只比较点击者 → 处理改变了纳入人群 → 主要分析保留所有分配用户。
- 把点击当处理前分组 → 点击发生在分配之后 → 先记录时间顺序。
- 调整所有可观测行为 → 处理后条件化可能打开偏差路径 → 使用有依据的处理前协变量。
- 认为大样本就有因果性 → 精确度不能恢复识别 → 声明估计量与假设。
追问与回答
还能报告点击者结果吗?
可以作为描述性或明确依赖假设的次要结果。标注它是观测点击者内的关联,并展示过滤如何改变两组构成。
为什么不能在回归中控制点击?
回归调整不会把处理后变量变成处理前变量。它可能截断部分处理效果;当未观测原因同时影响点击和购买时,还可能产生碰撞点偏差。
如果产品只服务点击者怎么办?
应把目标定义为主要分层,例如两组下都会点击的用户,并使用假设可辩护的识别方法。观测点击者不自动等于该分层。