题干与适用场景
产品团队只在部分地区上线新的结账流程。上线前处理地区转化率为 10%,对照地区为 8%;上线后分别为 14% 和 9%。你会如何用双重差分评估改动效果?
这是数据科学、产品分析和实验平台岗位的因果推断题。四个百分比是面试假设,不是实际业务结果。回答要区分描述性变化与因果识别,说明处理分配、时间窗口、平行趋势和分期上线风险。
面试官考察点
强回答会先写出估计量,再检查识别假设,而不是直接说“转化率涨了 3 个百分点”。面试官还会看你是否识别选择偏差、同期冲击、溢出效应、重复观测、标准误聚类,以及多期或错峰处理下简单双向固定效应可能失真。
回答前需要澄清的问题
- 地区如何进入处理组,是否由业务团队按预期增长选择?
- 是否有多个上线前周期可画趋势,处理组与对照组的走势是否近似平行?
- 上线期间是否发生价格、营销、季节或流量来源变化?
- 用户会跨地区访问或迁移,是否存在处理向对照的溢出?
- 是一次同时上线,还是不同地区在不同日期上线?
- 结果单位是用户、订单还是地区,标准误应在哪个层级聚类?
30 秒回答框架
“先把变化写成双重差分:处理组变化减去对照组变化,本题点估计是 3 个百分点。但这只有在处理前趋势相近、没有差异化同期冲击和明显溢出的条件下才有因果含义。我会画多期事件研究图,检查预趋势,控制已知协变量,并按处理分配层级聚类标准误。若是错峰上线,我会使用适合分期处理的估计器和稳健性比较,而不是直接依赖朴素的双向固定效应。”
分步骤深入解答
第一步:计算描述性估计
处理地区从 10% 到 14%,变化为 4 个百分点;对照地区从 8% 到 9%,变化为 1 个百分点。因此双重差分为 (14%-10%) - (9%-8%) = 3 个百分点。这个数字描述了相对变化,尚未证明产品改动造成它。
第二步:确认识别假设
核心是平行趋势:如果没有改动,处理组与对照组的结果差距应按相近趋势变化。用多个上线前周期画原始均值和差值,检查是否已有分叉。还要确认没有地区特定营销、物流变化、宏观冲击或用户迁移同时发生。平行趋势无法只靠一次上线前后对比证明,必须结合业务机制和多期数据。
第三步:选择估计与推断方法
同时上线且只有一个处理时,可用地区和时间固定效应的 DiD,并按地区聚类标准误。处理组较少时,常规渐近标准误可能不可靠,应考虑随机化推断或小样本方法。错峰上线时,先识别各批次的动态效应;NBER 的分期处理指南提醒,简单的双向固定效应在效应随时间或批次变化时可能混合不同权重,需比较适用于分期处理的估计器。
第四步:做反事实与稳健性检查
做伪上线日期、伪处理地区和不同窗口;加入已知协变量并比较结果;检查负向结果和留存是否出现不合理变化。若存在溢出,缩小到不相邻地区或改用市场层级处理。报告点估计、置信区间、样本量、聚类层级和缺失数据处理,不能只报 3 个百分点。
高质量示范回答
“先做算术:处理地区上涨 4 个百分点,对照地区上涨 1 个百分点,所以 DiD 点估计是 3 个百分点。它只是相对变化,只有在没有改动时两组会有相近趋势、没有地区特定同期冲击、没有明显跨地区溢出时,才可以解释为结账流程的因果效果。
我会先取多个上线前周期,画两组转化率和差值,检查预趋势;再核对处理分配是否由增长预期决定,排查营销、价格、流量和节假日变化。若是同时上线,我会使用地区和时间固定效应,并按地区聚类标准误。若地区数量少,我会补充随机化或小样本推断。
若各地区错峰上线,我不会直接使用朴素双向固定效应,而会按上线批次估计动态效应,并用适合分期处理的方法做比较。最后做伪日期、伪地区、不同窗口和负向结果检查,报告区间与假设。若预趋势明显不平行或溢出无法控制,我会把结论降级为相关性,建议重新设计随机实验或分层 rollout。”
常见错误
- 把 3 个百分点当因果事实 → 只计算了相对变化 → 明确写出识别假设和不确定性。
- 只看一个上线前点 → 无法检查平行趋势 → 使用多个周期和事件研究图。
- 忽略处理分配偏差 → 高增长地区可能主动获得改动 → 分析分配机制并控制可比协变量。
- 错峰上线仍套朴素 TWFE → 批次效应可能互相污染 → 使用分期处理估计器并做敏感性比较。
- 标准误按用户聚类 → 处理在地区层级,相关性被低估 → 按处理分配层级聚类或采用稳健推断。
- 不检查溢出 → 对照组也受到改动影响 → 换不相邻对照或改用更高层级处理。
- 只报告点估计 → 读者不知道精度和样本边界 → 报告区间、样本量、缺失和窗口。
追问及应对
追问一:上线前两组趋势已经分叉,是否还能用 DiD?
先寻找机制和可比对照。可加入有依据的协变量或缩小窗口,但不能用回归“修平”无法解释的分叉;若平行趋势不可信,应改做随机实验或明确降级为相关性。
追问二:处理组只有三个地区,如何做推断?
避免依赖大样本近似。考虑随机化推断、野 bootstrap 或合成控制等适合小簇的方法,并把地区级结果和不确定性完整报告。
追问三:用户跨地区移动怎么办?
定义处理暴露,例如按首次稳定地区或账户归属分配;剔除明显迁移者做敏感性分析,同时测量迁移率。若溢出很强,地区 DiD 的对照反事实已被破坏。
追问四:结果显著但收入没有变化,如何解释?
把转化提升拆成订单价值、退款、留存与获客成本,检查是否出现负向结果。DiD 识别的是目标指标变化,不自动代表整体商业价值;建议把收入和体验指标纳入后续评估。