代表性面试主题

数据科学面试:如何发现实验中的幸存者偏差?

数据中等
Offer.cc 编辑团队发布 更新

题干

一个功能实验在仍然活跃的用户中提升转化,但大量已分配用户消失了。你如何判断结果是否真实?

题目与场景

当前结果只统计有观测结果的用户。面试官希望你判断流失、遥测失败或被过滤的用户是否系统性不同,并说明如何恢复可信的决策人群。

面试官在考察什么

  • 识别把幸存用户作为条件所产生的幸存者偏差。
  • 在读取转化率前重建分配分母。
  • 区分缺失、曝光和处理效应。

作答前的澄清问题

  • 主要估计量是所有随机分配用户的意向性分析,还是遵循协议用户的效果?
  • 用户何时以及为何会流失、关闭遥测或失去资格?
  • 两组是否都有分配、曝光和结果计数,并能按分组查看?
  • 留存过滤条件是在上线前定义,还是看到结果后加入的?

30 秒回答框架

我会先暂停决策,重建从分配、曝光到结果的漏斗,并比较两组流失率。主要分析应保留所有随机分配用户,把缺失结果显式处理。随后检查样本比例失配、遥测丢失和处理前分组,并对可能的缺失结果给出敏感性边界。只看幸存者的提升可以作为描述性结果,但在没有更强假设时不能代表上线效果。

分步深挖

1. 定义人群

明确分析单位、分配时间、资格规则和观察窗口。意向性分析人群应保留每个分配用户,不能悄悄改成打开功能或持续活跃的用户。

2. 重建漏斗

按实验组统计分配、曝光、活跃、观测结果和缺失结果人数,并同时给出比例与绝对数。处理可能造成更多早期退出时,幸存者转化率上升仍可能伴随总体转化下降。

3. 诊断选择机制

检查样本比例失配、发布规则、客户端版本、地区、设备、延迟和事件投递。比较留存与缺失用户的处理前行为。若缺失与处理或结果风险有关,完整案例分析就会产生偏差。

4. 选择主要估计

上线决策使用意向性分析,按预先规定的规则或边界处理缺失结果。遵循协议或只看幸存者的结果作为次要分析,并写明假设。若随机化或遥测损坏,应修复流程或重跑实验。

5. 表达不确定性

展示两组人数、流失差异、区间和敏感性情景。只按处理前变量分层并预先规定分析;若结论会随合理的缺失结果假设改变,应升级决策风险。

高质量示范回答

“我会暂停上线,重建两组从分配到结果的完整漏斗。主要估计保留每个随机分配用户,只看幸存者的转化率作为次要结果。我会检查样本比例失配、遥测丢失和两组流失差异,并比较缺失与观测用户的处理前风险。最终报告意向性分析区间和敏感性边界;若结论依赖无法验证的缺失假设或随机化链路损坏,就先修复或重跑。”

常见失误

  • 只用活跃用户 → 处理造成的流失被隐藏 → 意向性分析保留所有分配用户。
  • 假定缺失随机 → 遥测丢失可能与分组或结果有关 → 诊断缺失机制并做敏感性分析。
  • 自动把曝光当分母 → 曝光可能是处理后的变量 → 先声明估计量再过滤。
  • 只报百分比 → 不同人数会反转决策 → 同时展示绝对数和组间差异。

追问与回答

缺失结果可以直接插补吗?

只有在明确模型和敏感性分析的前提下才可以。多重插补可能适用于随机缺失假设,但不能证明该假设;最坏情形或临界点边界可以揭示结论是否脆弱。

遵循协议结果什么时候有用?

它可以描述遵循明确协议的用户效果,但依从性通常受处理影响。应作为次要结果,并解释假设,或使用针对依从性的因果方法。

如何区分幸存者偏差和样本比例失配?

样本比例失配关注分配人数偏离计划比例;幸存者偏差关注分配后对选定子集进行条件化。两者可能同时存在,因此要同时审计随机化分母和后续留存。

公开来源

同类题目