题干与适用场景
一家即时配送平台准备在 24 个运营区域测试新的派单算法。实验组订单可能占用原本会分给对照组订单的骑手,骑手也会在相邻区域之间移动。请设计实验,估计把新算法推广到整个市场后的效果,并说明估计目标、随机化单位、空间外溢和跨期残留控制、功效计算、分析方法、护栏以及上线决策。
24 个区域、干预方式和运营细节都是面试案例假设,并非某家真实平台的数据。假设实验系统可以随时切换新旧算法,但不能因此认定市场状态会立刻恢复。切换窗口和洗脱期都需要从订单与骑手动态中推导。
这是一道面向数据科学家、实验科学家、经济学家和产品分析师的高难度实验设计题。一个公开面试题页面将网络实验列为数据科学和数据分析岗位的困难案例,并记录了 2026 年 4 月 7 日的提问日期。LinkedIn 公开过用聚类实验检测社交网络干扰的方法。DoorDash 公开过派单场景的“区域 × 时间”切换式实验,并在 2025 年的广告市场案例中解释了跨期残留、低功效以及资源隔离方案的选择边界。ICLR 2026 论文仍在研究网络干扰下聚类随机实验的偏差与方差问题。这些材料证明题目在当前环境中仍有代表性和技术价值,无法据此推断任何公司的提问频率或公司归属。
直接按订单随机分组并比较两个用户级均值会得到误导性结论。新算法改变了订单对共享骑手池的访问,一个订单的处理会改变其他订单的结果,普通 A/B 解释依赖的无干扰条件因此失效。高质量回答先定义要估计的效应,再识别处理如何跨越空间和时间传播,最后让分组、估计量、不确定性和上线决策回答同一个问题。
面试官考察点
第一,候选人能否明确因果问题。“实验组是否优于对照组”缺少目标人群和处理环境。产品决策关心整个市场统一使用新算法后的效应,该效应可能不同于邻居仍混合使用两种算法时,单个实验组订单获得的直接效应。
第二,候选人能否把“网络干扰”拆成机制。共享骑手让订单相互争夺容量;骑手跨区移动连接了相邻区域;未完成配送和行为变化又会把影响带到后续时间。只说存在网络效应,无法据此确定实验单位和窗口。
第三,候选人能否比较多种设计。地理聚类可以减少跨组竞争,但独立单位可能太少;切换式实验能增加区域时间单位,却可能受跨期残留影响;两阶段饱和度实验适合拆分社交网络中的直接效应和外溢效应;当预算或库存可以真实切开时,隔离资源宇宙能消除组间争夺。
第四,分析能否匹配随机化方式。当处理只分配给少量市场时间块时,数百万订单也不会产生数百万个独立观测。功效、权重、标准误和随机化检查都必须尊重真实的实验单位与分配概率。
最后,候选人能否拒绝不可信的正向结果。读取提升前应检查分配、真实曝光、跨边界移动、处理持续性、并行实验和指标成熟度。候选人还要说明:切换式实验可能估计短期政策效应,但无法自动支持长期市场均衡或骑手学习效应的结论。
回答前需要澄清的问题
- 哪一个效应直接支撑决策? 目标是整个市场使用新算法后每个合格订单的变化、每个市场时间块的平均变化、实验组订单的直接效应,还是对未处理订单的外溢效应?估计量和权重由此决定。
- 干扰沿什么路径传播? 一个骑手能否服务多个区域?订单能否跨区域匹配?定价、激励、拼单或队列优先级是否也把区域连接起来?答案决定干扰图。
- 处理会影响多长时间? 派单、到店、完成、骑手换区和重新进入可用运力的时长分布是什么?代码可以切回旧版本,不代表市场状态同步复原。
- 实际有多少个独立市场? 24 个区域是互不相干的运力池,还是 4 座高度连通城市的内部划分?24 个标签可能只对应 4 个有效地理聚类。
- 稀缺资源能否隔离? 预算、候选库存或配额有机会切成独立池。骑手通常无法复制到两个宇宙,派单场景未必能采用资源隔离。
- 主要指标和分母是什么? 每个合格订单的完成率、接驾时长、骑手利用率和成交额回答不同问题。合格条件必须在处理改变入队或完成之前固定。
- 哪些延迟和双边护栏必须保护? 可考虑取消、超时、骑手每活跃小时收入、空闲时长、接单率、投诉和跨区域挤出。
- 哪些并行策略改变同一市场? 促销、定价、天气应对和其他派单实验可能与本实验交互,需要分层、互斥或明确的因子设计。
- 能记录哪些分配和曝光数据? 至少需要计划分组、实际算法、市场聚类、时间块、订单合格时间、骑手跨区、降级和成熟结果,才能区分实验故障与产品效应。
30 秒回答框架
“我会先把估计目标定义为:整个目标市场统一采用新派单策略后,每个合格订单的变化。订单级随机不成立,因为实验组和对照组争夺同一批骑手。我会用匹配和骑手移动数据建立干扰图,把跨区流量大的区域合并;若策略可快速恢复,再评估按‘地理聚类 × 时间块’随机的切换式实验。时间块和固定过渡区间由实测残留决定,不采用默认时长。功效用历史聚类时间块的方差和自相关规划,分析按随机排程做意向治疗,并让估计量和不确定性与每订单估计目标及聚类设计一致。读取提升前先核对分配、真实曝光、污染和指标成熟度。只有完成率提升且用户与骑手护栏通过,我才进入持续区域放量;若学习效应很长或外溢无法控制,就改用更长期的聚类实验。”
分步骤深入解答
步骤一:先定义估计目标,再选择分桶单位
先把目标对比写成一句话:“对新旧策略都符合准入条件的订单,目标市场全部运行新算法,相比全部运行旧算法,会使主要结果变化多少?”这对应全量上线政策效应。
存在干扰时,一个订单的结果同时取决于自身处理和周围单位的处理。用户级混合实验主要估计部分处理密度下的直接效应,未必等于全实验与全对照的差。如果业务还想知道直接效应和外溢效应,应分别声明估计目标,不能期望一个组间差同时识别两者。
合格条件要在策略生效前冻结。例如用请求有效性、服务区域和派单前时间戳定义合格订单。主要结果可以是“固定成熟窗口内,每个合格订单完成的配送数”,这样未匹配和失败订单都保留在分母中。“实验组已完成订单的平均配送时长”依赖处理后的完成状态,策略只要丢掉困难订单,也可能显得更快。
步骤二:把网络效应画成干扰图
根据运营数据与产品规则建立边:
- 同一时段争夺相同骑手的订单相连;
- 跨区匹配和骑手移动连接不同区域;
- 未完成订单或骑手位置变化仍存在时,相邻时间块相连;
- 定价、拼单、激励或其他实验改变同一容量时,策略之间相连。
干扰图只能使用实验前数据构建,不能根据处理后产生的行为重新划组。计算每个候选边界上的跨区匹配和骑手移动占比。有效聚类应把大部分强连接留在组内,同时保留足够多的聚类以获得功效。LinkedIn 的公开实践清楚展示了这个权衡:聚类越多,随机化单位和功效通常越多;聚类越大,跨实验组的边通常越少。
这张图还会暴露无法隔离的结果。如果骑手频繁跨越所有区域边界,按区域分组只是给一个连通市场重新贴标签。团队需要考虑整座城市按时间随机、长期独立市场实验,或主动缩小因果结论。
步骤三:根据干扰机制比较设计
个体伯努利随机在单位之间互不影响时具有较高名义样本量。本题的实验组订单会消耗共享运力,因此不适用。
长期地理聚类随机让一个相对隔离市场在整个实验期只使用一种策略。它更能容纳长期残留和行为学习;24 个区域若合并成少数连通市场,平衡、功效和外推会变得困难。
聚类切换式随机让一个连通地理聚类在一个时间块内统一使用某种策略,后续时间块重新随机。它适合主要影响能在可测时间内衰减的可逆派单算法。DoorDash 公开的派单实验正是以区域时间单元随机。该设计会产生更多实验单位,但未完成订单、骑手换区或行为变化可能继续连接相邻时间块。
两阶段或饱和度随机先把网络聚类分配到不同处理密度,再在聚类内分配成员。它能估计邻居曝光变化带来的直接和外溢效应,适合社交或推荐场景;同一时刻必须统一管理共享骑手池时,实施和解释都更复杂。
隔离资源宇宙直接切开产生干扰的资源。DoorDash 2025 年的广告案例按实验组拆分活动预算,使两个策略无法相互消耗预算。资源可分割且每个宇宙都能正常运行时,这可能优于切换式实验。把同一个骑手同时视为两个独立运力池,不会产生真实隔离。
本题只有在主要效应能足够快地衰减时,才优先选择聚类切换式实验。先把跨区连接紧密的相邻区域合成市场聚类,再随机“市场聚类 × 时间块”。如果策略会引发持续数周的骑手学习或位置迁移,就改用长期聚类放量。
步骤四:设计切换排程和过渡规则
用实验前订单生命周期、骑手换区和运营仿真估计跨期残留,再用 A/A 数据检查候选排程。时间块要让大部分相关状态得到消化;缩短窗口能增加实验单位,通常也会提高功效,同时增加残留偏差。区域大小也有同类权衡:更大的区域减少空间泄漏,也减少独立单位。
在市场聚类、星期和日内时段等预先定义的层内随机每个时间块。不能只随机第一个窗口后机械交替,否则处理可能与高峰、工作日或趋势对齐。各个序列需要平衡,关键时段内每个聚类都应有机会获得两种策略。
结果产生前固定过渡规则。主要分析可以按订单准入时计划运行的策略分组,并一直跟踪到结果成熟。若协议设置边界洗脱期,该区间必须由排程固定、对两组同时排除、明确改变后的估计目标,并计入功效损失。看到结果后再删除“疑似污染”订单会破坏随机比较。
可以把预注册分配契约压缩成:
实验单位 = 市场聚类 × 时间块
分配方式 = 在市场聚类 × 周内时段层内随机
准入时间 = 派单策略选择之前记录
主要结果 = 固定成熟窗口内每个合格订单的完成配送
主要估计目标 = 全量上线后每个合格订单的效应
过渡规则 = 曝光前固定;禁止按结果排除步骤五:按有效实验单位规划功效
用历史 A/A 时段或重放的随机排程,估计聚类时间块之间的方差、市场内序列相关、共同时间冲击、流量不均和预定协变量调整。对候选排程反复随机,在现实残留假设下计算识别预先规定最小效应的概率。
有效样本由独立分配信息决定,并非时间块内嵌套的原始订单数。缩短窗口可能增加单位,也可能增加残留偏差;扩大聚类能减少空间泄漏,也会减少单位。功效规划应展示这条偏差与方差曲线,并选择值得承担运营成本的最小效应,不能通过排程追求“必然显著”。
实验前固定时长、分配比例、停止规则和只使用处理前数据的方差缩减。现有聚类无法识别业务认为有意义的最小效应时,应在上线前说明限制。再大的订单量也无法把 4 个独立市场变成高功效实验。
步骤六:让分析方式与设计和估计目标一致
按照随机排程做意向治疗分析。真实算法曝光和执行合规应单独报告;实验组发生降级的订单仍留在实验组。分配变化发生在聚类时间块层级,健康检查也要在这一层聚合。
权重必须匹配估计目标。聚类时间块的非加权均值估计“平均时间块效应”。如果决策目标是全量上线后每个合格订单的效应,且时间块规模不同,应根据已知分配概率采用与设计一致的 Horvitz–Thompson 或 Hájek 类估计量,并明确目标人群。平均时间块效应可以作为次要结果,不能悄悄替代每订单效应。
条件允许时,优先针对真实随机排程做随机化推断。模型方法至少要处理同一市场重复观测、时间序列相关、共同时间冲击和分层。把每个订单当作独立观测会制造过窄区间。结果需要同时给出效应、区间、最小决策效应,并检查预注册过渡规则的敏感性。
影响分析前先完成以下健康检查:
- 每个层内的计划处理比例和平衡;
- 分配持久性与真实算法曝光;
- 两组的合格订单、降级和缺失事件比例;
- 跨聚类匹配和骑手移动;
- 结果成熟度和延迟取消;
- 并行实验与策略重叠;
- 同一流水线下 A/A 假阳性率是否校准。
步骤七:把结果连接到放量决策
选择一个直接对应派单目标的主要结果,例如固定窗口内每个合格订单的完成配送。用户护栏可包括取消、超时、投诉和接驾等待;骑手护栏可包括每活跃小时收入、空闲时长、接单率和不安全的工作量集中。伤害容忍值和回滚线都要在曝光前确定。
正向切换式结果支持测试时间块下的短期市场政策效应。数周后的运力均衡、骑手学习和留存仍需额外证据。相关动态会影响决策时,再做持续区域放量或长期保留组,比较其方向和量级是否与切换实验一致,并持续监控边界泄漏。
个体实验与聚类实验结果不一致时,不要把两者平均成一个数。LinkedIn 的公开元实验显示,这种差异可能正是干扰信号。需要重新核对两种估计目标、聚类泄漏、分配健康和功效,再判断哪种设计更接近全量上线。
高质量示范回答
“我会先明确因果问题:目标市场全部采用新派单算法后,固定准入条件下每个合格订单的完成配送会变化多少。准入定义要在派单前记录,处理不能改变自己的分母;每个已分配订单都跟踪到统一成熟窗口。
订单级随机在这里会失效。实验组订单可能抢到唯一合适的骑手,改变对照组的等待和完成;骑手移动又把影响带过区域和时间边界。我会使用实验前匹配和移动数据建立干扰图,把跨区匹配和骑手流动强的相邻区域合并,并用预注册指标检查聚类间污染。24 个区域如果最终只形成少数连通市场,我会按实际独立单位规划,不会把标签数当成样本数。
派单代码可逆,所以第一候选是聚类切换式实验。每个连通市场聚类在一个时间块内统一运行一种算法,时间块在市场和周内时段层内随机,不能机械交替。窗口长度根据订单完成和骑手重新定位数据以及 A/A 排程模拟选择。短窗口增加单位,同时增加残留;长窗口减少泄漏,同时降低功效。若策略影响骑手数周行为,我会放弃快速切换,采用长期市场聚类放量。
主要分析按订单准入时计划运行的算法做意向治疗,降级和失败订单保留在原组。分配发生在市场时间块层级,所以功效和不确定性来自这些单位及其序列相关,不能用数百万订单制造虚假精度。我会在历史 A/A 数据上模拟排程,预先规定最小效应、时长和过渡规则,并在可行时使用基于设计的随机化推断。决策指标是每个合格订单,因此采用利用已知分配概率的设计一致加权估计,同时报告非加权的平均市场时间块效应。
读取提升前,我会检查层内分配平衡、真实策略曝光、降级和缺失、跨聚类匹配、骑手换区、结果成熟度与并行实验。主要结果是固定窗口内每个合格订单的完成配送,用户取消、超时、投诉、接驾等待,以及骑手收入、空闲和接单率都有预先定义的伤害边界。
效应超过最小业务门槛且所有护栏通过后,我会用持续区域放量验证短期结果能否经受学习和市场均衡变化。若残留仍很强、聚类太少无法识别目标效应,或个体与聚类估计冲突却找不到机制,我不会把用户级结果解释成全量上线效应,而会重新设计实验或缩小因果结论。”
常见错误
- 独立随机数百万订单 → 两组消耗同一运力,名义样本量掩盖干扰 → 随机包含主要交互的单位,或真实隔离产生干扰的资源。
- 只说“按聚类实验” → 地理边界未必能阻断骑手移动、社交互动、预算争夺或跨期残留 → 从真实机制与处理前数据建立干扰图。
- 默认采用 30 分钟切换窗口 → 方便的窗口可能短于配送和换区影响,也可能长于实际需要 → 估计残留,并用 A/A 数据和仿真校准候选排程。
- 机械交替两种策略 → 处理可能与高峰、星期或趋势重合 → 在预定义的市场和时间层内重新随机每个时间块。
- 把每个订单视为独立样本 → 分配发生在更粗的单位上,会低估不确定性并提高假阳性 → 按真实随机结构做功效与推断。
- 用非加权时间块均值代表每订单上线效应 → 时间块规模不同会改变目标人群 → 先定义估计目标,再采用明确权重的设计一致估计量。
- 看到结果后删除边界订单 → 按结果判断的排除会破坏随机比较 → 预先定义准入、过渡和成熟规则,并保留意向治疗分组。
- 把切换式实验当作通用答案 → 跨期残留、学习、低功效和共同时间冲击都会使结果偏差或变弱 → 根据条件选择长期聚类、饱和度或隔离宇宙。
- 只凭短期提升直接上线 → 市场均衡和骑手行为可能在持续放量后改变 → 使用分阶段长期放量和双边护栏复核。
追问及应对
追问一:24 个区域最终只形成 4 个独立市场怎么办?
4 个市场聚类无法给长期聚类实验提供足够信息,聚类内订单再多也不能弥补。如果效应衰减快,可以增加随机市场时间块,同时正确处理序列相关和跨期残留。若效应持续数周,只能采用更长的配对或分阶段市场放量、加强处理前协变量调整、用仿真降低运营风险,或等待更多独立市场。需要报告宽区间并缩小结论,不能把连通区域切碎来制造独立性。
追问二:新策略会改变骑手数周的行为怎么办?
快速切换会估计当前策略和历史处理的混合效应,不适合长期目标。改用长期聚类分配或随机分阶段放量,在完整行为周期中测量运力激活、供给时长、收入、留存和用户结果,并始终按市场分配。切换式实验仍可筛查即时算法效应,但无法替代长期实验。
追问三:如果测试的是社交分享功能,设计如何变化?
用处理前关系或互动边构建图。多数强连接位于聚类内部时,聚类随机更接近全网络统一处理与统一对照的差异。如果还要拆分直接效应和外溢效应,可以先把聚类分到不同处理饱和度,再在聚类内随机用户。预先定义“相关邻居中实验组占比”等曝光映射,并为社区重叠和更低功效留出空间。
追问四:干扰来源是可以拆分的广告预算怎么办?
把预算或库存拆成独立宇宙,每个策略只能使用自己的资源池。这样可以消除直接的预算蚕食,同时保留用户级分配并提高功效。仍需验证资源池不能相互借用、投放节奏和竞价不会重新连接两组,以及预算拆分能代表全量策略。隔离不完整时要测量泄漏并限制结论。
追问五:个体级实验与聚类实验的结果不一致怎么办?
先检查两者的分配、曝光、指标定义、成熟度和功效。再比较估计目标:个体实验测量混合环境下的处理,聚类实验让更多邻居共同处理,通常更接近全量上线。量化跨聚类边和处理密度,并在可能时使用预注册元实验或随机化检验。显著差异是需要调查的干扰证据,不能按提升更大的一组挑结果。
追问六:实践中如何选择切换窗口?
使用实验前数据或安全小流量试点,绘制策略切换后未完成订单、骑手位置偏移和关键指标的衰减。把多套随机排程放到 A/A 时段模拟,检查假阳性校准、方差和固定边界缓冲的敏感性。选择残留低于预注册容忍值且功效仍足够的最短窗口,再对相邻窗口和过渡规则做敏感性分析。