代表的な面接トピック

データサイエンス面接:ネットワーク干渉(Network Interference)が存在する環境下でA/Bテストをどのように設計するか?

データ難しい
Offer.cc 編集チーム公開日 更新日

質問

あるオンデマンド配送マーケットプレイスが、24の運営ゾーン全体で新しい配車アルゴリズムをテストしたいと考えています。トリートメント群の注文は、本来コントロール群の注文に割り当てられるはずだった配達員を奪う可能性があり、配達員は隣接するゾーン間を移動できます。アルゴリズムを市場全体にロールアウトした場合の効果を推定するための実験をどのように設計しますか?

質問と背景

あるオンデマンド配送マーケットプレイスが、24の運営ゾーン全体で新しい配車アルゴリズムをテストしたいと考えています。トリートメント群の注文は、本来コントロール群の注文に割り当てられるはずだった配達員を奪う可能性があり、配達員は隣接するゾーン間を移動できます。アルゴリズムを市場全体にロールアウトした場合の効果を推定する実験を設計してください。推定対象(estimand)、ランダム化単位、波及効果(spillover)および持ち越し効果(carryover)の制御、検出力計算、分析、ガードレール指標、そしてローンチ判断について説明してください。

24のゾーン、介入内容、および運用上の詳細は面接ケース用の前提条件であり、実際のプラットフォームに関する事実ではありません。アルゴリズムは可逆的(切り戻し可能)であり、実験サービスによって選択可能であると仮定してください。スイッチバックのウィンドウやウォッシュアウト期間を最初から仮定してはならず、注文や配達員のダイナミクスから正当化する必要があります。

これは、データサイエンティスト、実験科学者、エコノミスト、プロダクトアナリスト向けの難関な実験設計の問題です。ある公開面接問題ページでは、ネットワーク実験を高難度のデータサイエンスおよびデータアナリストのケースとして分類し、出題日を2026年4月7日と記録しています。LinkedInはソーシャルネットワークの干渉を検出するためのクラスター実験を文書化しています。DoorDashは配車に関する地域・時間単位のスイッチバックを文書化しており、2025年のマーケットプレイス広告の事例では、リソースを隔離できる場合に持ち越し効果や低検出力によってスイッチバックが不適切な選択肢となり得る理由を説明しています。ICLR 2026の論文では、クラスターランダム化ネットワーク実験におけるバイアスと分散のトレードオフが継続して研究されています。これらを総合すると、本テーマの現在の代表性と技術的妥当性が裏付けられます。ただし、特定の企業がこの質問を出題する頻度を証明するものではなく、特定企業の問題として帰定する根拠にはなりません。

最も重大な失敗は、注文単位でランダム化し、2つのユーザーレベルの平均を比較してしまうことです。アルゴリズムは共有された配達員プールへのアクセスを変化させるため、ある注文のトリートメントが別の注文の結果を変えてしまう可能性があります。これは、通常のA/Bテストの解釈を支える無干渉仮定(no-interference condition)に違反します。優れた回答では、まず関心のある効果を定義し、トリートメントが空間と時間をどのように伝播するかをマッピングした上で、割り当て、推定量、不確実性の計算、およびロールアウトの判断がその問いと整合するように設計します。

面接官が評価しているポイント

第1に、候補者が因果推論上の問いを定義できるか?「トリートメント群がコントロール群に勝っているか?」という問いは不完全です。プロダクトの意思決定は、新アルゴリズムを市場全体に適用した場合の効果に関わるものであり、周囲が混在した状態で1つの注文をトリートメントした場合の直接効果とは異なる可能性があります。

第2に、候補者が干渉をメカニズムとして説明できるか?共有配達員は注文間の競合を生み出し、配達員の移動は隣接ゾーンを接続し、進行中の配達や行動の変化は時間を超えた持ち越し効果を生み出します。これらのエッジ(結合要因)を特定せずに単に「ネットワーク効果」と呼ぶだけでは、設計を決定できません。

第3に、単に「クラスターランダム化」と暗記的に答えるのではなく、複数の設計から適切に選択できるか?地理的クラスターはアーム間の競合を減らしますが、独立した単位の数が少なくなる可能性があります。スイッチバックは地域・時間の単位を増やしますが、持ち越し効果によるバイアスを受ける可能性があります。2段階飽和設計(two-stage saturation designs)は、ソーシャルグラフにおける直接効果と波及効果を分離できます。希少な予算や在庫を実際に分割できる場合は、リソース分割によって隔離されたユニバースを作成できます。

第4に、候補者が割り当てと分析を整合させられるか?トリートメントが少数の市場・時間ブロックに割り当てられている場合、何百万件の注文があっても何百万もの独立した観測値にはなりません。検出力、重み付け、標準誤差、およびランダム化チェックは、設計における単位と割り当て確率を反映していなければなりません。

最後に、誤解を招く結果を候補者が棄却できるか?優れた回答では、リフト(効果量)を読み取る前に、割り当て、実曝露、境界をまたぐ移動、持続性、並行実験、およびメトリクスの成熟度を検証します。また、スイッチバックが短期的なポリシー効果を推定するものであり、長期的な均衡や配達員の学習された行動に関する主張を裏付けることはできない状況を明確に述べます。

質問すべき明確化のための質問

  • どの効果が意思決定の基準となるか? 目標は、すべてのゾーンが新ポリシーを使用した場合の対象注文あたりの効果か、市場・時間ブロックあたりの平均効果か、トリートメント注文への直接効果か、それとも非トリートメント注文への波及効果か?推定量と重み付けはこの選択に依存します。
  • 干渉はどこを通って伝播するか? 1人の配達員が複数のゾーンを担当できるか?境界を越えて注文をマッチングできるか?価格設定、インセンティブ、バッチ処理、またはキューの優先順位もゾーン間を結合しているか?この回答が干渉グラフを定義します。
  • トリートメントはどのくらいの期間、その後の結果に影響を与えるか? 割り当て、ピックアップ、完了、配達員の再配置、および供給への復帰時間の分布はどうなっているか?コードパスが可逆的であっても、マーケットプレイスの状態が即座に可逆的であるとは限りません。
  • 独立した市場はいくつ存在するか? 24のゾーンは個別の労働力プールなのか、それとも密接に結びついた4つの都市の区分なのか?24のラベルがあっても、実質的には有用な地理的クラスターが4つしか存在しない場合もあります。
  • 希少リソースを隔離できるか? 予算、候補在庫、またはクォータは、独立したプールに分割できるか?配達員を複製することは通常できないため、配車においてリソース・ユニバースのランダム化は実行不可能な場合があります。
  • プライマリアウトカムと分母は何か? 対象注文あたりの完了配達数、ピックアップ時間、配達員の稼働率、総予約額は、それぞれ異なる問いに答えるものです。トリートメントがキューへの登録や完了を変化させる前に、対象資格(eligibility)を確定させておく必要があります。
  • どのような遅延型および2サイドのガードレールが重要か? 候補となるガードレールには、キャンセル数、配達遅延、アクティブ時間あたりの配達員報酬、アイドル時間、受託率、顧客からの苦情、ゾーン間の移動による偏りが含まれます。
  • 同じ市場を変更している並行ポリシーは何か? プロモーション、価格設定、天候対応、その他の配車実験が割り当てと相互作用する可能性があります。ブロッキング、除外、または明示的な要因配置計画が必要になる場合があります。
  • どのような割り当てログおよび曝露ログが存在するか? 設計上の失敗とプロダクトの効果を区別するために、予定されていたバリアント、実際のアルゴリズム、市場クラスター、時間ブロック、注文の対象資格発生時刻、配達員の遷移、フォールバック、およびアウトカムの成熟度が必要です。

30秒の回答フレームワーク

「私はまず、対象市場全体が新しい配車ポリシーを使用した場合の対象注文あたりの変化として推定対象(estimand)を定義します。トリートメントとコントロールが同じ配達員を奪い合うため、注文レベルのランダム化は無効です。移動とマッチングのグラフを構築し、境界を越えるトラフィックが多いゾーンを結合した上で、ポリシーが可逆的であるため、ランダム化されたクラスター×時間のスイッチバックを検討します。ブロックと固定の遷移ウィンドウは、デフォルトの期間ではなく、観測された持ち越し効果に基づいて設定します。過去のクラスター・ブロックの分散と自己相関から検出力を計画し、割り当てスケジュールを用いたITT(intention to treat)分析を行い、注文あたりの推定対象とクラスター設計に合致する推定量および不確実性評価手法を採用します。リフトを読み取る前に、割り当て、実際の曝露、汚染、メトリクスの成熟度を検証します。完了率が改善し、顧客および配達員のガードレールをクリアした場合にのみ、持続的な地域ロールアウトを通じてリリースします。長期的な学習や解消されない波及効果がある場合は、代わりにより長期のクラスターロールアウトを採用します。」

ステップごとの詳細解説

ステップ1:バケットを選択する前に対象となる推定対象を定義する

目標とする対比を言葉で記述します。「どちらのポリシー下でも対象となる注文について、対象市場内のすべてのユニットが現在のアルゴリズムではなく新しいアルゴリズムに従った場合、プライマリアウトカムはどのように変化するか?」。これが完全ロールアウト時のポリシー効果です。

干渉が存在する場合、注文のアウトカムは自身の割り当てと周囲の割り当てに依存します。混在市場でのユーザーレベルのテストは、主に部分飽和下での直接効果を推定するものであり、全トリートメント対全コントロールの対比と等しくなるとは限りません。ビジネスが直接効果と波及効果の両方を求めている場合は、単一のトリートメント対コントロールの差が両方を識別することを期待するのではなく、それらを個別の推定対象として定義します。

ポリシーが影響を与える前に対象資格を固定します。例えば、リクエストの妥当性、サービスエリア、および配車前に記録されたタイムスタンプから対象注文を定義します。「対象注文あたりの完了配達数」のようなアウトカムは、失敗や未マッチングの注文も保持します。「完了したトリートメント注文の平均配達時間」はトリートメント後のイベントを条件としており、困難な注文をドロップするポリシーが見かけ上速く見える原因になります。

ステップ2:「ネットワーク効果」を干渉マップに落とし込む

運用データとプロダクトのルールからエッジを作成します。

  • 重複する時間帯に同じ配達員を奪い合う場合、注文同士が接続されます。
  • ゾーンをまたぐマッチングや配達員の移動によって、ゾーン同士が接続されます。
  • 割り当てられた配達が完了していない間、または配達員が移動したままの状態である間、時間ブロック同士が接続されます。
  • 価格設定、バッチ処理、インセンティブ、または別の実験が同一のキャパシティを変更する場合、ポリシー同士が接続されます。

このマップには実験前のデータを使用します。トリートメントによって生じた行動からクラスターを構築してはなりません。提案された各境界を越えるマッチングと配達員の遷移の割合を定量化します。有用なクラスタリングとは、検出力のための十分なクラスター数を維持しながら、ほとんどの強いエッジをクラスター内に保持するものです。LinkedInが公開しているアプローチでも、同様のトレードオフが明示されています。クラスター数を増やすとランダム化単位が増加し、クラスターサイズを大きくするとトリートメントとコントロール間をまたぐエッジが減少します。

このマップは、設計によって隔離できないアウトカムを特定することにも役立ちます。配達員が日常的にすべてのゾーン境界を越えている場合、ゾーンレベルの割り当ては接続された市場に単にラベルを付け替えているだけにすぎません。チームは、時間経過に伴う都市全体レベルでのランダム化、独立した持続的市場の利用、またはより弱い因果関係の主張を受け入れる必要があるかもしれません。

ステップ3:メカニズムに照らして実験設計を比較する

個別のベルヌーイランダム化は名目上のサンプルサイズが大きく、ユニットが相互に影響を与えない場合に有用です。トリートメントの注文が共有キャパシティを消費してコントロールを汚染するため、今回の配車ポリシーには不適切です。

持続的な地理的クラスターランダム化は、十分に隔離された市場クラスター内のすべての対象トラフィックを、実験全体を通じて単一のポリシーに割り当てます。急速な切り替えよりも長期の持ち越し効果や行動学習にうまく対応できますが、24のゾーンがわずか数個の接続された市場に集約されてしまう可能性があります。その場合、バランス、検出力、一般化が困難になります。

クラスター化されたスイッチバックランダム化は、接続された地理的クラスターを一定の時間ブロックの間単一のポリシーに割り当て、将来のブロックを再度ランダム化します。重要な効果が測定可能な期間内に減衰する可逆的な配車アルゴリズムに適しています。DoorDashが公開している配車設計で地域・時間単位を使用しているのはこのためです。より多くの実験単位を作成できますが、未完了の注文、再配置された配達員、または変化した行動が持続する場合、隣接するブロック同士は依然として接続されたままになります。

2段階または飽和ランダム化は、まずネットワーククラスターをトリートメントの飽和レベルに割り当て、次にその中のメンバーを割り当てます。近隣の曝露によってアウトカムがどのように変化するかを特定でき、ソーシャル機能や紹介機能に有用です。ある特定の時点で単一の配車ポリシーが同一の共有配達員プールを管理しなければならない場合、この手法はより複雑で不自然になります。

隔離ユニバース(isolated-universe)ランダム化は、干渉の原因となるリソース自体を分割します。DoorDashの2025年の広告の例では、バリアント同士がお互いの予算を消費しないようにキャンペーン予算を分割しています。リソースが分割可能であり、各ユニバースが正常に動作できる場合、これはスイッチバックよりも強力な手法となり得ます。同一の配達員が2つの独立したプールに属しているかのように見せかけても、有効な解決策にはなりません。

提示されたケースでは、主要な効果が十分に速く減衰することを確認した後にのみ、クラスター化されたスイッチバックを選択します。密接に接続された隣接ゾーンを市場クラスターにグループ化し、市場クラスター×時間ブロックの単位でランダム化します。効果に数週間にわたる配達員の学習や持続的な再配置が含まれる場合は、代わりに持続的なクラスターロールアウトを使用します。

ステップ4:スイッチバックスケジュールと遷移ルールの設計

実験前の注文の有効期間、配達員の遷移、および運用シミュレーションから持ち越し効果を推定し、A/Aデータを使用して候補スケジュールをテストします。ブロックは関連する状態の大部分が解消されるのに十分な長さである必要がありますが、ブロックを短くすると単位数が増え、通常は検出力が高くなります。地域のサイズも同じトレードオフを生み出します。地域を大きくすると空間的な漏洩は減少しますが、独立した単位の数が減少します。

市場クラスター、曜日、時間帯などの事前指定された層(strata)内で各ブロックをランダム化します。決定論的にトリートメントとコントロールを交互に配置してはなりません。固定されたシーケンスは需要のトレンドと一致してしまう可能性があるためです。シーケンスのバランスを取り、重要な時間帯に特定のクラスターが1つのバリアントしか受け取らない状態を防ぎます。

アウトカムが判明する前に遷移を定義します。プライマリ分析では、すべての対象注文をその対象資格発生時刻に予定されていたポリシーに帰属させ、完了(maturity)まで追跡します。プロトコルで境界のウォッシュアウトを使用する場合は、その期間をスケジュールによって固定し、両方のアームから除外し、変更された推定対象を説明し、その損失を検出力に含めます。アウトカムを確認した後に「汚染されていそうな」注文を削除してはなりません。

事前に宣言されたコンパクトな割り当てレコードは次のようになります。

text
experimental unit = market cluster × time block
assignment = randomized within market cluster × time-of-week stratum
eligibility time = recorded before dispatch policy selection
primary outcome = completed delivery within the fixed maturity horizon per eligible order
primary estimand = full-rollout effect per eligible order
transition rule = fixed before exposure; no outcome-based exclusions

ステップ5:注文数ではなく有効単位数から検出力を計画する

過去のA/A期間または再現された割り当てスケジュールを使用して、クラスター・ブロック間の分散、市場内の系列相関、共通の時間ショック、不均等なトラフィック、および計画されている共変量調整を推定します。提案されたスケジュールを何度も再ランダム化し、現実的な持ち越し効果の前提の下で、事前指定された最小効果をどのくらいの頻度で検出できるかを測定します。

有効サンプルサイズは、ブロック内にネストされた配達の単純な数ではなく、独立した割り当て情報によって決定されます。ブロックを短縮すると単位数は増えますが、持ち越し効果のバイアスが増加します。クラスターを拡大すると空間的な漏洩は減少しますが、単位数が減少します。検出力計画では、このバイアスと分散のトレードオフ曲線を提示し、運用コストに見合う最小の効果量を選択すべきであり、有意性を保証するスケジュールを探索すべきではありません。

期間、割り当て比率、停止ルール、およびトリートメント前の共変量のみを使用した分散削減手法を事前に指定します。利用可能なクラスターで意思決定に値する最小効果を特定できない場合は、ローンチ前にその限界を明示します。膨大な注文数があっても、実質4つしかない独立市場を補うことはできません。

ステップ6:設計と推定対象に沿って分析する

ランダム化されたスケジュールに基づくITT(intention to treat)割り当てを使用します。コンプライアンスと実際のアルゴリズムへの曝露は個別に報告します。フォールバックした注文をトリートメント群から削除してはなりません。割り当てが変更される単位であるため、診断はクラスター・ブロックレベルで集約します。

重み付けを推定対象に一致させます。クラスター・ブロック間の非加重平均は、平均ブロック効果を推定します。意思決定の対象がロールアウト下での対象注文あたりの効果であり、クラスターサイズが異なる場合は、既知の割り当て確率に基づいた設計と整合性のあるHorvitz-Thompson型またはHájek型の推定量を使用し、その対象母集団を明示します。推定対象を無断で変更するのではなく、平均ブロック効果は副次的な視点として報告します。

不確実性の評価には、実行可能であれば実際の割り当てスキームに対するランダム化推論(randomization inference)を優先します。モデルベースの代替手法を採用する場合は、市場内の反復観測、系列依存性、共有された時間ショック、および層別化を考慮する必要があります。すべての注文を独立として扱うと、人為的に狭い信頼区間が生成されてしまいます。推定値、信頼区間、意思決定に値する最小効果、および事前指定された遷移ルールに対する感度を報告します。

効果検証の前に健全性チェックを実行します。

  1. 各層内の予定されたトリートメント比率とバランス
  2. 割り当ての持続性と実際のアルゴリズム曝露
  3. アームごとの対象注文率、フォールバック率、欠損イベント率
  4. クラスター間をまたぐマッチングと配達員の移動
  5. アウトカムの成熟度と遅延キャンセル
  6. 並行する実験およびポリシーの重複
  7. 同一パイプライン下でのA/Aによる偽陽性率のキャリブレーション

ステップ7:結果をロールアウト判断に結びつける

対象注文あたりの固定期間内の完了配達数など、配車目標に結びついたプライマリアウトカムを1つ選択します。キャンセル、遅延、苦情率、ピックアップ待ち時間などの顧客向けガードレールを追加します。配達員向けガードレールには、アクティブ時間あたりの報酬、アイドル時間、受託率、安全でない作業負荷の集中などが含まれます。曝露前に損失許容マージンとロールバックの閾値を定義します。

スイッチバックの良好な結果は、テストされたブロック条件下での短期的な市場ポリシー効果を裏付けるものです。数週間にわたる均衡供給、配達員の学習、継続率を捉えきれていない可能性があります。これらのダイナミクスが重要な場合は、持続的な地域ランプアップ(段階的展開)またはホールドアウトを実施します。スイッチバックとの方向性と大きさを比較し、境界を監視し、ガードレールや汚染が事前に宣言された制限を超えた場合は展開を停止します。

クラスター実験と個別実験の結果が一致しない場合、それらを1つの数値に平均化してはなりません。LinkedInが公開したメタ実験が示しているように、その差異は干渉の証拠となり得ます。どちらの設計が完全なロールアウトに適合しているかを判断する前に、それぞれの推定対象、クラスター漏洩、割り当ての健全性、および検出力を再確認します。

質の高い模範解答

「私はまず因果推論上の問いを明確にすることから始めます。ローンチの意思決定基準は、対象市場全体が新しい配車アルゴリズムを使用した場合の『対象注文あたりの完了配達数の変化』です。これは、近隣の注文がコントロール群に留まっている状態で単一の注文をトリートメントすることとは異なります。トリートメントが自身の分母を改善してしまわないよう、配車前に対象資格を定義し、割り当てられたすべての注文を固定の成熟期間まで追跡します。

このケースでは注文レベルのランダム化は無効です。トリートメントされた注文が唯一の適切な配達員を確保することで、コントロール注文の待ち時間や完了を変化させる可能性があり、配達員の移動によってその影響がゾーン境界やその後の時間帯へと波及するためです。実験前のマッチングおよび移動データを使用して干渉グラフを構築し、クラスター間のマッチングと配達員の移動が事前に宣言した診断閾値を下回るまで隣接ゾーンを結合します。24のゾーンが少数の接続された市場に集約される場合は、24の独立したクラスターが存在すると主張するのではなく、その事実を明示します。

配車コードは可逆的であるため、私の第1候補はクラスター化されたスイッチバックです。接続された各市場クラスターは、ランダム化された時間ブロックの間、単一のアルゴリズムを受け取ります。決定論的に交互配置するのではなく、市場および曜日・時間帯の層内でブロックをランダム化します。ウィンドウの長さは、注文の完了および配達員の再配置データとA/Aスケジュールのシミュレーションから決定します。短いウィンドウはより多くの単位を提供しますが持ち越し効果を高め、長いウィンドウは漏洩を減らしますが検出力を失います。ポリシーが配達員の行動を数週間にわたって変化させる場合は、スイッチバックを不採用とし、持続的な市場レベルのロールアウトを使用します。

プライマリ分析は、注文の配車前の対象資格発生時刻に予定されていたアルゴリズムを用いたITT(intention to treat)で行います。フォールバックや割り当て失敗も元のアームに保持します。割り当ては市場・ブロックレベルで行われるため、検出力と不確実性は数百万の注文からではなく、それらの単位と系列依存性から導き出されます。過去のA/Aデータで提案スケジュールをシミュレーションし、最小効果量、期間、遷移ルールを事前指定し、実行可能な場合は設計ベースのランダム化推論を使用します。決定指標は対象注文あたりであるため、既知の割り当て確率を用いた設計と整合性のある加重推定量を使用し、加重なしの平均市場・ブロック効果も併せて報告します。

リフトを読み取る前に、層内のトリートメントバランス、実際のポリシー曝露、フォールバックおよびイベント欠損率、クラスター間マッチング、配達員の遷移、アウトカムの成熟度、重複する実験をチェックします。プライマリアウトカムは、対象注文あたりの固定期間内の完了配達数とします。顧客のキャンセル、遅延、苦情、ピックアップ待ち時間、および配達員の報酬、アイドル時間、受託率には、事前に損失許容マージンを設定しておきます。

推定値が最小有用効果とすべてのガードレールをクリアした場合、短期的なスイッチバックの結果が学習や均衡の変化を経ても維持されるかを検証するため、持続的な地域ランプアップを実施します。持ち越し効果が重大なままである場合、計画された効果に対してクラスター数が少なすぎる場合、または個別実験とクラスター実験の推定値が明確なメカニズムなしに乖離している場合は、ユーザーレベルの結果をロールアウト効果として提示しません。実験を再設計するか、因果関係の主張範囲を狭めます。」

よくある間違い

  • 数百万の注文を独立してランダム化する → トリートメントとコントロールが同じ配達員供給を消費するため、名目上のサンプルサイズが干渉を覆い隠してしまう → 主要な相互作用を含む単位をランダム化するか、リソース自体を隔離する。
  • エッジを定義せずに「クラスターを使用する」と述べる → 地理的区分だけでは配達員の移動、社会的相互作用、予算の競合、時間の持ち越し効果を内包できない場合がある → 実際のメカニズムとトリートメント前のデータから干渉マップを構築する。
  • 標準的な30分のスイッチバックを安易に選択する → 便宜的なウィンドウは、配達や再配置の影響よりも短いか、必要以上に長い可能性がある → 持ち越し効果を推定し、A/Aデータとシミュレーションを用いて候補スケジュールをキャリブレーションする。
  • バリアントを決定論的に交互配置する → トリートメントがピーク時間帯、平日、またはトレンドと一致してしまう可能性がある → 事前指定された時間および市場の層内でブロックを再ランダム化する。
  • すべての注文を独立したものとしてカウントする → 割り当てはより粗い単位で行われるため、不確実性が過小評価され過度の確信を生む → 検出力と推論の根拠を実際のランダム化構造に置く。
  • 加重なしのブロック平均を注文あたりのロールアウト効果として報告する → ブロックサイズが不均等な場合、対象母集団が変化する → 推定対象を定義し、明示的な重み付けを伴う設計と整合した推定量を使用する。
  • 結果を見た後に境界の注文を除外する → アウトカムに基づく除外はランダム化された比較を破壊する → 対象資格、遷移の処理、成熟度を事前宣言し、ITT割り当てを維持する。
  • スイッチバックを普遍的に堅牢なものとして扱う → 持ち越し効果、学習、低検出力、共通の時間ショックがスイッチバックを無効化または弱体化させる可能性がある → 前提条件がより適合する場合は、持続的クラスター、飽和抽出、または隔離ユニバースを使用する。
  • 短期的なリフトだけでリリースを判断する → 持続的なロールアウトの下では、マーケットプレイスの均衡や配達員の行動が変化する可能性がある → 段階的な持続的ランプアップと2サイドのガードレールで検証する。

フォローアップ質問と回答

フォローアップ1:24のゾーンが実質4つの独立市場に集約される場合はどうするか?

4つの市場クラスターでは、持続的なクラスター実験を行うための情報が乏しく、その中に多数の注文が存在しても解決にはなりません。効果が急速に減衰する場合は、系列依存性と持ち越し効果がモデル化されていることを前提として、ランダム化された市場・時間ブロックを繰り返すことで情報量を増やせる可能性があります。効果が数週間にわたる場合、誠実な選択肢は、より長期のペア化または段階的な市場ロールアウト、トリートメント前の強力な共変量調整、運用リスクに対するシミュレーション、あるいはより多くの独立市場が利用可能になるのを待つことです。広い不確実性を報告し主張を限定すべきであり、接続されたゾーンを分割して独立性を人為的に作り出してはなりません。

フォローアップ2:トリートメントによって配達員の行動が数週間にわたって変化する場合はどうするか?

急速なスイッチバックは現在のポリシーと過去の履歴の混合物を推定することになり、長期的な効果を測定するための設計としては不適切です。持続的なクラスター割り当てまたはランダム化された段階的ロールアウトを使用し、行動変化の全期間にわたって稼働率、供給時間、報酬、継続率、および顧客アウトカムを測定し、割り当ては市場レベルに維持します。スイッチバックは依然として即時のアルゴリズム効果のスクリーニングには役立ちますが、長期的な実験を代替することはできません。

フォローアップ3:ソーシャル共有機能の場合、設計はどのように変わるか?

トリートメント前の関係性またはインタラクションのエッジからグラフを構築します。クラスターランダム化は、ほとんどのエッジがクラスター内に留まる場合、ネットワークにおける全トリートメント対全コントロールの対比を近似できます。直接効果と波及効果の両方を含めることが目的である場合、クラスターを異なるトリートメント飽和レベルにランダム化し、次にクラスター内のユーザーをランダム化します。関連する近隣ユーザーのトリートメント比率などの曝露マッピングを事前に指定し、コミュニティ間の重複や検出力の低下をあらかじめ織り込んで計画します。

フォローアップ4:干渉経路が分割可能な広告予算である場合はどうするか?

予算または在庫を独立したユニバースに分割し、各バリアントにそのプールへの排他的なアクセス権を与えます。これにより、ユーザーレベルの割り当てを維持しながら直接的な共食い(カニバリゼーション)が排除され、検出力を向上させることができます。プール間での貸し借りができないこと、配信ペース制御(pacing)やオークションがそれらを再結合しないこと、および分割が完全ロールアウト時のポリシーを代表していることを検証します。隔離が不完全な場合は漏洩を測定し、因果関係の主張を限定的なものに留めます。

フォローアップ5:個人レベルの実験とクラスターレベルの実験の結果が一致しない場合はどうするか?

まず、両方の実験で割り当て、曝露、メトリクス定義、成熟度、および検出力を検証します。次に推定対象を比較します。個人レベルのテストは混在環境でのトリートメントを測定するのに対し、クラスターテストはより多くの近隣を同時に動かすため、完全なロールアウトをより適切に近似している可能性があります。クラスター間のエッジと飽和度を定量化し、可能であれば事前指定されたメタ実験またはランダム化検定を使用します。有意な差があることは干渉を調査するための証拠であり、単にリフトが大きい方を選択するための理由にしてはなりません。

フォローアップ6:実際にはスイッチバックウィンドウをどのように選択するか?

実験前データまたは安全なパイロット運用を使用して、ポリシー遷移後の未完了注文、配達員の移動、および主要メトリクスの減衰をプロットします。A/A期間で複数のランダム化スケジュールをシミュレーションし、偽陽性のキャリブレーション、分散、および固定された境界バッファへの感度を測定します。検出力が十分保たれている中で、残存する持ち越し効果が事前宣言された許容範囲内に収まる最も短いウィンドウを選択し、隣接するウィンドウや遷移の選択肢に対して感度分析を実行します。

公開情報ソース

関連する質問