代表的な面接トピック

データサイエンス面接:なぜトリートメント後変数の調整がA/Bテストにバイアスをもたらすのか?

データ難しい
Offer.cc 編集チーム公開日 更新日

質問

トリートメントによってユーザーがパネルをクリックするかどうかが変化する状況で、クリックしたユーザーのみを対象に購入を比較したいと考えています。どのような問題が生じる可能性があり、何を報告すべきですか?

設問と設定

クリックは割り当て後に観測され、トリートメントの影響を受けます。分析をクリックしたユーザーのみに限定することは、一見有用なサブグループ比較に見えるかもしれませんが、全体のトリートメント効果を識別していたランダム化を損なう可能性があります。

面接官が見ているポイント

  • トリートメント前のモデレーターとトリートメント後のメディエーター(媒介変数)の区別。
  • 因果グラフを用いた合流点(collider)バイアスおよび選択バイアスの説明。
  • プロダクトの意思決定に合致した推定対象(estimand)の選択。

回答前に確認すべき明確化のための質問

  • クリックは割り当て前、割り当て後、またはその両方で測定されていますか?
  • 意思決定の対象は全体的な影響ですか、遵守者(compliers)における効果ですか、それともパネルを経由するメカニズムですか?
  • クリックと購入の両方を予測するトリートメント前の変数は存在しますか?
  • クリックによるフィルタリングは実験前に計画され、有効な識別戦略によって裏付けられていましたか?

30秒の回答フレームワーク

観測されたクリックユーザーのみを対象とした購入の比較を、主要な結果として採用することはありません。クリックはトリートメント後のメディエーターであり、購入を予測する未観測の特性の影響も受けている可能性があります。これについて条件付けると、非因果的パスが開き、各群のランダム化が崩れる恐れがあります。割り当てられたすべてのユーザーに対するIntent-to-Treat(ITT)を報告し、事前定義された媒介分析や主要層別化(principal stratification)分析は、明示的な仮定を置いた上でのみ使用します。

ステップごとの詳細解説

1. 時間の順序を描く

割り当てがクリックに先行し、クリックが購入に先行します。ベースラインの特性は、クリックと購入の両方に影響を与える可能性があります。また、トリートメントもクリックに影響を与えるため、クリックユーザーのサブセットはトリートメントの下流にある変数によって選択されることになります。

2. 因果関係の問いを定義する

全体効果は、割り当てられた母集団全体にプロダクトをリリースした場合に何が起こるかを問うものです。メカニズムに関する問いは、パネルを経由してどれだけの効果が生じるかを問います。反応者(responder)に関する問いは、どちらの群であってもクリック行動が変わらないユーザーについて問います。これらは異なる推定対象です。

3. フィルタリングが破綻する理由を示す

クリックユーザーのサブセット内では、トリートメントによって誰がそのサブセットに含まれるかが変化したため、トリートメント群とコントロール群のユーザー間で潜在的な購入傾向が異なる可能性があります。元のランダム化は、割り当てられた母集団全体を保護するものであり、トリートメント後の任意の切り口を保護するものではありません。

4. 妥当な分析手法を選択する

リリースの判断基準となる推定量としてIntent-to-Treatを使用します。媒介分析を行う場合は、ベースライン共変量を事前に指定し、メディエーターとアウトカムの観測期間を定義し、メディエーターとアウトカム間の交絡に関する仮定を明記します。コンプライアンスに関する問いに対しては、仮定が妥当である場合に主要層別化や操作変数法を検討します。

5. 限界事項を伝える

全体的な推定値、群ごとのクリック率、および副次的な分析を個別に提示します。サンプルサイズが大きいから、あるいはクリックイベントが観測可能であるからという理由だけで、クリックユーザーの比較を因果関係と呼ぶべきではありません。どの結論が識別されており、どの結論が仮定に依存しているかを説明します。

質の高い回答例

「クリックは割り当て後に発生し、トリートメントによって変化するため、クリックユーザーに絞り込むことはメディエーターで条件付けることになります。これにより、トリートメント群とコントロール群で異なる潜在的購入傾向が選択され、ランダム化による保護が崩れる可能性があります。私はリリースの意思決定にはIntent-to-Treatを使用し、クリック率と全体的な購入効果を提示した上で、メカニズムや反応者の分析は副次的なものとして扱います。媒介分析や主要層別化の手法を使用する前に、因果グラフと仮定を事前に定義します。」

よくある間違い

  • クリックユーザーのみを比較する → トリートメントによって誰が含まれるかが変化する → Intent-to-Treatを主要な指標として維持する。
  • クリックをベースラインのセグメントと呼ぶ → 割り当て後に測定されている → 時間の順序を記録する。
  • 観測されたすべての行動を調整する → トリートメント後の条件付けはバイアスのパスを開く可能性がある → 正当なトリートメント前共変量を使用する。
  • 大規模なサブグループを因果関係として扱う → 精度が高くても識別可能性は回復しない → 推定対象と仮定を明記する。

フォローアップの質問と回答

それでもクリックユーザーの結果を報告することはできますか?

はい。記述的であるか、あるいは仮定に依存することを明示した副次的な結果として報告することは可能です。観測されたクリックユーザー内での関連性としてラベル付けし、フィルターによって各群の構成がどのように変化するかを示します。

回帰分析でクリックを単にコントロールするだけではいけないのですか?

回帰調整によってトリートメント後変数がトリートメント前変数になるわけではありません。トリートメント効果の一部を遮断してしまったり、未観測の原因がクリックと購入の両方に影響を与えている場合に合流点(collider)バイアスを生じさせたりする可能性があります。

プロダクトの意思決定が明確にクリックユーザー向けである場合はどうすればよいですか?

どちらの群であってもクリックするユーザーなど、ターゲットを主要層(principal stratum)として定義し、その仮定を正当化できる識別手法を使用します。観測されたクリックユーザーがそのままその層になるわけではありません。

公開情報ソース

関連する質問