プロンプトと状況設定
全体を集計した指標が、すべての重要なサブグループと矛盾しています。ここでのタスクは、セグメント構成比の不均衡、交絡因子、選択ルール、またはサンプリング誤差によってこの逆転が生じたのかどうかを判断し、統計的な修正を適用する前に対象となる推定量(estimand)を選択することです。
面接官が見ているポイント
- シンプソンのパラドックスを数学的な矛盾ではなく、集計による逆転現象として認識しているか。
- トリートメントの割り付け、セグメントのバランス、分母、および事前に規定された分析計画を確認しているか。
- 記述的な関連性と因果的な処置効果を区別できているか。
回答前の確認質問
- どのセグメントが処置前に定義され、どのセグメントが処置後に発見されたものですか?
- 割り付けはランダム化されていましたか?また、曝露率や欠損アウトカム率はバランスが取れていますか?
- 今回の決定は、母集団全体に関するものですか、ターゲットセグメントに関するものですか、それとも標準化後の施策効果に関するものですか?
- スパースなセル、重複ユーザー、または処置後変数による条件付けは存在しますか?
30秒の回答フレームワーク
分母を含めた集計テーブルおよびセグメント別テーブルを再現し、ランダム化と曝露のバランスを検証して、セグメント構成を変化させている変数を特定します。対象となる推定量(estimand)を事前に定義した上で、不確実性とともに標準化された効果または層別化された効果を報告します。ランダム化に不備があった場合は実験を再実行または修正し、セグメントが真の効果修飾因子である場合は、単一の代表的な数値に集約しないようにします。
ステップごとの詳細解説
1. 算術的計算の再構築
すべてのセグメントについて、トリートメント群のユーザー数、コントロール群のユーザー数、コンバージョン数、およびレートを表示します。集計されたレートは加重平均です。すべてのセグメントでトリートメント群が優勢であっても、重みが異なれば比較結果が逆転することがあります。ダッシュボードの分母として、インプレッション数、曝露されたユーザー数、割り当てられた全ユーザー数のどれが使用されているかを確認します。
2. 割り付けと曝露の監査
結果が観察される前に、トリートメント確率とセグメント比率を比較します。ロールアウトルール、デバイスの対象条件、地域、期間、ボット、欠損イベントを確認します。ベースラインのコンバージョン率が低いセグメントにトリートメント群が偏っている場合、セグメント内の効果が正であっても全体集計で劣る結果になることがあります。
3. 推定量(estimand)の定義
全体に対する ITT(intent-to-treat)効果は、母集団へのローンチに関する問いに答えます。セグメント固有の効果は、デバイスごとにトリートメントの効果が異なるかどうかの問いに答えます。標準化された効果は、選択されたターゲット母集団に合わせてセグメント固有の推定値の重みを再調整します。意思決定に必要な問いがどれであるかを明確にします。万能な調整方法は存在しません。
4. 是正策の選択
有効なランダム化と十分なサンプルサイズがある場合は、信頼区間を伴う層別化推定値または回帰調整推定値を報告し、交互作用を慎重に検定します。割り付けに偏りがある場合は、ランダム化を修正するか実験を再実行します。観察データの場合は、因果グラフを作成し、処置前の交絡因子のみを調整し、感度分析を伴う重み付けやマッチングを使用します。逆転を解消するためだけに処置後の中介変数を調整してはいけません。
5. ローンチ判断の伝達
不確実性やセグメントサイズとともに、集計値、セグメント別、標準化された推定値を併せて提示します。ターゲットとする推定量とリスク許容度がローンチを支持する場合にのみグローバルにローンチします。それ以外の場合は、セグメントごとの展開、データの追加収集、または一時停止を選択します。繰り返しのサブグループ探索によって偽陽性が膨らまないよう、分析計画を文書化します。
質の高い模範回答
「まず、トリートメント群とコントロール群の分母を用いて両方のレートを再構築し、割り付け、曝露、対象条件、欠損イベントのバランスを検証します。次に、重みの違いを引き起こしているセグメントを特定し、意図された母集団効果(intent-to-treat)が必要なのか、それともセグメント固有の効果が必要なのかを定義します。適切なランダム化が行われていれば、区間推定を伴う層別化および標準化された推定値を報告し、交互作用を確認します。不均衡がある場合は、実験を再実行または修正します。ローンチの検討資料にはすべての視点を提示し、処置後の調整や計画外のサブグループ探索は避けます。」
よくある間違い
- ダッシュボードの集計値を鵜呑みにする → 重み付けによってシグナルが逆転することがある → セグメントの分子、分母、重みを再計算する。
- セグメントの結果を自動的に因果関係と見なす → 割り付けや曝露にバイアスがある可能性がある → まずランダム化と欠損結果を監査する。
- 利用可能なすべての変数で調整する → 処置後バイアスが増大する可能性がある → 正当な理由のある処置前の交絡因子のみを調整する。
- ローンチを後押しする結果だけを選択する → 知らないうちに推定量(estimand)がすり替わる → 対象母集団と分析を事前に規定する。
フォローアップの質問と回答
シンプソンのパラドックスは常に問題となりますか?
いいえ。全体集計に対する問いと条件付きの問いが異なることを示しているに過ぎません。集計値がローンチに向けた正しい推定量である場合もあれば、セグメントごとの効果が適切なターゲティング判断となる場合もあります。問題となるのは、どちらを意図しているかを明示しないことです。
極端に小さいセグメントにはどのように対処しますか?
その不確実性を明示し、ノイズによる逆転を過剰に解釈しないようにします。階層モデルや事前に規定されたプーリングルールを検討し、セグメント固有の意思決定を行う前により多くの観測データを収集します。
セグメント変数が処置後に発生したものの場合はどうしますか?
主たる因果推定のためにその変数で条件付けをしてはいけません。記述的に報告するか、明確な仮定を置いた媒介分析を使用します。条件付けを行うと、合流点(collider)バイアスや媒介バイアスが生じる可能性があります。