Topik temu duga representatif

Bagaimanakah Anda Mendiagnosis Sample Ratio Mismatch dalam Ujian A/B?

DataSederhana
Pasukan Editorial Offer.ccDiterbitkan Dikemas kini

Soalan

Satu ujian A/B menggunakan penetapan pengguna 50/50 yang stabil. Selepas 100,000 pengguna yang layak, kawalan mempunyai 51,000 pengguna dan rawatan mempunyai 49,000; papan pemuka melaporkan peningkatan penukaran sebanyak 1.8% dengan nilai p di bawah 0.01. Adakah anda akan melancarkan (ship) rawatan tersebut? Terangkan cara anda mengesan, mendiagnosis, membaiki, dan mencegah Sample Ratio Mismatch.

Gesaan dan Konteks yang Berkenaan

Satu eksperimen produk menggunakan penetapan rawak yang stabil mengikut pengguna dengan pembahagian 50/50 yang dikonfigurasikan. Selepas 100,000 pengguna yang layak, analisis mengandungi 51,000 pengguna kawalan dan 49,000 pengguna rawatan. Penukaran rawatan adalah 1.8% lebih tinggi, dan ujian kesan biasa melaporkan nilai p di bawah 0.01. Tentukan sama ada keputusan tersebut boleh dipercayai dan reka bentuk proses untuk mengesan, mendiagnosis, membaiki, dan mencegah Sample Ratio Mismatch, atau SRM.

Soalan ini terpakai kepada peranan sains data, analitik produk, kecerdasan perniagaan (BI), dan platform eksperimentasi. Panduan temu duga peranan data semasa Amazon secara jelas memerlukan statistik, menangani data yang tidak jelas (ambiguous), dan mengubah analisis menjadi keputusan yang boleh diambil tindakan. Penyelidikan eksperimentasi Microsoft menganggap SRM sebagai isyarat kebolehpercayaan teras. Kategori utama ialah data: tugas utamanya ialah ujian statistik dan diagnosis salasilah data (data lineage), bukannya mereka bentuk keseluruhan platform eksperimentasi.

Nilai 100,000, 51,000, 49,000, dan 1.8% ialah andaian temu duga, bukan penanda aras industri. Penyelesaian ini mengandaikan pengguna ialah unit rawak dan setiap pengguna harus muncul dalam tepat satu varian. Eksperimen sebenar yang dirawakkan mengikut peranti, akaun, ruang kerja (workspace), isi rumah, atau wilayah mesti menguji unit yang sepadan.

Perkara yang Dinilai oleh Penemu Duga

Isyarat pertama ialah sama ada calon memeriksa integriti eksperimen sebelum membaca impak perniagaan. Jawapan yang lemah melihat "peningkatan 1.8% dengan nilai p di bawah 0.01" dan mengesyorkan pelancaran. Jawapan yang kukuh terlebih dahulu mengesahkan bahawa populasi yang diperhatikan sepadan dengan penetapan yang dikonfigurasikan. Ujian kesan boleh menyatakan bahawa dua hasil yang diperhatikan berbeza; ia tidak dapat membuktikan bahawa pengguna yang tinggal dalam kumpulan tersebut masih membentuk sampel rawak yang boleh dibandingkan.

Isyarat kedua ialah sama ada perbezaan nisbah yang ketara diterjemahkan menjadi ujian statistik. Pembahagian 51/49 yang sama membawa maksud yang sangat berbeza dengan 1,000 pengguna berbanding dengan 100,000 pengguna. Ujian SRM membandingkan bilangan varian yang diperhatikan dengan bilangan yang diimplikasikan oleh peruntukan yang dikonfigurasikan. Lebih banyak data menjadikan sisihan sistematik yang kecil lebih mudah dibezakan daripada faktor kebetulan.

Isyarat ketiga ialah liputan diagnostik. SRM boleh berlaku melalui konfigurasi peruntukan, identiti yang tidak stabil, pelaksanaan varian, telemetri yang hilang, penapisan bot, percantuman data (data joins), atau syarat analisis yang ditakrifkan selepas rawatan. Menganggap setiap SRM sebagai "kerawakan yang buruk" terlepas banyak kegagalan pelaksanaan dan pemprosesan data yang biasa berlaku.

Akhir sekali, penemu duga mencari disiplin dalam membuat keputusan. SRM ialah satu gejala, bukannya hingaran (noise) tidak berbahaya yang dikeluarkan secara automatik oleh pembobotan (weighting). Dalam kes yang pernah diterbitkan, rawatan mengubah penglibatan sehingga penapis bot menyingkirkan lebih ramai pengguna yang sangat aktif; kesimpulan perniagaan berbalik selepas kecacatan tersebut diperbaiki. Sehingga punca utama difahami, tangguhkan keputusan pelancaran dan bukannya mencari metrik lain yang kekal signifikan.

Soalan untuk Dijelaskan Sebelum Menjawab

  • Adakah 50/50 menggambarkan penetapan, pendedahan (exposure), pencetusan (triggering), atau populasi analisis akhir? Penetapan mungkin bersih sementara pendedahan, kelayakan, atau analisis hiliran mengalami SRM. Uji setiap peringkat.
  • Apakah unit rawak? Jika penetapan adalah mengikut ruang kerja, bilangan ahli boleh berbeza secara semula jadi. Uji bilangan ruang kerja terlebih dahulu dan analisis hasil dengan kaedah yang sesuai untuk penetapan berkelompok (clustered assignment).
  • Adakah identiti stabil dan saling eksklusif? Log masuk rentas peranti, pemadaman kuki, penggabungan akaun tanpa nama kepada akaun berdaftar, dan penghijrahan ID boleh menetapkan semula atau menduplikasi seseorang.
  • Adakah peruntukan berubah semasa eksperimen dijalankan? Peningkatan (ramp) daripada 10/90 kepada 50/50 memerlukan kiraan jangkaan daripada setiap selang, bukan pembahagian akhir yang digunakan pada keseluruhan eksperimen.
  • Bagaimanakah "pengguna yang layak" ditakrifkan? Syarat yang dipengaruhi oleh rawatan, seperti mengklik butang baharu yang hanya ada pada rawatan, ialah pemilihan pasca rawatan dan boleh memusnahkan kebolehbandingan.
  • Bolehkah satu varian mengubah hala (redirect), gagal, atau mencatat log secara berbeza? Pemuatan yang lebih perlahan, ranap sistem (crashes), dan telemetri khusus versi boleh menyingkirkan pengguna semasa pelaksanaan dan pengumpulan.
  • Saluran paip (pipelines) manakah yang menghasilkan kiraan akhir? Asingkan penetapan, pendedahan, pengumpulan peristiwa, penyahduplikasian, penapisan bot, percantuman dimensi, dan tetingkap metrik.
  • Bolehkah eksperimen dijalankan semula? Jika pembinaan semula tanpa pincang (unbiased) daripada log mentah adalah mustahil, membetulkan kecacatan dan menjalankan semula eksperimen adalah lebih wajar daripada memaksa kesimpulan daripada sampel semasa.

Rangka Kerja Jawapan 30 Saat

"Saya tidak akan melancarkannya. Dengan peruntukan 50/50, kiraan jangkaan ialah 50,000 bagi setiap kumpulan. Statistik khi-kuasa dua ialah (51,000 - 50,000)² / 50,000 + (49,000 - 50,000)² / 50,000 = 40; dengan satu darjah kebebasan, nilai p adalah kira-kira 2.54 × 10^-10. Oleh itu, populasi akhir mengalami sample ratio mismatch yang teruk, jadi nilai p kesan perniagaan bukanlah bukti untuk pelancaran. Saya akan membandingkan kiraan pada peringkat penetapan, pendedahan, pencetus, pemprosesan log, dan analisis akhir, kemudian membahagikan mengikut masa, platform, versi, dan jenis identiti untuk mencari titik pencapahan pertama. Selepas membaiki puncanya, saya akan menjalankan semula semakan SRM, telemetri, dan A/A; jika sampel tidak dapat dibina semula tanpa pincang, saya akan menjalankan semula eksperimen tersebut."

Jawapan Terperinci Langkah demi Langkah

Mulakan dengan get keputusan yang jelas: eksperimen mesti melepasi semakan perawakan, integriti data, dan kesan perniagaan. Jalankan SRM sebelum analisis kesan dan paparkannya secara ketara dalam platform eksperimentasi. Amalan Microsoft yang diterbitkan menggunakan p < 0.0005 sebagai ambang amaran konservatif untuk mengurangkan positif palsu pada skala platform. Itu ialah contoh yang didokumentasikan, bukan pemalar sejagat. Pasukan harus memilih ambang kualitinya lebih awal dan bukannya selepas melihat keputusan.

Langkah 1: Kira SRM dengan betul.

Bagi dua varian yang dikonfigurasikan pada 50/50 dengan 100,000 jumlah pengguna, setiap kiraan jangkaan ialah 50,000. Statistik khi-kuasa dua kebagusan suaian (goodness-of-fit) ialah:

χ² = Σ (observed - expected)² / expected = 40

Dengan dua kumpulan dan tiada parameter anggaran tambahan, terdapat satu darjah kebebasan, memberikan nilai p kira-kira 2.54 × 10^-10. Ini jauh di bawah ambang integriti konservatif dan tidak munasabah sebagai hingaran peruntukan biasa. Penghampiran khi-kuasa dua memerlukan kiraan jangkaan yang mencukupi; peraturan NIST yang biasa ialah kira-kira lima pemerhatian jangkaan bagi setiap kumpulan. Sampel yang sangat kecil, peruntukan yang jarang, atau banyak varian yang jarang (sparse) memerlukan ujian binomial atau multinomial yang tepat.

Nisbah mesti ditafsirkan bersama saiz sampelnya. Jika jumlahnya ialah 1,000 dan bilangannya ialah 510/490, kiraan jangkaan ialah 500/500, χ² = 0.4, dan nilai p adalah kira-kira 0.527. Nisbah 51/49 yang kelihatan adalah serupa, tetapi buktinya tidak sama.

Langkah 2: Cari peringkat pertama di mana kiraan mula mencapah.

Bina corong peringkat yang mengekalkan kiraan unit rawak unik mengikut varian:

PeringkatSoalanPunca lazim
PenetapanAdakah pencincangan (hashing) dan konfigurasi menghasilkan pembahagian yang dijangkakan?Peruntukan salah, perubahan salt, ID tidak stabil, pertindihan
PendedahanAdakah pengguna yang ditetapkan menerima varian yang dimaksudkan?Kegagalan pelaksanaan (deployment), cache, pengalihan hala, klien tidak tersedia
PencetusBolehkah kelayakan diketahui sebelum rawatan?Pengelogan khusus varian, rawatan mengubah kebarangkalian pencetus
Pemprosesan logAdakah kedua-dua varian memasuki jadual fakta secara sama rata?Peristiwa hilang, penyahduplikasian buruk, penapis bot, percantuman tercicir
AnalisisAdakah pertanyaan (query) mengekalkan semantik penetapan?Penapis pasca rawatan, tetingkap tidak sama rata, pengecualian tidak konsisten

Jika penetapan sudah tidak seimbang, periksa konfigurasi eksperimen, kod pengelompokan (bucketing code), dan ID perawakan. Jika penetapan bersih tetapi pendedahan mencapah, periksa kegagalan pemuatan, ranap sistem, dan pengalihan hala khusus varian. Jika populasi yang tidak dicetuskan adalah bersih tetapi "pengguna yang melawat checkout" tidak bersih, tentukan sama ada pencetus dipengaruhi oleh rawatan atau tiada dalam kawalan. Jika hanya jadual fakta akhir yang mencapah, tumpukan pada penapisan, penyahduplikasian, dan percantuman.

Langkah 3: Kenal pasti punca mengikut masa dan segmen.

Plot kiraan kumulatif yang diperhatikan dan dijangkakan mengikut jam dan cari masa jurang mula berlaku. Ketakselanjaran (discontinuity) yang tiba-tiba menunjukkan perubahan konfigurasi, penggunaan, atau saluran paip. Sisihan yang stabil dari permulaan eksperimen lebih konsisten dengan kecacatan pengelompokan atau pencetus. Segmenkan mengikut platform, pelayar, versi aplikasi, geografi, status log masuk, jenis identiti, dan sumber trafik, sambil menunjukkan saiz segmen, arah, dan masa anomali pertama.

Pensegmenan ialah alat diagnostik, bukan usaha mencari subkumpulan yang secara kebetulan melepasi SRM. Banyak hirisan data secara semula jadi menghasilkan beberapa nilai p yang kecil. Hirisan yang berguna menyokong sesuatu mekanisme. Jika SRM tertumpu pada versi iOS lama dan log pendedahan rawatan hilang dalam versi tersebut, periksa penghantaran klien dan telemetri; jangan hanya mengecualikan iOS dan mengisytiharkan baki eksperimen sebagai boleh dipercayai.

Langkah 4: Sahkan semantik perawakan dan identiti.

Pengelompokan (bucketing) mestilah fungsi deterministik bagi ID perawakan yang stabil, ID eksperimen, dan salt tetap. Unit yang sama harus kekal dalam satu varian sepanjang eksperimen. Periksa:

  1. Sama ada satu unit rawak muncul dalam pelbagai varian.
  2. Sama ada ID tanpa nama ditetapkan semula apabila digabungkan ke dalam ID akaun.
  3. Sama ada pembersihan kuki atau penggunaan rentas peranti mewujudkan "pengguna baharu" yang berulang.
  4. Sama ada peraturan pekerja, bot, dan pengecualian digunakan secara konsisten di sekitar penetapan.
  5. Sama ada setiap konfigurasi ramp mempunyai cap masa berkuat kuasa yang boleh diaudit.

Bagi perawakan ruang kerja atau isi rumah, uji bilangan kelompok terlebih dahulu. Varian rawatan boleh menerima beberapa ruang kerja yang besar secara rawak dan menunjukkan nisbah baris ahli 51/49 tanpa kecacatan pengelompokan. Menganggap baris ahli sebagai sampel rawak bebas akan menghasilkan penggera palsu.

Langkah 5: Audit pemilihan pasca rawatan dan data yang hilang.

Pencetus yang sah harus ditentukan daripada maklumat yang tersedia sebelum rawatan sebaik mungkin. "Mencapai checkout" boleh ditakrifkan melalui pendedahan halaman yang direkodkan dalam kedua-dua varian. "Mengklik butang kupon rawatan baharu" tidak mempunyai pemerhatian yang setara dalam kawalan dan secara semula jadi memilih lebih ramai pengguna rawatan. Prestasi rawatan juga boleh mengubah kelengkapan telemetri; penapis bot, tamat masa (timeout), dan ralat boleh menyingkirkan pengguna yang paling terkesan dengan perubahan tersebut.

Jangan anggap pengguna yang hilang adalah rawak. Bandingkan log penetapan tak boleh ubah (immutable) dengan setiap jadual hiliran, ambil sampel ID yang hilang, dan periksa platform, masa, versi, dan tingkah laku mereka. Jika rawatan mempengaruhi kebarangkalian pengguna untuk memasuki jadual analisis, perbezaan penukaran yang diperhatikan mengandungi pincang pemilihan (selection bias).

Langkah 6: Pilih pembaikan, pembinaan semula, atau pelaksanaan semula.

  • Peruntukan salah atau pengguna merentasi varian: hentikan, baiki penetapan, rawakkan semula, dan jalankan semula.
  • Penetapan dan pendedahan lengkap dengan keciciran ETL yang boleh diundur: baiki tugasan (job), bina semula daripada peristiwa mentah tanpa pincang, dan jalankan semula SRM.
  • Pencetus bergantung pada rawatan: gunakan syarat pra-rawatan atau kembali kepada populasi niat untuk merawat (intent-to-treat) yang tidak dicetuskan.
  • Telemetri yang diperlukan hilang dalam versi klien tanpa isian semula (backfill): betulkan instrumentasi dan jalankan semula untuk populasi sasaran tersebut.
  • Ramp peruntukan yang dirancang: jumlahkan kiraan jangkaan daripada setiap selang konfigurasi dan simpan sejarah konfigurasi.

Pembobotan hanya boleh dipertahankan apabila mekanisme pemilihan diketahui, boleh dianggarkan, dan disahkan secara bebas. Kebanyakan SRM memberi isyarat bahawa mekanisme kehilangan data tidak diketahui. Mendarabkan 49,000 pengguna rawatan dengan wajaran sehingga jumlahnya kelihatan seperti 50,000 tidak memulihkan tingkah laku pengguna yang hilang atau memulihkan perawakan.

Langkah 7: Bina pencegahan ke dalam platform eksperimentasi.

Simpan rekod penetapan tak boleh ubah, nisbah yang dikonfigurasikan, dan cap masa berkuat kuasa. Kira SRM secara berasingan untuk populasi yang ditetapkan, didedahkan, dicetuskan, dan dianalisis. Keputusan perniagaan tidak seharusnya mendorong keputusan pelancaran sehingga semakan integriti lulus. Jalankan ujian A/A secara berkala untuk mengesahkan bahawa pengelompokan, telemetri, dan analisis kekal bersih apabila tiada perbezaan produk wujud.

Amaran harus merangkumi jumlah saiz, kiraan yang diperhatikan dan dijangkakan, nilai p, arah, masa anomali pertama, dan segmen utama. Tingkatkan penelitian selepas perubahan pada penggunaan, identiti, pengesanan bot, atau ETL. Kekalkan salasilah (lineage) yang mencukupi selepas eksperimen tamat untuk menghasilkan semula kiraan jangkaan daripada konfigurasi sejarah dan bukannya hanya menyimpan imej papan pemuka.

Contoh Jawapan Berkualiti Tinggi

"Saya tidak akan melancarkannya kerana peningkatan 1.8% yang dilaporkan mengandaikan sampel rawak yang boleh dibandingkan. Di bawah pembahagian 50/50 yang dikonfigurasikan, 51,000 pengguna kawalan dan 49,000 pengguna rawatan mempunyai kiraan jangkaan sebanyak 50,000 setiap satu. Statistik khi-kuasa dua ialah 40 dengan satu darjah kebebasan, jadi nilai p adalah kira-kira 2.54 × 10^-10. Eksperimen ini mempunyai SRM, dan saya akan membekukan kesimpulan perniagaan.

Mula-mula saya akan mengesahkan bahawa pengguna ialah unit rawak sebenar dan 50/50 digunakan untuk keseluruhan tempoh larian. Kemudian saya akan membandingkan kiraan melalui penetapan, pendedahan sebenar, kelayakan pencetus, kemasukan jadual fakta peristiwa, dan analisis akhir. Peringkat mencapah yang pertama menentukan siasatan. SRM penetapan menunjukkan masalah konfigurasi, ID stabil, salt, atau keahlian rentas varian. Penetapan yang bersih tetapi pendedahan yang tidak seimbang menunjukkan masalah penggunaan, prestasi, ranap sistem, atau pengalihan hala. SRM khusus pencetus menunjukkan syarat yang bergantung pada rawatan. SRM jadual akhir menunjukkan masalah telemetri, penapisan bot, penyahduplikasian, atau percantuman.

Saya akan membahagikan mengikut masa, platform, versi aplikasi, geografi, status log masuk, dan jenis ID untuk mencari bukti bagi satu mekanisme, bukan untuk memilih subkumpulan yang bersih secara terpilih (cherry-pick). Jika peristiwa mentah tanpa pincang boleh membina semula populasi, saya akan membaiki saluran paip dan menjalankan semula setiap semakan integriti. Jika pengguna merentasi varian, pencetus bergantung pada rawatan, atau telemetri yang diperlukan tidak dapat dipulihkan, saya akan membaiki sistem dan menjalankan semula eksperimen.

Untuk pencegahan, platform harus menjalankan SRM sebelum mendedahkan hasil perniagaan, mengekalkan sejarah penetapan dan peruntukan yang tak boleh ubah, dan memantau kiraan penetapan, pendedahan, pencetus, dan analisis secara berasingan. Ujian A/A, pengelompokan yang stabil, dan pencetus pra-rawatan mengesahkan laluannya. Hanya selepas punca utama dijelaskan dan populasi yang dibaiki melepasi SRM barulah saya akan mempertimbangkan semula peningkatan 1.8% dan batas kawalannya (guardrails)."

Kesilapan Biasa

  • Melancarkan perubahan kerana nilai p hasil adalah kecil → Inferens kesan mengandaikan sampel yang boleh dibandingkan → Luluskan semakan SRM dan integriti data terlebih dahulu.
  • Hanya melihat peratusan 51/49 → Nisbah yang sama mempunyai bukti yang berbeza pada saiz sampel yang berbeza → Gunakan kiraan jangkaan dan ujian statistik.
  • Menganggap SRM hanya masalah nombor rawak → Pelaksanaan, log, dan penapis juga menyingkirkan pengguna → Jejak pencapahan pertama melalui laluan penuh.
  • Menunggu sehingga kiraan kelihatan lebih rapat → Lebih banyak data yang pincang tidak memulihkan perawakan → Bekukan keputusan dan buat diagnosis dengan segera.
  • Membuat pembobotan semula secara terus kepada 50/50 → Wajaran tidak memulihkan tingkah laku yang hilang secara sistematik → Betulkan hanya di bawah model kehilangan data yang disahkan.
  • Hanya menyemak jadual analisis akhir → Ia menyembunyikan sama ada penetapan atau pemprosesan hiliran yang gagal → Kekalkan kiraan pada setiap peringkat.
  • Mencetuskan berdasarkan tingkah laku rawatan sahaja → Kawalan tidak mempunyai peluang yang sama untuk memasuki sampel → Gunakan syarat pra-rawatan yang simetri.
  • Menguji baris ahli dalam eksperimen kelompok → Variasi saiz kelompok mewujudkan SRM palsu → Uji unit rawak sebenar terlebih dahulu.
  • Menggugurkan platform yang bermasalah selepas melihat keputusan → Pemilihan populasi post-hoc menambah kepincangan → Gunakan hirisan data untuk diagnosis dan jalankan semula populasi yang dirancang.
  • Menggunakan semula laporan kesan lama selepas pembaikan → Ia dikira daripada sampel yang rosak → Jana semula analisis integriti, kesan, dan batas kawalan.

Soalan Susulan dan Maklum Balas

Soalan susulan 1: Bagaimana jika pembahagian masih 51/49 tetapi jumlah sampel hanya 1,000?

Kiraan jangkaan ialah 500 setiap satu dan kiraan yang diperhatikan ialah 510 dan 490. Statistik khi-kuasa dua ialah (510 - 500)² / 500 + (490 - 500)² / 500 = 0.4, memberikan nilai p kira-kira 0.527 dengan satu darjah kebebasan. Itu bukan bukti yang mencukupi untuk SRM. Inilah sebabnya peraturan tetap "lebih daripada satu mata peratusan" tidak boleh menggantikan ujian statistik, walaupun kecacatan kejuruteraan yang diketahui masih perlu disiasat.

Soalan susulan 2: Penetapan keseluruhan melepasi SRM, tetapi pengguna iOS gagal. Bolehkah eksperimen masih digunakan?

Pertimbangkan bilangan hirisan, saiz sampel iOS, dan sama ada satu mekanisme menjelaskan anomali tersebut. Jika SRM tertumpu dalam versi iOS tertentu yang telah dipratentukan dan kehilangan pendedahan menjelaskannya, keputusan populasi tersebut tidak boleh dipercayai. Sama ada populasi lain kekal boleh digunakan bergantung pada pelan analisis dan pengasingan sebenar punca tersebut. Jangan gugurkan iOS hanya selepas melihat hasil; membetulkan klien dan menjalankan semula populasi sasaran yang dirancang adalah lebih selamat.

Soalan susulan 3: Populasi yang tidak dicetuskan adalah bersih, tetapi analisis yang dicetuskan mempunyai SRM. Apakah kemungkinan besar kesilapannya?

Periksa pencetus terlebih dahulu. Ia mungkin dilog dalam satu varian sahaja atau bergantung pada tingkah laku yang disebabkan oleh rawatan. Gantikannya dengan syarat yang boleh dipenuhi oleh kedua-dua kumpulan sebelum rawatan, seperti mencapai halaman dan bukannya mengklik komponen baharu. Bandingkan juga liputan telemetri pencetus. Kiraan tidak dicetuskan yang bersih mencadangkan penetapan asas mungkin baik, tetapi ia tidak mengesahkan analisis kesan yang dicetuskan.

Soalan susulan 4: Mengapa tidak membuat pembobotan semula kumpulan mengikut saiz yang diperhatikan?

SRM tidak mengenal pasti siapa yang hilang. Jika rawatan kehilangan pengguna yang paling aktif, paling tinggi penukarannya, atau paling mudah ranap, wajaran kiraan hanya memulihkan jumlah keseluruhan, bukan taburan tingkah laku. Pembetulan mungkin boleh dilakukan apabila kebarangkalian pemilihan dijelaskan sepenuhnya oleh pemboleh ubah pra-rawatan dan model tersebut disahkan, tetapi itu ialah andaian tambahan, bukan remedi lalai.

Soalan susulan 5: Ruang kerja dirawakkan 50/50, tetapi kiraan pengguna ialah 55/45. Adakah itu SRM?

Semak kiraan ruang kerja terlebih dahulu. Jika penetapan ruang kerja ialah 50/50 tetapi rawatan secara rawak menerima beberapa ruang kerja yang besar, ketidakseimbangan ahli boleh menjadi variasi saiz kelompok biasa dan bukannya kegagalan pengelompokan. Analisis hasil juga mesti mengambil kira pergantungan dalam ruang kerja. Jika trafik ahli yang seimbang diperlukan, gunakan penstrataan saiz atau perawakan berpadanan dalam reka bentuk eksperimen dan bukannya menganggap baris ahli sebagai penetapan bebas selepas itu.

Soalan susulan 6: Eksperimen meningkat daripada 10/90 kepada 50/50. Bagaimanakah anda mengira kiraan jangkaan?

Kira kiraan jangkaan dalam setiap selang peruntukan dan jumlahkannya. Jika 20,000 pengguna tiba di bawah 10/90 dan 80,000 di bawah 50/50, jumlah kiraan jangkaan ialah 42,000 dan 58,000, bukan 50,000 setiap satu. Gunakan konfigurasi dan masa berkuat kuasa yang aktif semasa penetapan; jangan sekali-kali menggunakan pembahagian akhir secara retroaktif untuk keseluruhan tempoh larian.

Sumber awam

Soalan berkaitan