Topik wawancara representatif

Wawancara Data Science: Bagaimana Cara Menilai Kalibrasi Probabilitas?

DataSedang
Tim Redaksi Offer.ccDipublikasikan Diperbarui

Pertanyaan

Sebuah model fraud menghasilkan probabilitas risiko dari 0 hingga 1 untuk setiap transaksi. Bisnis ingin menggunakan nilai 0.8 sebagai ambang batas (threshold) tinjauan manual. Jelaskan cara menilai kalibrasi, memisahkan ranking dari kualitas probabilitas, memilih metode kalibrasi, dan menangani ketidakseimbangan kelas (class imbalance), drift, serta batasan kapasitas tinjauan.

Konteks dan pertanyaan

Sebuah model fraud menghasilkan probabilitas risiko dari 0 hingga 1 untuk setiap transaksi. Bisnis ingin menggunakan nilai 0.8 sebagai ambang batas (threshold) tinjauan manual. Jelaskan cara menilai kalibrasi, memisahkan ranking dari kualitas probabilitas, memilih metode kalibrasi, dan menangani ketidakseimbangan kelas (class imbalance), drift, serta batasan kapasitas tinjauan.

Pertanyaan wawancara machine learning publik tahun 2026 dari PracHub secara eksplisit menanyakan tentang kalibrasi model, diagram reliabilitas, ECE, Brier score, dan pemilihan threshold. Dokumentasi scikit-learn menyediakan batasan implementasi untuk kalibrasi, diagram reliabilitas berbasis bin, dan data kalibrasi independen. Pertanyaan ini tidak terikat pada perusahaan tertentu.

Apa yang dinilai oleh pewawancara

Jawaban rata-rata akan mengatakan "periksa accuracy atau AUC." Jawaban yang kuat mendefinisikan probabilitas secara tepat: di antara kasus-kasus yang diprediksi mendekati 0.8, tingkat positif jangka panjang seharusnya mendekati 0.8. Jawaban tersebut kemudian memisahkan reliabilitas, diskriminasi, base rate, dan threshold bisnis, serta menjelaskan mengapa model dengan AUC tinggi masih bisa mengalami overconfident.

Pewawancara juga memeriksa pemisahan data yang bebas kebocoran (leakage-free splits), set kalibrasi yang representatif, jumlah observasi yang cukup per bin, dan pemeriksaan biaya pasca-kalibrasi. Kalibrasi tidak membuat model menjadi lebih cerdas; kalibrasi membuat skor dapat diinterpretasikan pada skala probabilitas.

Pertanyaan klarifikasi

  • Keputusan apa yang menggunakan probabilitas tersebut? Ranking mungkin memerlukan AUC dan top-k; alokasi kapasitas atau keputusan kerugian yang diharapkan (expected-loss) memerlukan kalibrasi.
  • Kapan label matang (mature)? Konfirmasi fraud mungkin tertunda, sehingga jendela evaluasi harus menunggu hingga label matang.
  • Apakah tingkat positif online cocok dengan data pelatihan? Sampling, pembobotan, dan perubahan waktu mengubah prior serta memerlukan evaluasi target-distribution atau koreksi prior.
  • Apakah setiap segmen harus memiliki probabilitas yang dapat dipercaya? Sistem berisiko tinggi harus memeriksa irisan wilayah, saluran, dan produk karena kalibrasi agregat dapat menyembunyikan kesalahan lokal.
  • Berapa kapasitas tinjauan dan biaya kesalahan? Threshold adalah keputusan bisnis, bukan output otomatis dari kurva kalibrasi.

Jawaban 30 detik

"Pertama-tama saya memastikan apakah probabilitas mendorong keputusan tinjauan dan menunggu hingga label matang. Kalibrasi berarti kasus-kasus yang diprediksi pada 0.8 memiliki tingkat positif teramati mendekati 0.8. Pada data yang independen dari pelatihan dan representatif untuk produksi, saya membuat diagram reliabilitas serta melaporkan jumlah bin, ECE, dan log loss; Brier adalah skor komposit dan tidak dapat membuktikan kalibrasi secara mandiri. Saya memilih threshold berdasarkan biaya dan kapasitas tinjauan, memastikan kualitas ranking tetap stabil, memeriksa segmen, dan memantau drift prior serta kalibrasi dari waktu ke waktu. Untuk miskalibrasi, saya mulai dengan penskalaan sigmoid; jika data cukup dan bentuknya non-linear, saya mencoba isotonik, dan saya tidak pernah memasang (fit) kalibrator pada prediksi data pelatihan."

Jawaban langkah demi langkah

Langkah 1: Memisahkan kalibrasi dari ranking

DimensiKalibrasi probabilitasRanking atau diskriminasi
PertanyaanApakah probabilitas prediksi sesuai dengan tingkat yang teramati?Apakah positif berada di peringkat lebih tinggi dari negatif?
Alat tipikalDiagram reliabilitas, ECE, log loss, dekomposisi BrierROC-AUC, PR-AUC, top-k lift
Penggunaan bisnisKerugian yang diharapkan, kapasitas tinjauan, tingkatan risikoMemilih kasus mana yang harus diproses terlebih dahulu
Kegagalan tipikalProbabilitas terlalu tinggi sementara ranking tetap baikRanking baik tetapi 0.8 tidak memiliki makna yang dapat dipercaya

Kalibrasi biner mengharuskan sampel yang diprediksi mendekati p memiliki frekuensi positif teramati mendekati p. AUC hanya bergantung pada urutan peringkat, dan transformasi probabilitas monotonik dapat mempertahankan AUC, sehingga AUC tidak dapat menggantikan pemeriksaan kalibrasi.

Langkah 2: Plot reliabilitas dan laporkan ketidakpastian

Bagi probabilitas prediksi ke dalam bin, lalu hitung rata-rata prediksi dan tingkat positif teramati di setiap bin. Buat plot rata-rata prediksi pada sumbu x dan tingkat positif pada sumbu y; kalibrasi sempurna berada di dekat garis diagonal. Tampilkan jumlah data setiap bin atau histogram agar bin skor tinggi yang berukuran kecil tidak diinterpretasikan secara berlebihan.

python
from sklearn.calibration import CalibrationDisplay
from sklearn.metrics import log_loss

display = CalibrationDisplay.from_predictions(
    y_true=y_cal,
    y_prob=p_cal,
    n_bins=10,
    strategy="quantile",
)
loss = log_loss(y_cal, p_cal)

Batasan bin bukanlah kebenaran objektif: bin dengan lebar sama (equal-width) mungkin sebagian besar kosong dalam kondisi ketidakseimbangan parah, sedangkan bin kuantil mengubah rentang probabilitas per bin. Dengan observasi yang sedikit, tampilkan interval kepercayaan (confidence intervals), gabungkan bin yang jarang, atau gunakan metode binning teroptimalkan yang dapat direproduksi daripada hanya mempercayai satu garis.

Langkah 3: Pahami batasan ECE, Brier, dan log-loss

ECE biasanya menghitung selisih absolut terbobot antara rata-rata prediksi dan frekuensi teramati per bin. Metrik ini mudah dikomunikasikan tetapi bergantung pada jumlah dan aturan bin. Brier score adalah kuadrat kesalahan probabilitas, sedangkan log loss memberikan penalti berat pada prediksi salah yang percaya diri; keduanya mencampurkan reliabilitas dengan diskriminasi dan ketidakpastian hasil.

Oleh karena itu, "Brier lebih rendah berarti kalibrasi lebih baik" bukanlah kesimpulan yang valid. Gabungkan diagram, jumlah bin, komponen reliabilitas dari dekomposisi, dan log loss pada jendela waktu matang yang sama. Penelitian tentang diagram reliabilitas juga menunjukkan bahwa binning naif sensitif terhadap pilihan implementasi, jadi laporkan metode beserta ketidakpastiannya.

Langkah 4: Kalibrasi pada pemisahan data yang bebas kebocoran (leakage-free)

Prediksi pelatihan telah dilihat oleh model dasar, sehingga memasang kalibrator pada data tersebut akan menghasilkan pemetaan yang optimis. Urutan yang aman adalah: latih model dasar; pasang kalibrator pada probabilitas out-of-fold atau data held-out; evaluasi sekali pada data yang tidak terlibat dalam kedua proses pelatihan tersebut.

text
train: fit base model
calibration: fit calibrator on out-of-fold or held-out probabilities
test: evaluate calibration, ranking, and business threshold once

Gunakan pemisahan berbasis waktu untuk kasus label tertunda atau deret waktu (time-series); jangan mencampur informasi masa depan ke masa lalu. Set kalibrasi harus sesuai dengan tingkat positif produksi, distribusi fitur, dan jendela kematangan label, jika tidak, metrik tersebut hanya mengukur sampel pelatihan daripada probabilitas yang akan digunakan bisnis.

Langkah 5: Pilih metode kalibrasi dan threshold operasional

Penskalaan Sigmoid atau Platt memasang regresi logistik satu dimensi pada skor mentah dan stabil dengan data terbatas ketika kesalahan berbentuk mendekati huruf S. Regresi isotonik lebih fleksibel tetapi dapat mengalami overfitting ketika set kalibrasi kecil. Temperature scaling umum digunakan untuk logit multikelas dan tetap memerlukan validasi independen.

Kalibrasi menentukan skala probabilitas; threshold tetap menjadi keputusan bisnis. Jika peninjau hanya dapat memproses 2.000 kasus per hari, pilih threshold berdasarkan kapasitas, biaya false-positive, biaya false-negative, dan penundaan, daripada berasumsi bahwa nilai 0.8 bermakna secara otomatis. Validasi perubahan threshold dengan replay representatif dan batas pengaman (guardrails) online.

Langkah 6: Tangani ketidakseimbangan dan drift produksi

Oversampling, bobot kelas, dan focal loss dapat mengubah makna probabilitas dari suatu skor. Jika pelatihan memiliki tingkat positif 10% tetapi produksi memiliki 2%, ranking mungkin tetap stabil sementara probabilitas menjadi tidak terkalibrasi. Lakukan evaluasi ulang pada target prior, terapkan koreksi prior jika dibenarkan, atau lakukan kalibrasi ulang.

Setelah peluncuran, hitung reliabilitas bergulir (rolling reliability), ECE, log loss, dan tingkat positif, dengan irisan berdasarkan saluran, wilayah, dan tingkatan pelanggan. Musiman, perubahan kebijakan, dan penundaan label menyebabkan drift. Picu kalibrasi ulang saat kesalahan melebihi toleransi bisnis, segmen penting mengalami drift, atau prior bergeser melampaui ambang batas, menggunakan data baru dengan label yang matang.

Contoh jawaban berkualitas tinggi

"Pertama-tama saya menanyakan apakah probabilitas ini mendorong proses tinjauan, kapan label matang, dan apakah tingkat positif online cocok dengan sampel pelatihan. Kalibrasi berarti transaksi yang diprediksi mendekati 0.8 memiliki tingkat fraud jangka panjang mendekati 0.8. Set evaluasi harus independen, memperhatikan waktu, memiliki label yang matang, dan representatif untuk produksi.

Saya membuat diagram reliabilitas dengan jumlah bin dan interval kepercayaan, kemudian melaporkan ECE, log loss, dan Brier. Brier bukan bukti kalibrasi karena metrik ini juga mencakup diskriminasi. AUC menjawab masalah ranking, bukan apakah suatu probabilitas dapat dipercaya. Saya menggunakan sigmoid untuk kesalahan kecil yang mendekati bentuk S dan mencoba isotonik jika ada cukup data untuk pemetaan non-linear, tanpa pernah memasang kalibrator pada prediksi data pelatihan.

Terakhir, saya menetapkan threshold dari kapasitas tinjauan dan biaya kesalahan, memeriksa kalibrasi segmen, dan memantau reliabilitas label matang serta log loss dari waktu ke waktu. Model dengan AUC tinggi yang melebih-lebihkan risiko tetap tidak dapat memperlakukan 0.8 sebagai risiko nyata."

Kesalahan umum

  • Gejala → Menggunakan accuracy atau AUC untuk membuktikan probabilitas dapat dipercaya → Alasan gagal → Keduanya tidak membandingkan nilai prediksi dengan frekuensi teramati → Solusi → Gunakan diagram reliabilitas, jumlah data per bin, dan metrik kalibrasi.
  • Gejala → Memasang kalibrator pada prediksi pelatihan → Alasan gagal → Pemetaan menjadi overfit dan salah mengkalibrasi sampel baru → Solusi → Gunakan prediksi out-of-fold atau set kalibrasi independen.
  • Gejala → Hanya melaporkan satu angka ECE → Alasan gagal → ECE bergantung pada aturan binning dan observasi yang jarang → Solusi → Laporkan aturan bin, diagram, jumlah data, dan ketidakpastian.
  • Gejala → Memperlakukan 0.8 sebagai threshold hanya karena AUC tinggi → Alasan gagal → Urutan ranking yang baik tidak menjamin skala probabilitas yang benar → Solusi → Pilih threshold berdasarkan kapasitas dan biaya kesalahan.
  • Gejala → Mengabaikan pergeseran sampling dan base-rate → Alasan gagal → Kalibrasi menargetkan populasi pelatihan daripada produksi → Solusi → Evaluasi pada distribusi target dan pantau drift prior.

Pertanyaan lanjutan dan jawabannya

Bagaimana jika AUC tinggi tetapi diagram reliabilitas berbentuk huruf S?

Pertahankan ranking model dasar, pasang sigmoid atau isotonik pada data independen, dan evaluasi ulang kalibrasi, AUC, serta biaya bisnis. Kalibrasi monotonik biasanya mempertahankan urutan peringkat, tetapi pemisahan data dan implementasinya tetap perlu diuji.

Bagaimana jika label positif baru dikonfirmasi setelah 30 hari?

Tentukan jendela kematangan label dan evaluasi atau pasang kalibrator hanya pada data yang berusia setidaknya 30 hari. Data terbaru dapat memantau volume prediksi dan keterlambatan, tetapi tidak dapat diperlakukan sebagai negatif untuk penilaian reliabilitas.

Bagaimana jika berbagai wilayah memiliki kurva kalibrasi yang sangat berbeda?

Periksa ukuran sampel, definisi label, dan base rate terlebih dahulu. Kemudian pilih kalibrator global, kalibrator per segmen, atau threshold per segmen. Jika suatu segmen kekurangan data, gunakan pemetaan global yang stabil dengan pemantauan interval daripada memasang kurva independen yang bising (noisy).

Sumber publik

Pertanyaan terkait