प्रतिनिधि इंटरव्यू विषय

असंतुलित डेटा (Imbalanced Data) पर क्लासिफायर का मूल्यांकन करें

डेटाकठिन
Offer.cc संपादकीय टीमप्रकाशित अपडेट किया गया

प्रश्न

एक फ्रॉड क्लासिफायर 1% पॉजिटिव दर का सामना करता है और 99% सटीकता (accuracy) रिपोर्ट करता है। आप कैसे तय करेंगे कि यह काम करता है या नहीं और इसके प्रोडक्शन थ्रेशोल्ड का चयन कैसे करेंगे?

प्रश्न और इसका उपयोग कब करें

एक फ्रॉड क्लासिफायर का मूल्यांकन 100,000 ट्रांजैक्शन पर किया जाता है। इनमें से 1,000 फ्रॉड हैं, इसलिए पॉजिटिव दर 1% है। मॉडल 99% सटीकता (accuracy) रिपोर्ट करता है। एक समीक्षा टीम प्रति दिन अधिकतम 1,000 अलर्ट की जांच कर सकती है, और एक छूटे हुए फ्रॉड (missed fraud), एक गलत ब्लॉक (false block) और एक अलर्ट समीक्षा की लागत अलग-अलग होती है। तय करें कि क्या मॉडल उपयोगी है, एक प्रोडक्शन थ्रेशोल्ड चुनें, और ऑफलाइन मूल्यांकन तथा प्रोडक्शन मॉनिटरिंग योजना का वर्णन करें।

यह प्रश्न डेटा साइंस, मशीन लर्निंग इंजीनियरिंग और रिस्क भूमिकाओं के लिए उपयुक्त है। कार्य केवल उस मेट्रिक का नाम बताना नहीं है जो माना जाता है कि "असंतुलित डेटा के लिए अच्छा है।" एक उपयोगी उत्तर कन्फ्यूजन मैट्रिक्स, रैंकिंग गुणवत्ता, व्यावसायिक लागत, प्रोसेसिंग क्षमता और प्रायिकता गुणवत्ता (probability quality) को एक ऑपरेशनल निर्णय में बदल देता है। 1% पॉजिटिव दर, 100,000 वैलिडेशन उदाहरण और 1,000 की दैनिक क्षमता इंटरव्यू की धारणाएं हैं, सामान्य उद्योग स्थिरांक नहीं।

इंटरव्यूअर क्या मूल्यांकन कर रहा है

पहला संकेत यह है कि क्या उम्मीदवार एक्यूरेसी ट्रैप (accuracy trap) को पकड़ पाता है। प्रत्येक ट्रांजैक्शन को वैध (legitimate) भविष्यवाणी करने पर भी 99% एक्यूरेसी और शून्य रिकॉल मिलता है। केवल एक्यूरेसी को F1 से बदलना अधूरा है: F1 डिफ़ॉल्ट रूप से प्रिसिजन और रिकॉल को समान भार देता है और ट्रू नेगेटिव, समीक्षा क्षमता या असमान त्रुटि लागतों के बारे में कुछ नहीं कहता है।

दूसरा संकेत यह है कि क्या उम्मीदवार रैंकिंग को व्यावसायिक निर्णय से अलग करता है। AUROC और औसत प्रिसिजन (average precision) जैसे मेट्रिक्स थ्रेशोल्ड के पार रैंकिंग को संक्षेप में प्रस्तुत करते हैं; प्रोडक्शन सिस्टम को अभी भी एक ऑपरेटिंग पॉइंट चुनना होगा। एक मजबूत उत्तर एक ही कन्फ्यूजन मैट्रिक्स से प्रिसिजन, रिकॉल, फॉल्स-पॉजिटिव दर, अलर्ट वॉल्यूम और लागत की रिपोर्ट करता है, फिर बताता है कि चयनित थ्रेशोल्ड क्षमता में क्यों फिट बैठता है।

तीसरा संकेत लीकेज-मुक्त प्रयोग (leakage-free experimentation) है। मॉडल फिटिंग, प्रायिकता कैलिब्रेशन, थ्रेशोल्ड चयन और अंतिम मूल्यांकन को बार-बार समान लेबल का उपभोग नहीं करना चाहिए। एक मजबूत उत्तर क्रॉस-वैलिडेशन या एक अलग वैलिडेशन सेट पर थ्रेशोल्ड का चयन करता है, निर्णय स्थिर होने तक अंतिम टेस्ट सेट को अछूता छोड़ देता है, और वैलिडेशन तथा टेस्ट डेटा में प्रोडक्शन जैसे क्लास अनुपात को सुरक्षित रखता है।

चौथा संकेत यह है कि क्या उम्मीदवार लॉन्च के बाद विफलता का पता लगा सकता है। क्लास बेस रेट, पॉपुलेशन मिक्स, स्कोर वितरण और लेबल विलंब (label delay) सभी चयनित ऑपरेटिंग पॉइंट के परिणामों को बदल सकते हैं। मॉनिटरिंग योजना को एक ऑफलाइन स्कोर को स्थायी मानने के बजाय टाइम स्लाइस और महत्वपूर्ण सेगमेंट का उपयोग करना चाहिए।

उत्तर देने से पहले स्पष्ट करने योग्य प्रश्न

  • पॉजिटिव क्लास का क्या अर्थ है, और कौन सी त्रुटि अधिक महंगी है? फ्रॉड छूटने से आमतौर पर नुकसान होता है, जबकि एक फॉल्स पॉजिटिव समीक्षा लागत और उपयोगकर्ता घर्षण (user friction) दोनों को जोड़ सकता है। बीमारी की जांच करने या स्पैम को फ़िल्टर करने से अलग-अलग त्रुटि अर्थ और उद्देश्य उत्पन्न होंगे।
  • क्या मॉडल एक रैंकिंग स्कोर आउटपुट करता है या एक भरोसेमंद प्रायिकता? निश्चित क्षमता के तहत उच्चतम स्कोर वाले 1,000 मामलों को लेने के लिए मुख्य रूप से अच्छी रैंकिंग की आवश्यकता होती है। अपेक्षित मौद्रिक नुकसान की गणना के लिए एक कैलिब्रेटेड स्कोर की आवश्यकता होती है जिसे प्रायिकता के रूप में व्याख्यायित किया जा सके।
  • क्या समीक्षा क्षमता एक कठोर सीमा (hard ceiling) है या एक औसत बजट है? एक कठोर सीमा top-k, precision@k, और recall@k की ओर इशारा करती है। लोचदार (elastic) क्षमता विभिन्न थ्रेशोल्ड के वृद्धिशील लाभ और लागत की सीधी तुलना की अनुमति देती है।
  • लेबल प्राप्त करने में कितना समय लगता है? चार्जबैक को परिपक्व होने में हफ्तों लग सकते हैं। उसी दिन का प्रिसिजन तब अनुपलब्ध होता है, इसलिए टीम को बिना लेबल वाले अग्रणी संकेतकों (leading indicators) और परिपक्व-लेबल विंडो पर पुनर्गणना किए गए परिणाम मेट्रिक्स की आवश्यकता होती है।
  • क्या प्रोडक्शन में वैलिडेशन के समान पॉजिटिव दर है? प्रिसिजन बेस रेट के साथ बदलता है। यदि वैलिडेशन डेटा को ओवरसैंपल या अंडरसैंपल किया गया था, तो ऑपरेटिंग पॉइंट का मूल्यांकन फिर से उस डेटा पर किया जाना चाहिए जो प्रोडक्शन अनुपात को बनाए रखता है।
  • क्या त्रुटि लागत ट्रांजैक्शन मूल्य या उपयोगकर्ता सेगमेंट के अनुसार भिन्न होती है? उच्च मूल्य वाले फ्रॉड को छोड़ना कम मूल्य वाले फ्रॉड को छोड़ने के बराबर नहीं है। एक एकल वैश्विक थ्रेशोल्ड एक सेगमेंटेड नीति या प्रति-उदाहरण अपेक्षित-लागत निर्णय से पिछड़ सकता है।

30-सेकंड उत्तर रूपरेखा

"99% एक्यूरेसी परिणाम यह स्थापित नहीं करता है कि मॉडल काम करता है। प्रत्येक मामले को वैध के रूप में भविष्यवाणी करने पर भी सभी फ्रॉड छूटने के साथ 99% तक पहुंच जाता है। प्रोडक्शन बेस रेट वाले एक अलग वैलिडेशन सेट पर, मैं उम्मीदवार थ्रेशोल्ड के लिए TP, FP, FN और TN काउंट्स का निर्माण करूंगा, फिर प्रिसिजन, रिकॉल, फॉल्स-पॉजिटिव दर और अलर्ट वॉल्यूम की रिपोर्ट करूंगा। यदि टीम केवल 1,000 अलर्ट की समीक्षा कर सकती है, तो मैं शीर्ष 1,000 के लिए precision@k और recall@k का मूल्यांकन करूंगा; यदि लागत मापने योग्य है, तो मैं छूटे हुए मामलों, फॉल्स पॉजिटिव और समीक्षाओं की संयुक्त अपेक्षित लागत को कम करूंगा। AUROC और प्रिसिजन-रिकॉल या औसत प्रिसिजन रैंकिंग की तुलना करते हैं लेकिन ऑपरेटिंग पॉइंट का चयन नहीं करते हैं। मैं केवल मॉडल फिटिंग के बाहर के डेटा पर थ्रेशोल्ड और कैलिब्रेशन को ट्यून करूंगा, अंतिम टेस्ट सेट का एक बार उपयोग करूंगा, और प्रोडक्शन में बेस रेट, सेगमेंट, क्षमता और परिपक्व-लेबल परिणामों की निगरानी करूंगा।"

चरण-दर-चरण समाधान

चरण 1: नो-स्किल बेसलाइन और पूर्ण कन्फ्यूजन मैट्रिक्स स्थापित करें

प्रत्येक मामले को वैध के रूप में भविष्यवाणी करने पर 99,000 ट्रू नेगेटिव और 1,000 फॉल्स नेगेटिव प्राप्त होते हैं: 99% एक्यूरेसी और शून्य रिकॉल। यह बेसलाइन दर्शाती है कि 99% एक्यूरेसी केवल क्लास काउंट को दर्शाती है और यह साबित नहीं करती है कि मॉडल किसी फ्रॉड को खोजता है।

मान लीजिए कि दो उम्मीदवार थ्रेशोल्ड समान वैलिडेशन सेट पर ये परिणाम उत्पन्न करते हैं:

Score thresholdTPFPFNTNAlertsPrecisionRecallF1AccuracyFalse-positive rate
0.8070030030098,7001,00070%70%70%99.4%0.303%
0.508501,65015097,3502,50034%85%48.6%98.2%1.667%

थ्रेशोल्ड को 0.50 तक कम करने से 150 अतिरिक्त फ्रॉड पकड़े जाते हैं लेकिन 1,350 अतिरिक्त फॉल्स पॉजिटिव और 1,500 अतिरिक्त समीक्षाएं बनती हैं। 0.80 थ्रेशोल्ड में उच्च एक्यूरेसी और F1 है, जबकि 0.50 में उच्च रिकॉल है। ये अंतर किसी एक मेट्रिक को विजेता नहीं बनाते हैं; वे उस व्यावसायिक ट्रेड-ऑफ को उजागर करते हैं जिसे हल किया जाना चाहिए।

चरण 2: रैंकिंग, ऑपरेटिंग पॉइंट और प्रायिकता गुणवत्ता का अलग-अलग मूल्यांकन करें

AUROC की व्याख्या इस प्रायिकता के रूप में की जा सकती है कि एक रैंडम पॉजिटिव एक रैंडम नेगेटिव से ऊपर रैंक करता है, इसलिए यह थ्रेशोल्ड के पार रैंकिंग की तुलना करने के लिए उपयोगी है। गंभीर असंतुलन के तहत, ट्रू नेगेटिव की एक बड़ी संख्या एक छोटी फॉल्स-पॉजिटिव दर को हानिरहित दिखा सकती है, भले ही फॉल्स अलर्ट की पूर्ण संख्या बड़ी हो। इसलिए प्रिसिजन-रिकॉल कर्व और औसत प्रिसिजन इस बात का दृश्य जोड़ते हैं कि जारी किए गए कितने अलर्ट सही हैं और पॉजिटिव क्लास का कितना हिस्सा पुनर्प्राप्त किया गया है। PR मेट्रिक्स अभी भी व्यापकता (prevalence) पर निर्भर करते हैं, इसलिए डेटा वितरण के बिना उनकी तुलना नहीं की जानी चाहिए।

व्यावसायिक निर्णय एक थ्रेशोल्ड या top-k कटऑफ पर समाप्त होता है। 1,000 पर निश्चित क्षमता के साथ, 0.80 थ्रेशोल्ड 1,000 वैलिडेशन अलर्ट उत्पन्न करता है, जिससे precision@1000 70% और recall@1000 70% होता है। प्रोडक्शन वॉल्यूम और स्कोर वितरण बदलते हैं। एक अधिक विश्वसनीय क्षमता नीति प्रत्येक दिन मामलों को रैंक करती है, शीर्ष 1,000 लेती है, और यह मानने के बजाय कि 0.80 हमेशा समान संख्या उत्पन्न करेगा, लगातार दोनों मेट्रिक्स को मापती है।

कैलिब्रेशन तब मायने रखता है जब किसी स्कोर का उपयोग प्रायिकता के रूप में किया जाता है। एक कैलिब्रेटेड 0.8 का अर्थ होना चाहिए कि तुलनीय भविष्यवाणियों में से लगभग 80% पॉजिटिव हैं। विश्वसनीयता आरेख (Reliability diagrams) और Brier score जैसे स्कोर कैलिब्रेशन की जांच कर सकते हैं, और कैलिब्रेटर को स्वतंत्र डेटा या आउट-ऑफ-फ़ोल्ड भविष्यवाणियों पर फिट किया जाना चाहिए। एक निश्चित top-k नीति को मुख्य रूप से स्थिर रैंकिंग की आवश्यकता होती है और इसके लिए प्रत्येक स्कोर को पूरी तरह से कैलिब्रेट करने की आवश्यकता नहीं होती है। मौद्रिक अपेक्षित-लागत निर्णयों के लिए विश्वसनीय प्रायिकताओं की आवश्यकता होती है।

चरण 3: थ्रेशोल्ड चयन को लागत नियम में बदलें

मान लीजिए C_FN एक फ्रॉड छूटने की औसत लागत है, C_FP मैनुअल समीक्षा को छोड़कर एक फॉल्स पॉजिटिव की उपयोगकर्ता-घर्षण लागत है, और C_R एक अलर्ट की समीक्षा करने की लागत है। एक थ्रेशोल्ड पर वैलिडेशन लागत FN × C_FN + FP × C_FP + alert count × C_R है।

0.80 से 0.50 पर जाने से 150 छूटे हुए मामले बचते हैं लेकिन 1,350 फॉल्स पॉजिटिव और 1,500 समीक्षाएं जुड़ती हैं। इस परिदृश्य के तहत, थ्रेशोल्ड को कम करना केवल तभी सार्थक है जब 150 × C_FN > 1,350 × C_FP + 1,500 × C_R हो, जो C_FN > 9 × C_FP + 10 × C_R में कम हो जाता है। यह उदाहरण कन्फ्यूजन मैट्रिक्स से प्राप्त एक निर्णय सीमा है, कोई सार्वभौमिक स्थिरांक नहीं।

यदि 1,000 समीक्षाएं एक अनुलंघनीय सीमा (inviolable ceiling) है, तो 0.50 थ्रेशोल्ड सीधे प्रोडक्शन में नहीं जा सकता है, भले ही इसका अपेक्षित मूल्य अधिक हो। विकल्पों में केवल शीर्ष 1,000 की समीक्षा करना, एक उच्च-विश्वास और कम-जोखिम वाले उपसमूह को स्वचालित करना, या विभिन्न मूल्यों और सेगमेंट को अलग-अलग कतारों में भेजना शामिल है। प्रत्येक विकल्प के लिए एक नई क्षमता, उपयोगकर्ता-हानि और प्रतिवर्तीता (reversibility) विश्लेषण की आवश्यकता होती है।

चरण 4: बेस-रेट परिवर्तनों को ध्यान में रखें

प्रिसिजन मॉडल के व्यवहार के साथ-साथ पॉजिटिव दर पर भी निर्भर करता है। ट्रू-पॉजिटिव दर TPR, फॉल्स-पॉजिटिव दर FPR, और व्यापकता p को देखते हुए, प्रिसिजन TPR × p ÷ [TPR × p + FPR × (1 - p)] है।

0.80 थ्रेशोल्ड पर, उदाहरण TPR 70% है और FPR 0.303% है। 1% व्यापकता पर, सूत्र लगभग 70.0% प्रिसिजन देता है। यदि TPR और FPR अपरिवर्तित रहते हैं लेकिन व्यापकता घटकर 0.5% हो जाती है, तो प्रिसिजन गिरकर लगभग 53.7% हो जाता है। इसलिए ऑफलाइन टेस्ट डेटा को प्रोडक्शन जैसी बेस रेट बनाए रखनी चाहिए, और प्रोडक्शन मॉनिटरिंग को व्यापकता और सेगमेंट मिक्स को ट्रैक करना चाहिए। रीसॅम्पलिंग (Resampling) मॉडल प्रशिक्षण में मदद कर सकता है, लेकिन इसका कृत्रिम क्लास अनुपात मूल्यांकन वितरण नहीं बनना चाहिए।

चरण 5: लीकेज-मुक्त मूल्यांकन और प्रोडक्शन मॉनिटरिंग डिज़ाइन करें

प्रशिक्षण, वैलिडेशन और अंतिम टेस्ट डेटा को समय के अनुसार विभाजित करें, संबंधित उदाहरणों को विभाजन पार करने से रोकने के लिए आवश्यकता पड़ने पर उपयोगकर्ता, डिवाइस या इवेंट समूहीकरण जोड़ें। मॉडल को फिट करने के बाद, हाइपरपैरामीटर, कैलिब्रेशन और थ्रेशोल्ड चयन के लिए क्रॉस-वैलिडेशन या अलग वैलिडेशन डेटा का उपयोग करें। निर्णय स्थिर होने के बाद एक बार अंतिम टेस्ट सेट का मूल्यांकन करें। यदि कोई थ्रेशोल्ड-ट्यूनिंग टूल आंतरिक रूप से क्रॉस-वैलिडेशन का उपयोग करता है, तो सत्यापित करें कि यह उस सटीक मॉडल को फिट करने के लिए उपयोग किए गए उसी पूर्ण डेटा पर ट्यूनिंग नहीं कर रहा है।

प्रोडक्शन डैशबोर्ड को कम से कम दो स्तरों की आवश्यकता होती है। तत्काल स्तर स्कोर वितरण, अलर्ट काउंट, top-k कटऑफ, समीक्षा-कतार आयु, महत्वपूर्ण सेगमेंट और सिस्टम त्रुटियों को ट्रैक करता है। परिपक्व-लेबल स्तर precision@k, recall@k, FN लागत, FP लागत, कैलिब्रेशन त्रुटि और ऑफलाइन अपेक्षाओं से विचलन की पुनर्गणना करता है। थ्रेशोल्ड परिवर्तनों को समान लागत और क्षमता नियम का पुन: उपयोग करना चाहिए और एक आउट-ऑफ-टाइम सेट पर फिर से चलाया जाना चाहिए; एक दिन के उतार-चढ़ाव से मूविंग टारगेट ट्रिगर नहीं होना चाहिए।

एक मजबूत उत्तर का उदाहरण

"मैं 99% एक्यूरेसी परिणाम को पहले स्वीकार नहीं करूंगा। वैलिडेशन सेट का केवल 1% फ्रॉड है, इसलिए प्रत्येक ट्रांजैक्शन को वैध भविष्यवाणी करने से 99% एक्यूरेसी और शून्य रिकॉल भी मिलता है। मैं पॉजिटिव-क्लास परिभाषा, तीन लागतों, क्या 1,000 दैनिक समीक्षाएं एक कठिन सीमा हैं, और लेबल विलंब को स्पष्ट करूंगा।

0.80 थ्रेशोल्ड पर, दिए गए परिणाम 700 TP, 300 FP, 300 FN और 98,700 TN हैं। प्रिसिजन और रिकॉल दोनों 70% हैं, और अलर्ट काउंट ठीक 1,000 है। 0.50 थ्रेशोल्ड रिकॉल को 85% तक बढ़ाता है लेकिन 2,500 अलर्ट बनाता है, जो क्षमता से अधिक है। यह 150 अतिरिक्त फ्रॉड पकड़ता है जबकि 1,350 फॉल्स पॉजिटिव और 1,500 समीक्षाएं जोड़ता है। थ्रेशोल्ड को कम करने के वृद्धिशील मूल्य का परीक्षण करने के लिए मैं C_FN > 9 × C_FP + 10 × C_R का उपयोग करूंगा। एक कठिन क्षमता सीमा के साथ, मैं इसके बजाय शीर्ष 1,000 स्कोर लूंगा और precision@1000 तथा recall@1000 की रिपोर्ट करूंगा।

मैं मॉडल तुलना के दौरान AUROC और प्रिसिजन-रिकॉल या औसत प्रिसिजन दोनों का उपयोग करूंगा, फिर कन्फ्यूजन मैट्रिक्स और लागतों के साथ ऑपरेटिंग पॉइंट का चयन करूंगा। यदि स्कोर मौद्रिक निर्णयों को संचालित करते हैं, तो मैं उन्हें मॉडल फिटिंग के बाहर के डेटा पर कैलिब्रेट करूंगा। यदि सिस्टम को केवल top-k की आवश्यकता है, तो मैं रैंकिंग स्थिरता पर ध्यान केंद्रित करूंगा। हाइपरपैरामीटर, कैलिब्रेशन और थ्रेशोल्ड वैलिडेशन या क्रॉस-वैलिडेशन के भीतर रहते हैं, जबकि प्रोडक्शन-अनुपात वाले अंतिम टेस्ट सेट का मूल्यांकन एक बार किया जाता है।

प्रोडक्शन में, मैं अलर्ट क्षमता और परिपक्व-लेबल मेट्रिक्स की एक साथ निगरानी करूंगा। भले ही TPR और FPR स्थिर रहें, पॉजिटिव दर को 1% से घटाकर 0.5% करने से उदाहरण प्रिसिजन लगभग 70.0% से घटकर 53.7% हो जाता है। यही कारण है कि योजना बेस रेट, स्कोर वितरण, कैलिब्रेशन ड्रिफ्ट और समय तथा प्रमुख सेगमेंट द्वारा प्रदर्शन को भी ट्रैक करती है।"

सामान्य गलतियाँ

  • केवल एक्यूरेसी की तुलना करना → एक ऑल-नेगेटिव क्लासिफायर पहले से ही 99% तक पहुंच जाता है, इसलिए मेट्रिक यह साबित नहीं करता है कि पॉजिटिव पाए गए थे → नो-स्किल बेसलाइन से शुरू करें, फिर कन्फ्यूजन मैट्रिक्स, प्रिसिजन, रिकॉल और निरपेक्ष अलर्ट काउंट की रिपोर्ट करें।
  • असंतुलन के लिए स्वचालित रूप से F1 चुनना → F1 समान प्रिसिजन-रिकॉल भार का तात्पर्य करता है और क्षमता तथा ट्रू नेगेटिव की उपेक्षा करता है → वास्तविक त्रुटि लागतों से F-beta, एक लागत फ़ंक्शन, या एक निश्चित-क्षमता मेट्रिक चुनें।
  • दावा करना कि PR हमेशा ROC से बेहतर होता है → वे अलग-अलग प्रश्नों के उत्तर देते हैं, और PR व्यापकता पर निर्भर करता है → रैंकिंग के लिए AUROC, पॉजिटिव-अलर्ट गुणवत्ता के लिए PR या AP का उपयोग करें, और ऑपरेटिंग पॉइंट का अलग से चयन करें।
  • डिफ़ॉल्ट 0.5 थ्रेशोल्ड का उपयोग करना → एक सांख्यिकीय डिफ़ॉल्ट कोई व्यावसायिक इष्टतम नहीं है → लागत और क्षमता के विरुद्ध मॉडल फिटिंग के बाहर के डेटा पर थ्रेशोल्ड को ट्यून करें।
  • प्रशिक्षण डेटा पर थ्रेशोल्ड को ट्यून करना → थ्रेशोल्ड प्रशिक्षण त्रुटि के अनुकूल होता है और आशावादी मूल्यांकन उत्पन्न करता है → अंतिम टेस्ट सेट को सुरक्षित रखते हुए, आउट-ऑफ-फ़ोल्ड भविष्यवाणियों या एक अलग वैलिडेशन सेट का उपयोग करें।
  • रीसॅम्पल किए गए टेस्ट सेट पर प्रिसिजन की रिपोर्ट करना → कृत्रिम क्लास अनुपात प्रिसिजन और अलर्ट वॉल्यूम को बदल देता है → प्रोडक्शन जैसी बेस रेट पर मूल्यांकन करें और रीसॅम्पलिंग को केवल प्रशिक्षण चरण में रखें।
  • एक रॉ स्कोर को प्रायिकता के रूप में मानना → एक अनकैलिब्रेटेड 0.8 का मतलब 80% घटना दर होना आवश्यक नहीं है → अपेक्षित-लागत निर्णयों के लिए प्रायिकताओं को मान्य और कैलिब्रेट करें; केवल रैंकिंग करते समय स्कोर सेमेंटिक्स बताएं।
  • लॉन्च के बाद केवल AUROC की निगरानी करना → स्थिर वैश्विक रैंकिंग क्षमता ओवरफ्लो, सेगमेंट विफलता, या बेस-रेट बदलाव को छिपा सकती है → ऑपरेटिंग पॉइंट, कतार, लागत और परिपक्व-लेबल परिणामों की भी निगरानी करें।

फॉलो-अप प्रश्न और प्रतिक्रियाएं

फॉलो-अप 1: क्या होगा यदि समीक्षा क्षमता 1,000 मामलों से घटकर 500 हो जाए?

पुराने थ्रेशोल्ड को स्केल करने के बजाय पहले 500 मामलों के लिए precision@500, recall@500 और अपेक्षित शुद्ध मूल्य की पुनर्गणना करें। यदि उच्च मूल्य वाले ट्रांजैक्शन अधिक लाभ प्रदान करते हैं, तो केवल फ्रॉड प्रायिकता के बजाय प्रति-उदाहरण अपेक्षित नुकसान के आधार पर रैंक करें। जांचें कि क्या वह रैंकिंग किसी उपयोगकर्ता सेगमेंट पर अनुपातहीन फॉल्स ब्लॉक लगाती है।

फॉलो-अप 2: जब लेबल को परिपक्व होने में 60 दिन लगते हैं तो आप मॉडल की निगरानी कैसे करेंगे?

तत्काल प्रॉक्सी को विलंबित परिणामों से अलग करें। तुरंत छूटे हुए इनपुट, स्कोर वितरण, अलर्ट वॉल्यूम, समीक्षक के निर्णय और कतार की आयु को ट्रैक करें। ईवेंट तिथि के अनुसार निश्चित परिपक्वता विंडो बनाएं और 60 दिनों के बाद उसी कोहोर्ट के लिए प्रिसिजन, रिकॉल और लागत की पुनर्गणना करें। प्रॉक्सी जांच को ट्रिगर कर सकते हैं लेकिन उन्हें अंतिम लेबल मेट्रिक्स के रूप में प्रस्तुत नहीं किया जाना चाहिए।

फॉलो-अप 3: क्या 0.5% फ्रॉड दर वाले नए बाजार में उसी थ्रेशोल्ड का उपयोग किया जा सकता है?

पुराने बाजार का 70% प्रिसिजन अपर्याप्त प्रमाण है। भले ही 70% TPR और 0.303% FPR ट्रांसफर हो जाएं, कम बेस रेट प्रिसिजन को घटाकर लगभग 53.7% कर देती है; वास्तविक TPR और FPR भी पॉपुलेशन के साथ बदल सकते हैं। नए बाजार से आउट-ऑफ-टाइम नमूनों पर कन्फ्यूजन मैट्रिक्स, कैलिब्रेशन और क्षमता का पुन: अनुमान लगाएं, फिर वही लागत नियम लागू करें।

फॉलो-अप 4: AUROC में सुधार हुआ, लेकिन शीर्ष 1,000 में प्रिसिजन गिर गया। कौन सा मॉडल जीतता है?

यदि प्रोडक्शन केवल शीर्ष 1,000 पर कार्य कर सकता है, तो स्थानीय रैंकिंग गुणवत्ता सीधे मूल्य को नियंत्रित करती है, इसलिए precision@1000, recall@1000 और लागत बाधाएं प्राथमिकता लेती हैं। AUROC सभी थ्रेशोल्ड में फैला हुआ है, और इसका लाभ उस क्षेत्र में हो सकता है जिसका व्यवसाय कभी उपयोग नहीं करता है। विश्वास अंतराल (Confidence intervals) या बार-बार लिए गए टाइम स्लाइस को पुष्टि करनी चाहिए कि top-k अंतर सैंपलिंग नॉइज़ नहीं है।

फॉलो-अप 5: क्या विभिन्न मूल्यों वाले ट्रांजैक्शन को एक थ्रेशोल्ड साझा करना चाहिए?

एक एकल थ्रेशोल्ड सरल है लेकिन यह एक-यूनिट त्रुटि और दस-हजार-यूनिट त्रुटि को समान मानता है। कैलिब्रेटेड प्रायिकताओं और अनुमानित लागतों के साथ, प्रति-ट्रांजैक्शन अपेक्षित नुकसान या अलग-अलग थ्रेशोल्ड वाले मूल्य बैंड का उपयोग करें, फिर कुल क्षमता, सेगमेंट निष्पक्षता, व्याख्यात्मकता और रोलबैक को मान्य करें। बहुत कम उदाहरणों वाले सेगमेंट को अपने स्वयं के थ्रेशोल्ड को ट्यून नहीं करना चाहिए क्योंकि यह नॉइज़ का पीछा करेगा।

सार्वजनिक स्रोत

संबंधित प्रश्न