प्रतिनिधि इंटरव्यू विषय

डेटा इंटरव्यू: आप एक ML डेटासेट के लिए ऑडिट योग्य Data Card कैसे डिज़ाइन करेंगे?

डेटामध्यम
Offer.cc संपादकीय टीमप्रकाशित अपडेट किया गया

प्रश्न

एक लेबल किए गए डेटासेट का पुन: उपयोग कई मॉडलों और एनालिटिक्स प्रोजेक्ट्स द्वारा किया जाएगा। एक Data Card डिज़ाइन करें और समझाएं कि आप यह कैसे सत्यापित करेंगे कि यह ज़िम्मेदार उपयोग के निर्णयों का समर्थन करता है।

प्रॉम्प्ट और संदर्भ

एक टीम के पास ऑनलाइन व्यवहार लॉग और मानवीय लेबलों से बना एक वर्गीकरण (classification) डेटासेट है। कई मॉडल, ऑफ़लाइन मूल्यांकन और एनालिटिक्स प्रोजेक्ट इसका पुन: उपयोग करेंगे, लेकिन उपयोगकर्ताओं को यह नहीं पता है कि नमूने (samples) कैसे एकत्र किए गए, लेबल किसने तैयार किए, किन समूहों का प्रतिनिधित्व किया गया है, छूटे हुए मानों (missing values) को कैसे संभाला गया, या क्या किसी नए व्यावसायिक उपयोग की अनुमति है। एक Data Card डिज़ाइन करें और समझाएं कि यह ऑडिट योग्य कैसे बना रहता है।

यह डेटा इंजीनियरिंग, डेटा साइंस, मशीन लर्निंग इंजीनियरिंग और डेटा गवर्नेंस इंटरव्यू के लिए उपयुक्त है। परीक्षण यह है कि क्या आप केवल कॉलम सूचीबद्ध करने या एक सुंदर सांख्यिकी पृष्ठ तैयार करने के बजाय डेटासेट दस्तावेज़ीकरण को किसी निर्णय के साक्ष्य में बदल सकते हैं। इसमें प्रूवेनेंस और स्वामित्व, इच्छित और प्रतिबंधित उपयोग, गुणवत्ता और प्रतिनिधित्व, गोपनीयता और लाइसेंसिंग, ज्ञात जोखिम, वर्ज़निंग और रखरखाव को शामिल करें।

इंटरव्यूअर क्या जांच रहा है

एक प्रभावी उत्तर उस निर्णय से शुरू होता है जो पाठक को लेना है और कार्ड को साक्ष्यों के आधार पर व्यवस्थित करता है। यह तथ्यों, अनुमानों और अज्ञात बातों को अलग करता है; नमूना आकार, समय सीमा, संग्रह की स्थिति, लेबलिंग प्रोटोकॉल, छूटे हुए डेटा के सुधार और प्रमुख स्लाइस की रिपोर्ट करता है। यह रिलीज़ अनुमोदक का नाम बताता है, वर्ज़न रिकॉर्ड करता है, नए उपयोगों और गंभीर निष्कर्षों को संभालता है, और पुनरुत्पादकता (reproducibility) जांच और उपयोगकर्ता प्रतिक्रिया से कार्ड को अपडेट करता है।

पहले स्पष्ट करने योग्य प्रश्न

  • डेटा की एक इकाई क्या है: एक इवेंट, एक उपयोगकर्ता, एक सत्र, या एक एनोटेशन?
  • क्या डेटासेट ट्रेनिंग, मूल्यांकन, पुनर्प्राप्ति (retrieval), रिपोर्टिंग या सुरक्षा से जुड़े निर्णय के लिए है?
  • नमूनों को किन समय अवधियों, क्षेत्रों, उपकरणों और चैनलों ने उत्पन्न किया, और लक्षित आबादी क्या है?
  • लेबल की परिभाषाएं, एनोटेटर की योग्यताएं, असहमति की प्रक्रिया और ऑडिट नियम क्या हैं?
  • क्या इसमें व्यक्तिगत डेटा, संवेदनशील विशेषताएं, तीसरे पक्ष के लाइसेंस या उद्देश्य से जुड़े प्रतिबंध शामिल हैं? इसे कौन अनुमोदित और बनाए रखता है?

30-सेकंड का उत्तर

“मैं सबसे पहले डेटासेट का उद्देश्य, लक्षित दर्शक और प्रतिबंधित उपयोग स्पष्ट करूंगा, फिर प्रूवेनेंस, संग्रह विंडो, नमूना संख्या व इकाई, लेबलिंग प्रक्रिया, वर्ज़न और मालिक का विवरण दर्ज करूंगा। मैं महत्वपूर्ण लोगों और समय के स्लाइस के आधार पर परिणामों की रिपोर्ट करते हुए प्रतिनिधित्व, पूर्णता, निरंतरता, लेबल गुणवत्ता, गोपनीयता और लाइसेंसिंग को मान्य करूंगा। कार्ड में अज्ञात बातें, ज्ञात पूर्वाग्रह और उपयोग की सीमाएं सूचीबद्ध होंगी। एक मालिक प्रत्येक रिलीज़ को मंजूरी देता है, और वर्ज़न किए गए स्नैपशॉट, पुनरुत्पादकता जांच और उपयोग की प्रतिक्रिया इसे अद्यतित रखती हैं। यदि कोई नया उपयोग उपलब्ध साक्ष्यों से परे जाता है, तो मैं अनुमोदन रोक दूंगा और अतिरिक्त सत्यापन चलाऊंगा।”

चरण-दर-चरण उत्तर

चरण 1: उपयोग और निर्णय की सीमाएं परिभाषित करें

“यह डेटासेट अच्छा है” को ऐसे प्रश्नों में बदलें जिनका उत्तर दिया जा सके: इसका उपयोग कौन करेगा, किसलिए करेगा, और इसके गलत होने पर क्या होगा। स्वीकृत उपयोगों, अतिरिक्त साक्ष्य की आवश्यकता वाले उपयोगों और प्रतिबंधित उपयोगों को सूचीबद्ध करें। ग्राहक-इरादे (customer-intent) वर्गीकरण के लिए बना डेटासेट हायरिंग स्क्रीनिंग के लिए स्वचालित रूप से अधिकृत नहीं होता है; एक ऑफ़लाइन तुलनात्मक लेबल रीयल-टाइम धोखाधड़ी निर्णयों का समर्थन नहीं कर सकता है।

चरण 2: प्रूवेनेंस, इकाई और निर्माण प्रक्रिया को रिकॉर्ड करें

कार्ड में स्रोत सिस्टम, संग्रह तिथियां, कवर किए गए वर्ज़न और क्षेत्र, अवलोकन की इकाई, और फ़िल्टरिंग, डिडुप्लीकेशन, डी-आइडेंटिफिकेशन व व्युत्पत्ति (derivation) चरणों की पहचान होनी चाहिए। प्रत्येक सुधार के लिए, कारण, इसे किसने किया, कब किया, और क्या प्रभावित हुआ, इसे रिकॉर्ड करें। Google का डेटा-क्वालिटी मार्गदर्शन बताता है कि उपकरण, मानवीय वर्कफ़्लो और राउंडिंग डेटा और वास्तविकता के बीच एक अंतर पैदा कर सकते हैं; केवल अंतिम फ़ाइल अपने आप में साक्ष्य नहीं है।

चरण 3: गुणवत्ता साक्ष्य को स्तरों में व्यवस्थित करें

काउंट, अनुपलब्धता (missingness), डुप्लिकेट, प्रकार और इकाई जांच, लेबल सहमति, आउटलायर हैंडलिंग, लीकेज जांच और पुन: चलाने (rerun) के परिणामों की रिपोर्ट करें। प्रत्येक मीट्रिक के साथ एक विंडो, हर (denominator) और थ्रेशोल्ड संलग्न करें; “शून्य छूटे हुए मान” बताते समय यह स्पष्ट होना चाहिए कि किन फ़ील्ड्स को बाहर रखा गया था। समीक्षा किए गए उदाहरणों और निर्णय साक्ष्यों को सुरक्षित रखें ताकि कोई अन्य व्यक्ति दावे को पुन: प्रस्तुत कर सके।

चरण 4: प्रतिनिधित्व और स्लाइस अंतरों का परीक्षण करें

लक्षित आबादी को परिभाषित करें, फिर क्षेत्र, भाषा, उपकरण, समय, जीवन चक्र चरण, या प्रदर्शन को प्रभावित करने वाले किसी अन्य आयाम के आधार पर स्लाइस करें। छोटे नमूनों के लिए अनिश्चितता के साथ स्लाइस आकार, लेबल वितरण और प्रमुख गुणवत्ता मेट्रिक्स की रिपोर्ट करें। एक उच्च समग्र सटीकता कम साक्ष्य वाले किसी महत्वपूर्ण समूह को छिपा नहीं सकती है, और देखा गया अंतर स्वचालित रूप से कारण (causal) नहीं होता है।

चरण 5: लेबल और मानवीय निर्णयों का वर्णन करें

परिचालन परिभाषाएं, सकारात्मक और नकारात्मक उदाहरण, सीमांत मामले (boundary cases), एनोटेटर की पृष्ठभूमि, प्रशिक्षण, दोहरी समीक्षा, न्यायनिर्णयन (adjudication) और ऑडिट दरें निर्दिष्ट करें। यदि लेबल उपयोगकर्ता के व्यवहार से आते हैं, तो उन्हें ग्राउंड ट्रुथ के बजाय प्रॉक्सी परिणाम कहें। लेबलों का वर्ज़न बनाएं और अर्थ संबंधी परिवर्तनों को रिकॉर्ड करें ताकि ट्रेनिंग में असंगत अर्थों का मिश्रण न हो।

चरण 6: गोपनीयता, लाइसेंसिंग और एक्सेस स्पष्ट करें

व्यक्तिगत और संवेदनशील फ़ील्ड, डी-आइडेंटिफिकेशन विधियां, पुन: पहचान के जोखिम, प्रतिधारण (retention), लाइसेंस स्रोत, साझाकरण का दायरा और अनुमोदन सूचीबद्ध करें। डी-आइडेंटिफिकेशन हर उपयोग को अनुमेय नहीं बनाता है; फ़ील्ड का संयोजन अभी भी समूहों को उजागर कर सकता है। कार्ड को एक्सेस और डिलीशन प्रक्रियाओं से जोड़ें, और असत्यापित लाइसेंसों या प्रूवेनेंस अंतराल को उजागर करें।

चरण 7: वर्ज़न, मालिकों और पुनरुत्पादन सामग्री को बांधें

प्रत्येक रिलीज़ को एक डेटा स्नैपशॉट, कोड संशोधन, प्रोसेसिंग कॉन्फ़िगरेशन, डिपेंडेंसी वर्ज़न, सांख्यिकीय सारांश और चेकसम के साथ पिन करें। एक व्यावसायिक मालिक, तकनीकी अनुरक्षक और जोखिम संपर्क का नाम दें, जिसमें अंतिम समीक्षा तिथि और अगली समीक्षा के ट्रिगर शामिल हों। एक नए उपयोग के लिए आबादी, स्लाइस, लाइसेंसिंग और ज्ञात जोखिमों की नई तुलना की आवश्यकता होती है; पुराने कार्ड की नकल करना पर्याप्त नहीं है।

चरण 8: पांच प्रकार के प्रश्नों के साथ कार्ड की समीक्षा करें

जवाबदेही, उपयोगिता, गुणवत्ता, प्रभाव और जोखिमों की समीक्षा करें। Google का Data Cards मार्गदर्शन इस बात पर ज़ोर देता है कि कार्ड से पाठकों को यह तय करने में मदद मिलनी चाहिए कि क्या डेटासेट उनके कार्य के अनुकूल है, इसके क्या परिणाम हो सकते हैं और किन प्रतिबंधों की आवश्यकता है। समीक्षकों को एक अस्पष्ट स्कोर देने के बजाय फॉलो-अप के लिए साक्ष्य, अज्ञात बातों और मालिकों की ओर संकेत करना चाहिए।

ट्रेड-ऑफ़ और सीमाएं

अधिक विवरण ज़िम्मेदार पुन: उपयोग को आसान बनाता है, लेकिन रखरखाव लागत को बढ़ाता है। मैं सभी प्रोजेक्ट्स में प्रूवेनेंस, उपयोग, गुणवत्ता और जोखिम को अनिवार्य बनाऊंगा, जबकि तदर्थ (one-off) विश्लेषणों को परिशिष्ट में रखूंगा। सारांश सांख्यिकी कच्चे उदाहरणों की समीक्षा की जगह नहीं ले सकती; समग्र मेट्रिक्स महत्वपूर्ण स्लाइस का स्थान नहीं ले सकते; स्वचालित जांच लेबल के अर्थ और व्यावसायिक परिणामों की मानवीय समीक्षा की जगह नहीं ले सकती।

जब साक्ष्य गायब हों, तो “अज्ञात” लिखें और इसे प्राप्त करने की योजना संलग्न करें। किसी उच्च जोखिम वाले निर्णय को सही ठहराने के लिए असत्यापित सटीकता संख्या का उपयोग करने के बजाय उपयोग को अन्वेषण तक सीमित करें या अनुमोदन स्थगित करें।

रोलआउट योजना और साक्ष्य

ऐसे डेटासेट से शुरुआत करें जिसका उपभोक्ता समूह और प्रभाव सीमित हो। पहले सप्ताह में, उद्देश्य, प्रूवेनेंस, अवलोकन इकाई और मालिकों को पंजीकृत करें। दूसरे सप्ताह में, गुणवत्ता और स्लाइस जांच चलाएं। तीसरे सप्ताह में, डेटा साइंस, गोपनीयता और व्यवसाय के प्रतिनिधियों से कार्ड की समीक्षा करवाएं, फिर पिन किए गए स्नैपशॉट से आंकड़े पुन: चलाएं और एक वर्ज़न प्रकाशित करें। पायलट रिकॉर्ड में निष्कर्ष, सुधार, शेष अज्ञात बातें और अगली समीक्षा तिथि शामिल होनी चाहिए।

रिलीज़ के बाद, उपयोगकर्ता की गलतफहमियों, डेटा दोषों, नए उपयोग के अनुरोधों और मॉडल-प्रदर्शन विसंगतियों को एकत्र करें। यदि समस्याएं पहली बार डाउनस्ट्रीम में पाई जाती हैं, तो कार्ड में साक्ष्य या खोज योग्यता की कमी है। यदि कोई भी किसी फ़ील्ड या सीमा की व्याख्या नहीं कर सकता है, तो स्वामित्व और शब्दावली अभी भी अस्पष्ट हैं।

सामान्य गलतियां और फॉलो-अप

उपयोग सीमाओं के बिना एक कॉलम डिक्शनरी

नाम और प्रकार यह नहीं बताते कि नमूने कैसे तैयार किए गए, लेबलों का क्या अर्थ है, या कौन से उपयोग नुकसान पहुंचा सकते हैं। लक्षित आबादी, स्वीकृत और प्रतिबंधित उपयोग और साक्ष्य स्तर जोड़ें।

समग्र औसत के पीछे स्लाइस के अंतर को छिपाना

बड़े समूह समग्र मेट्रिक्स पर हावी हो सकते हैं। महत्वपूर्ण स्लाइस के आकार, वितरण, अनिश्चितता और जहां साक्ष्य अपर्याप्त हैं, उसकी रिपोर्ट करें।

क्लीनिंग आउटपुट को वास्तविकता मानना

आउटलायर्स को हटाना, छूटे हुए मानों को भरना और इकाइयों को सामान्य बनाना डेटासेट को बदल देता है। नियमों, प्रभाव और अनसुलझे मुद्दों को रिकॉर्ड करें; प्रोसेस किए गए मान को डिफ़ॉल्ट रूप से ग्राउंड ट्रुथ न कहें।

नए उपयोग के लिए पुराने कार्ड को कॉपी करना

उद्देश्य बदलने से जोखिम, लक्षित आबादी और आवश्यक साक्ष्य बदल जाते हैं। लाइसेंस, प्रतिनिधित्व, लेबल उपयुक्तता और परिणामों का पुनर्मूल्यांकन करें, और मालिक के अनुमोदन या अस्वीकृति को रिकॉर्ड करें।

आप कैसे साबित करेंगे कि Data Card उपयोगी है?

जांचें कि क्या उपयोगकर्ता मॉडलिंग से पहले सीमाओं को पहचानते हैं और सुरक्षित विकल्प चुनते हैं। तुलना करें कि समस्याएं पहली बार कहां पहचानी जाती हैं, पुनरुत्पादकता की सफलता, अनुमोदन का पुनर्गठन (rework), और उच्च जोखिम वाली दुरुपयोग की घटनाएं। डेटासेट वर्ज़न, उपयोग की मात्रा और समीक्षा प्रयास के साथ परिवर्तनों की व्याख्या करें; केवल कम घटनाएं ही कार्य-कारण (causation) साबित नहीं करती हैं।

सार्वजनिक स्रोत

संबंधित प्रश्न