प्रतिनिधि इंटरव्यू विषय

डिफरेंशियल प्राइवेसी में आप ऍप्सिलॉन (epsilon), संवेदनशीलता (sensitivity), और प्राइवेसी बजट को कैसे समझाते हैं?

डेटाकठिन
Offer.cc संपादकीय टीमप्रकाशित अपडेट किया गया

प्रश्न

यूज़र सांख्यिकी जारी करने वाली एक डिफरेंशियली प्राइवेट सेवा डिज़ाइन करें। प्राइवेसी यूनिट और पड़ोसी डेटासेट्स को परिभाषित करें, काउंट्स या औसतों के लिए मैकेनिज़्म चुनें, ऍप्सिलॉन, डेल्टा, संवेदनशीलता और कंपोजिशन की व्याख्या करें, योगदान सीमाओं के साथ बजट आवंटित करें, सटीकता का मूल्यांकन करें, और बताएं कि किन जोखिमों के लिए डिफरेंशियल प्राइवेसी से परे नियंत्रणों की आवश्यकता है।

1. प्रॉम्प्ट

एक एनालिटिक्स टीम दैनिक सक्रिय यूज़र्स, क्षेत्र के अनुसार औसत ऑर्डर मूल्य, और ट्रेंड चार्ट्स प्रकाशित करना चाहती है, बिना किसी एक यूज़र के शामिल होने, हटने, या एक रिकॉर्ड से रिलीज़ में कोई बड़ा बदलाव आए। टीम के कुछ सदस्य नामों को हटाने और यूज़र IDs को हैश करने को ही प्राइवेसी समाधान मानते हैं; अन्य ऍप्सिलॉन को मनमाने ढंग से बहुत छोटी संख्या पर सेट करना चाहते हैं।

एक डिफरेंशियल-प्राइवेसी रिलीज़ फ़्लो डिज़ाइन करें। प्राइवेसी यूनिट, पड़ोसी डेटासेट्स, क्वेरी संवेदनशीलता, नॉइज़ मैकेनिज़्म, ऍप्सिलॉन और डेल्टा, बार-बार की जाने वाली क्वेरीज़ में कंपोजिशन, प्रति-यूज़र योगदान सीमाएं, और सटीकता मूल्यांकन की व्याख्या करें। बताएं कि मैकेनिज़्म के साथ-साथ किन जोखिमों के लिए एक्सेस कंट्रोल, डेटा न्यूनीकरण (data minimization), या गवर्नेंस की आवश्यकता होती है।

2. सीमाएं और स्पष्टीकरण

  • सबसे पहले परिभाषित करें कि संरक्षित यूनिट एक यूज़र, अकाउंट, डिवाइस, या इवेंट है। एक यूज़र के कई इवेंट्स आमतौर पर एक ही प्राइवेसी यूनिट से संबंधित होते हैं।
  • पड़ोसी डेटासेट की परिभाषा तय करें, जैसे कि वे डेटासेट्स जो एक यूज़र के सभी रिकॉर्ड्स या किसी एक इवेंट में भिन्न होते हैं। अलग-अलग परिभाषाएं अलग संवेदनशीलता और गारंटी उत्पन्न करती हैं।
  • सेंट्रल डिफरेंशियल प्राइवेसी पर चर्चा करें: एक विश्वसनीय आंतरिक मैकेनिज़्म रॉ डेटा तक पहुंचता है और नॉइज़ी परिणाम जारी करता है। अज्ञातिकरण, हैशिंग, और एन्क्रिप्शन स्वचालित रूप से डिफरेंशियल-प्राइवेसी गारंटी प्रदान नहीं करते हैं।
  • बिना क्वेरी, डेटा वितरण, और थ्रेट मॉडल के कोई “सही ऍप्सिलॉन” न बताएं। प्राइवेसी की मजबूती, उपयोगिता, और यूज़र अपेक्षाओं को एक साथ चुना जाना चाहिए।

3. मुख्य परिभाषा: पड़ोसी डेटासेट्स के आउटपुट वितरणों को सुरक्षित करना

एक रैंडमाइज़्ड एल्गोरिदम M तब (epsilon, delta)-डिफरेंशियली प्राइवेट होता है जब किसी भी पड़ोसी डेटासेट्स D, D', और आउटपुट इवेंट S के लिए:

Pr[M(D) in S] <= exp(epsilon) * Pr[M(D') in S] + delta

सहायक जानकारी होने पर भी, यह केवल एक रिलीज़ से यह अनुमान लगाना कठिन बना देता है कि कोई प्राइवेसी यूनिट मौजूद है या नहीं। इसका मतलब यह नहीं है कि आउटपुट में कोई संवेदनशील जानकारी नहीं है या अज्ञात डेटा की पहचान नहीं की जा सकती है। छोटा ऍप्सिलॉन आम तौर पर एक मजबूत प्राइवेसी बाधा लगाता है लेकिन अधिक नॉइज़ जोड़ता है; डेल्टा विफलता की एक अनुमत छोटी संभावना है, कोई मनमाना एरर या अनुपलब्धता दर (missingness rate) नहीं।

निकटता संबंध (adjacency relation) परिभाषित करता है कि एक यूनिट के बदलाव का क्या अर्थ है। यदि एक यूज़र अधिकतम पांच ऑर्डर्स का योगदान दे सकता है, तो यूज़र-स्तरीय काउंट को संवेदनशीलता 1 तक सीमित किया जा सकता है, जबकि ऑर्डर-वैल्यू योग के लिए प्रत्येक ऑर्डर या यूज़र के कुल योग पर भी एक सीमा की आवश्यकता होती है। अन्यथा एक यूज़र बिना किसी सीमा के परिणाम को बदल सकता है।

4. मैकेनिज़्म और संदर्भ स्यूडोकॉड

संवेदनशीलता Delta वाले काउंट या बाउंडेड योग के लिए, लाप्लास मैकेनिज़्म f(D) + Laplace(Delta / epsilon) जारी करता है। हाई-डायमेंशनल या औसत क्वेरीज़ जिनके लिए (epsilon, delta) गारंटी की आवश्यकता होती है, उनके लिए गॉसियन मैकेनिज़्म सामान्य है, लेकिन इसका कैलिब्रेशन संवेदनशीलता, डेल्टा, और अकाउंटिंग विधि पर निर्भर करता है।

text
release_count(users, epsilon, delta, budget):
  clipped = cap_each_user_contribution(users, max_contribution=1)
  true_count = count_distinct_privacy_units(clipped)
  require budget.remaining >= epsilon
  noise = sample_laplace(scale=1 / epsilon)
  budget.spend(epsilon, delta)
  return max(0, round(true_count + noise))

release_mean(records, epsilon, delta, budget):
  clipped = cap_each_user_contribution(records, max_rows=K)
  clipped_values = clamp_values(clipped, lower=L, upper=U)
  sum_release = dp_sum(clipped_values, epsilon_sum, delta_sum)
  count_release = dp_count(clipped, epsilon_count, delta_count)
  return sum_release / max(count_release, minimum_safe_count)

औसत निकालते समय केवल अंश (numerator) में नॉइज़ नहीं जोड़ा जा सकता: हर (denominator) को भी सुरक्षा की आवश्यकता होती है, और मानों तथा प्रति-यूज़र योगदानों को क्लिप (clip) किया जाना चाहिए। क्लिपिंग से पूर्वाग्रह (bias) आता है और नॉइज़ से विचरण (variance) आता है, इसलिए सिमुलेशन या रोके गए मूल्यांकन सेट पर अंतराल कवरेज (interval coverage), सापेक्ष एरर (relative error), और छोटे समूहों के विरूपण (distortion) को मापें।

5. कंपोजिशन, बजट, और सिस्टम डिज़ाइन

जब एक प्राइवेसी यूनिट कई रिलीज़ में भाग लेती है, तो प्राइवेसी की हानि जुड़ती (compose होती) है। बेसिक कंपोजिशन कई शुद्ध-ऍप्सिलॉन गारंटियों को जोड़ता है; व्यावहारिक सिस्टम अधिक सटीक एडवांस्ड कंपोजिशन या Rényi DP अकाउंटिंग का उपयोग कर सकते हैं, लेकिन उन्हें अकाउंटेंट, प्राइवेसी यूनिट, और डेल्टा सिमेंटिक्स को मानकीकृत करना चाहिए। एक ही क्वेरी पर दस फ़िल्टर भी बजट खर्च करते हैं; एकत्रीकरण (aggregation) से कंपोजिशन गायब नहीं होता है।

एक बजट सेवा को प्रति प्राइवेसी यूनिट या डेटासेट, क्वेरी प्रकार, संस्करण, और समाप्ति नीति के अनुसार खर्च किए गए ऍप्सिलॉन और डेल्टा को ट्रैक करना चाहिए। एक बार समाप्त होने के बाद, इसे अनुरोध अस्वीकार करना चाहिए, अधिक मोटे (coarser) परिणाम में डिग्रेड करना चाहिए, या मौजूदा रिलीज़ लौटानी चाहिए। असंयुक्त (disjoint) यूज़र पार्टिशन्स पैरेलल-कंपोजिशन सीमाओं का उपयोग कर सकते हैं, लेकिन एक ही यूज़र वाले कई समूहों के लिए अभी भी यूज़र-स्तरीय अकाउंटिंग की आवश्यकता होती है।

गवर्नेंस को क्वेरी अनुमतियों को भी प्रतिबंधित करना चाहिए, ऑडिट रिकॉर्ड रखने चाहिए, अवधारण (retention) को परिभाषित करना चाहिए, आधिकारिक रिलीज़ से एक्सप्लोरेशन को अलग करना चाहिए, और न्यूनतम समूह आकार लागू करना चाहिए। डिफरेंशियल प्राइवेसी सांख्यिकीय रिलीज़ की भिन्नता (distinguishability) की रक्षा करती है; यह अनधिकृत रॉ-डेटा एक्सेस, दुर्भावनापूर्ण अंदरूनी सूत्रों (malicious insiders), व्यावसायिक-तर्क लीकेज, या ऐसे परिणाम को ठीक नहीं करती है जिसे कभी सार्वजनिक नहीं किया जाना चाहिए था।

6. फॉलो-अप्स और संभावित गलतियां

  • हैश की गई ID अपर्याप्त क्यों है? हैश अक्सर एक स्थिर लिंक करने योग्य पहचानकर्ता होता है और बाहरी डेटा के साथ इसे फिर से पहचाना जा सकता है; यह पड़ोसी डेटासेट्स के लिए कोई आउटपुट-वितरण गारंटी नहीं देता है।
  • क्या छोटा ऍप्सिलॉन हमेशा बेहतर होता है? नहीं। बहुत छोटा ऍप्सिलॉन छोटे-समूह के परिणामों को अनुपयोगी बना सकता है; इसे थ्रेट मॉडल, यूज़र अपेक्षाओं, और एरर लक्ष्य के आधार पर चुनें।
  • यूज़र योगदान को सीमित क्यों करें? बिना किसी सीमा के, अत्यधिक सक्रिय यूज़र संवेदनशीलता पर हावी हो सकता है, जिससे नॉइज़ कैलिब्रेशन और बताई गई गारंटी की व्याख्या करना कठिन हो जाता है।
  • जब कई सेगमेंट्स जारी किए जाते हैं तो क्या होता है? प्रत्येक क्वेरी बजट खर्च करती है; उच्च-आयामी स्लाइसिंग स्पार्स नॉइज़ और बहुलता (multiplicity) संबंधी चिंताएं भी पैदा करती है। आयामों को सीमित करें, क्वेरीज़ को पहले से पंजीकृत करें, और एक अकाउंटेंट का उपयोग करें।

7. सत्यापन और गुणवत्ता जांच

  • प्रॉपर्टी टेस्ट्स: पड़ोसी डेटासेट्स पर मैकेनिज़्म को बार-बार चलाएं और केवल आउटपुट के एक जोड़े की नहीं, बल्कि आउटपुट-वितरण सीमा की जांच करें।
  • उपयोगिता टेस्ट्स: एक प्रतिनिधि मूल्यांकन सेट पर, काउंट्स, योग, और औसतों के लिए पूर्ण और सापेक्ष एरर, अंतराल कवरेज, और समूह-स्तरीय एरर अंतर को मापें।
  • बजट टेस्ट्स: बार-बार की जाने वाली क्वेरीज़, समवर्ती अनुरोधों, पुनः प्रयासों और कैश हिट्स का अनुकरण करके यह सत्यापित करें कि एक लॉजिकल रिलीज़ से एक ही बार शुल्क लिया जाता है और शेष बजट को बायपास नहीं किया जा सकता है।
  • गवर्नेंस टेस्ट्स: प्रकाशित प्राइवेसी स्टेटमेंट के विरुद्ध प्राइवेसी-यूनिट मैपिंग, क्लिपिंग, अनुमतियां, ऑडिट, न्यूनतम-समूह थ्रेशोल्ड, और वर्ज़न रोलबैक को सत्यापित करें।

8. साक्षात्कार स्कोरिंग बिंदु

प्राइवेसी यूनिट और निकटता को परिभाषित कर सकते हैं

उम्मीदवार को संरक्षित ऑब्जेक्ट, यूज़र-स्तरीय या इवेंट-स्तरीय निकटता, और यह विकल्प संवेदनशीलता तथा बजट को कैसे बदलता है, यह बताना चाहिए।

मैकेनिज़्म और उपयोगिता के बीच संतुलन (trade-offs) को समझा सकते हैं

उन्हें केवल "रैंडम नॉइज़ जोड़ना" कहने के बजाय लाप्लास और गॉसियन मैकेनिज़्म में अंतर करना चाहिए और संवेदनशीलता, क्लिपिंग, ऍप्सिलॉन, डेल्टा, पूर्वाग्रह और विचरण की व्याख्या करनी चाहिए।

कंपोजिशन और बजट गवर्नेंस को संभाल सकते हैं

उन्हें यह समझाना चाहिए कि बार-बार की जाने वाली क्वेरीज़ से प्राइवेसी का नुकसान जमा होता है और अकाउंटिंग, योगदान सीमाएं, अस्वीकृति, या डिग्रेडेशन का प्रस्ताव देना चाहिए।

डिफरेंशियल प्राइवेसी की सीमाओं की पहचान कर सकते हैं

उन्हें यह बताना चाहिए कि डिफरेंशियल प्राइवेसी एक्सेस कंट्रोल, डेटा न्यूनीकरण, ऑडिटिंग, या आउटपुट गवर्नेंस का विकल्प नहीं है, और प्रॉपर्टी, उपयोगिता, तथा बजट टेस्ट्स प्रदान करने चाहिए।

सार्वजनिक स्रोत

संबंधित प्रश्न