प्रतिनिधि इंटरव्यू विषय

डेटा इंजीनियरिंग साक्षात्कार: GenAI के लिए भरोसेमंद OpenTelemetry कैसे डिज़ाइन करें?

डेटाकठिन
Offer.cc संपादकीय टीमप्रकाशित अपडेट किया गया

प्रश्न

एक मल्टी-मॉडल, टूल-उपयोग करने वाले GenAI एप्लिकेशन में लेटेंसी, लागत और गुणवत्ता में गिरावट (regression) आई है। इसका OpenTelemetry डेटा मॉडल, संग्रह नीति और डेटा-गुणवत्ता जांच डिज़ाइन करें।

प्रॉम्प्ट और लागू संदर्भ

आप एक ऐसे GenAI एप्लिकेशन के प्रभारी हैं जो दस्तावेज़ पुनर्प्राप्त (retrieve) करता है, मॉडल कॉल करता है और टूल्स निष्पादित करता है। टीम को यह जानना आवश्यक है कि किस मॉडल संस्करण ने पहले टोकन के समय (time to first token) को बढ़ाया, क्या किसी टूल ने विफलताओं को बढ़ाया, क्या लागत कुछ ही टेनेंट्स में केंद्रित है, और क्या प्रॉम्प्ट्स में व्यक्तिगत डेटा को उजागर किए बिना गुणवत्ता प्रतिगमन को दोबारा चलाया (replay) जा सकता है। OpenTelemetry सिमेंटिक कन्वेन्शन्स का उपयोग करके ट्रेसेस, मेट्रिक्स, इवेंट्स और डेटा-क्वालिटी गेट्स डिज़ाइन करें।

यह एक टेलीमेट्री-डेटा मॉडलिंग और सत्यापन की समस्या है, वेंडर-चयन का अभ्यास नहीं। OpenTelemetry सिमेंटिक कन्वेन्शन्स को कोडबेस, लाइब्रेरीज़ और प्लेटफ़ॉर्म्स पर साझा विशेषता (attribute) नामों और अर्थों के रूप में परिभाषित करता है। GenAI कन्वेन्शन्स मॉडल्स, बातचीत, टूल कॉल्स, टोकन उपयोग और मूल्यांकनों को कवर करते हैं, लेकिन कुछ हिस्से अभी भी विकसित हो रहे हैं, इसलिए प्रत्येक विशेषता को एक स्थिर अनुबंध नहीं माना जाना चाहिए।

साक्षात्कारकर्ता क्या मूल्यांकन करता है

साक्षात्कारकर्ता व्यावसायिक प्रश्नों से प्राप्त संकेतों (signals) को देखना चाहता है, न कि मॉडल मापदंडों से भरा हुआ लॉग। एक मजबूत उत्तर उपयोगकर्ता के एक अनुरोध को पुनर्प्राप्ति, मॉडल, टूल और अंतिम-परिणाम कार्य के साथ सहसंबंधित (correlate) करता है, जबकि प्रतिगमन को समझाने के लिए पर्याप्त संस्करण और टेनेंट आयामों को बनाए रखता है।

आपको डेटा सीमाओं को परिभाषित करना होगा। प्रॉम्प्ट्स, प्रतिक्रियाएं, टूल तर्क और पुनर्प्राप्त दस्तावेज़ों में संवेदनशील डेटा हो सकता है; उच्च-कार्डिनैलिटी सेशन आईडी, उपयोगकर्ता आईडी या पूर्ण सामग्री को असीमित मेट्रिक लेबल नहीं बनना चाहिए। संग्रह को गोपनीयता, भंडारण लागत, सैंपलिंग और अवधारण (retention) के बीच संतुलन बनाना चाहिए।

अंत में, गुणवत्ता गेट्स निर्दिष्ट करें। यदि कोई पैरेंट स्पैन, मॉडल संस्करण, समाप्ति का कारण (finish reason), या टोकन गणना गायब है, तो रिकॉर्ड को अधूरा चिह्नित करें और एक सटीक दिखने वाले डैशबोर्ड को प्रस्तुत करने के बजाय इसकी निगरानी करें।

स्पष्टीकरण के लिए प्रश्न

पहले पूछें कि कौन सा परिणाम मायने रखता है: पहले टोकन का समय, कुल लेटेंसी, प्रति अनुरोध लागत, टूल की सफलता, पुनर्प्राप्ति रिकॉल, या उत्तर की गुणवत्ता। वह विकल्प निर्धारित करता है कि कौन से ट्रेसेस, मेट्रिक्स और मूल्यांकन इवेंट्स आवश्यक हैं।

फिर संवेदनशीलता और क्षेत्राधिकार के बारे में पूछें। क्या प्रॉम्प्ट्स और प्रतिक्रियाओं को संग्रहीत किया जा सकता है? क्या क्षेत्रीय अलगाव या टेनेंट-स्तरीय विलोपन आवश्यक है? यदि कच्ची सामग्री प्रतिबंधित है, तो हैश, रिडैक्टेड सारांश, संदर्भ आईडी और सुरक्षित ऑफ़लाइन रीप्ले का उपयोग करें।

अंत में वॉल्यूम और अवधारण के बारे में पूछें। अनुरोध दर, मॉडल-कॉल गणना, टूल की गहराई, सैंपलिंग दर और अवधारण अवधि कलेक्टर्स, कतारों, स्टोरेज पार्टिशनिंग और लागत के दायरे को निर्धारित करती है।

30-सेकंड उत्तर ढांचा

आप कह सकते हैं:

“मैं प्रत्येक उपयोगकर्ता अनुरोध को एक ट्रेस के रूप में मॉडल करूंगा, जिसमें पुनर्प्राप्ति, जनरेशन, टूल कॉल्स और मूल्यांकन संस्करणित चाइल्ड स्पैन या इवेंट्स के रूप में होंगे। मेट्रिक्स मॉडल, प्रदाता, वर्कफ़्लो और परिणाम स्थिति जैसे कम-कार्डिनैलिटी आयामों का उपयोग करते हैं। प्रॉम्प्ट्स, प्रतिक्रियाएं और टूल तर्क रिडक्शन, सैंपलिंग और ऑडिटेड एक्सेस के साथ एक नियंत्रित इवेंट स्ट्रीम में जाते हैं। प्रत्येक रिकॉर्ड की ट्रेस सहसंबंध, क्रम, मॉडल संस्करण और टोकन गणना के लिए जांच की जाती है; गायब फ़ील्ड डेटा-गुणवत्ता विफलताएं बन जाती हैं। डैशबोर्ड लेटेंसी, लागत, त्रुटियों और गुणवत्ता स्कोर को जोड़ते हैं, जबकि अनुरोधों का एक निश्चित नमूना सुरक्षित रीप्ले के लिए उपलब्ध रहता है।”

चरण-दर-चरण विस्तृत उत्तर

एंड-टू-एंड सिग्नल ग्राफ़ बनाएं

एंट्री स्पैन अनुरोध आईडी, एक टेनेंट सारांश और वर्कफ़्लो संस्करण रिकॉर्ड करता है। एक पुनर्प्राप्ति स्पैन स्रोत आईडी, क्वेरी सारांश और परिणाम गणना रिकॉर्ड करता है। एक मॉडल स्पैन प्रदाता, अनुरोध मॉडल, प्रतिक्रिया मॉडल, स्ट्रीमिंग फ़्लैग, पहले टोकन का समय और टोकन उपयोग रिकॉर्ड करता है। एक टूल स्पैन टूल प्रकार, कॉल आईडी और परिणाम स्थिति रिकॉर्ड करता है। एक मूल्यांकन इवेंट मूल्यांकनकर्ता का नाम, स्कोर और स्पष्टीकरण संदर्भ रिकॉर्ड करता है।

कम-कार्डिनैलिटी मेट्रिक आयामों का उपयोग करें

मॉडल, प्रदाता, वर्कफ़्लो, क्षेत्र, परिणाम स्थिति और त्रुटि वर्ग द्वारा लेटेंसी, टोकन, लागत और सफलता को एकत्रित करें। टाइम-सीरीज़ विस्फोट से बचने के लिए मेट्रिक लेबल्स के बजाय ट्रेसेस या इवेंट्स में सेशन आईडी, उपयोगकर्ता आईडी, दस्तावेज़ आईडी और पूर्ण त्रुटि टेक्स्ट रखें।

रनटाइम मेट्रिक्स से सामग्री इवेंट्स को अलग करें

OpenTelemetry का GenAI मार्गदर्शन ट्रेसेस, मेट्रिक्स और इवेंट्स को तीन संकेतों के रूप में वर्णित करता है। प्रॉम्प्ट्स और प्रतिक्रियाएं एक इवेंट स्ट्रीम में फिट होते हैं क्योंकि वे बड़े, संवेदनशील और विभिन्न अवधारण नियमों के अधीन होते हैं। रनटाइम मेट्रिक्स गणना, लेटेंसी और लागत रखते हैं; सामग्री इवेंट्स नियंत्रित भंडारण, एन्क्रिप्शन और कम अवधारण का उपयोग करते हैं।

संस्करण और कार्य-कारण संबंध (causality) रिकॉर्ड करें

प्रत्येक स्पैन मॉडल, प्रॉम्प्ट-टेम्पलेट, रिट्रीवर, टूल-परिभाषा और मूल्यांकनकर्ता संस्करणों को रिकॉर्ड करता है। एक प्रतिगमन जांच को एक स्कोर को सटीक मॉडल अनुरोध और इनपुट-डेटा संस्करण से जोड़ना चाहिए; केवल एक मॉडल नाम उपनाम विचलन (alias drift), रूटिंग परिवर्तन और प्रॉम्प्ट परिवर्तनों में अंतर नहीं कर सकता है।

सैंपलिंग और लागत को नियंत्रित करें

एक निश्चित दर पर पूर्ण ट्रेसेस रखें, फिर त्रुटियों, अत्यधिक लेटेंसी, कम स्कोर और नए संस्करणों के लिए सैंपलिंग बढ़ाएं। वास्तविक समय में टोकन और टूल-कॉल गणनाओं को एकत्रित करें; थ्रॉटलिंग या डिग्रेडेशन के साथ टेनेंट बजट लागू करें। सैंपलिंग नियम गुणवत्ता मेटाडेटा में शामिल होने चाहिए ताकि संस्करण-से-संस्करण तुलनाएं मान्य रहें।

गोपनीयता और एक्सेस नियंत्रण लागू करें

एसडीके या कलेक्टर पर फ़ील्ड्स को रिडैक्ट करें ताकि पासवर्ड, व्यक्तिगत डेटा और कुंजियां कभी भी विशेषताओं (attributes) में प्रवेश न करें। सामग्री इवेंट्स को रनटाइम मेट्रिक्स से अलग अधिकृत करें, टेनेंट स्कोप, एन्क्रिप्टेड संदर्भों और विलोपन इंडेक्स का उपयोग करें। संवेदनशील सामग्री को बनाए रखने के लिए «केवल आंतरिक» कोई औचित्य नहीं है।

पूर्णता और क्रमबद्धता को मान्य करें

प्रत्येक ट्रेस के लिए पैरेंट-चाइल्ड संबंध, मोनोटोनिक टाइमस्टैम्प, समाप्ति स्थिति, मॉडल संस्करण और टूल-कॉल आईडी की जांच करें। मेट्रिक्स के लिए, इकाइयों, बकेट सीमाओं, मोनोटोनिक काउंटरों और डुप्लिकेट रिपोर्टों की जांच करें। इवेंट्स के लिए, स्कीमा संस्करण, रिडक्शन स्थिति और आकार सीमाओं की जांच करें। कारण कोड के साथ विफलताओं को बैड-डेटा कतार में भेजें।

मूल्यांकन इवेंट्स के माध्यम से गुणवत्ता को जोड़ें

एक मूल्यांकन इवेंट में मूल्यांकनकर्ता का नाम, स्कोर, लेबल और एक स्पष्टीकरण संदर्भ होता है। स्वचालित स्कोर को पूर्ण सत्य न मानें; मूल्यांकनकर्ता और डेटासेट संस्करणों के साथ-साथ मानव नमूने भी रिकॉर्ड करें। केवल एक सिग्नल को अनुकूलित करने के बजाय लेटेंसी, लागत और त्रुटियों के साथ गुणवत्ता प्रतिगमन की समीक्षा की जानी चाहिए।

उच्च गुणवत्ता वाला नमूना उत्तर

“मैं प्रत्येक अनुरोध को एक सहसंबंधित ट्रेस के रूप में प्रस्तुत करूंगा: एंट्री, पुनर्प्राप्ति, मॉडल, टूल्स और मूल्यांकन संस्करणित स्पैन या इवेंट्स हैं। मेट्रिक्स पहले टोकन के समय, कुल लेटेंसी, टोकन, लागत और त्रुटियों को एकत्रित करने के लिए कम-कार्डिनैलिटी मॉडल, प्रदाता, वर्कफ़्लो और परिणाम आयामों का उपयोग करते हैं। प्रॉम्प्ट्स, प्रतिक्रियाएं और टूल तर्क मेट्रिक लेबल्स के बजाय एक रिडैक्टेड, एक्सेस-ऑडिटेड सामग्री स्ट्रीम में जाते हैं। संग्रह परत पैरेंट-चाइल्ड लिंक, ऑर्डरिंग, स्कीमा, मॉडल संस्करणों और टोकन गणनाओं की जांच करती है; अमान्य रिकॉर्ड एक बैड-डेटा कतार में प्रवेश करते हैं। पूर्ण ट्रेसेस को निश्चित दर पर सैंपल किया जाता है, जबकि त्रुटियों, धीमे अनुरोधों और गुणवत्ता प्रतिगमन को अधिक सैंपलिंग प्राप्त होती है। डैशबोर्ड डेटासेट और मूल्यांकनकर्ता संस्करणों का उपयोग करके रनटाइम मेट्रिक्स को मूल्यांकन स्कोर और रीप्ले डेटा से जोड़ते हैं।”

सामान्य गलतियाँ

सभी सामग्री को मेट्रिक लेबल्स में डालना

विफलता पैटर्न: लेबल के रूप में उपयोगकर्ता आईडी, सेशन आईडी, या पूर्ण प्रॉम्प्ट्स का उपयोग करना। यह विफल क्यों होता है: उच्च कार्डिनैलिटी भंडारण और प्रश्नों को प्रभावित कर सकती है जबकि गोपनीयता का जोखिम बढ़ जाता है। सुधार: मेट्रिक्स को कम-कार्डिनैलिटी रखें और सामग्री को नियंत्रित इवेंट्स में डालें।

केवल मॉडल का नाम रिकॉर्ड करना

विफलता पैटर्न: केवल एक मॉडल-नाम फ़ील्ड द्वारा प्रत्येक परिणाम की तुलना करना। यह विफल क्यों होता है: उपनाम रूटिंग, प्रॉम्प्ट टेम्पलेट्स, रिट्रीवर्स और टूल संस्करण अप्रभेद्य हो जाते हैं। सुधार: अनुरोध मॉडल, प्रतिक्रिया मॉडल, वर्कफ़्लो और निर्भरता संस्करण रिकॉर्ड करें।

केवल टोकन लागत को अनुकूलित करना

विफलता पैटर्न: लागत कम होने पर सफलता की घोषणा करना। यह विफल क्यों होता है: पहले टोकन का समय, टूल की सफलता, या उत्तर की गुणवत्ता खराब हो सकती है। सुधार: लागत, लेटेंसी, त्रुटियों, पुनर्प्राप्ति और मूल्यांकन की एक साथ निगरानी करें।

कच्चे प्रॉम्प्ट्स और प्रतिक्रियाओं को संग्रहीत करना

विफलता पैटर्न: रीप्ले के लिए कच्चे टेक्स्ट को अनिश्चित काल तक बनाए रखना। यह विफल क्यों होता है: सामग्री में व्यक्तिगत डेटा, कुंजियां या क्रॉस-टेनेंट जानकारी शामिल हो सकती है। सुधार: फ़ील्ड्स को रिडैक्ट करें, अल्पकालिक अवधारण, एन्क्रिप्टेड संदर्भों, टेनेंट एक्सेस और विलोपन इंडेक्स का उपयोग करें।

खराब डेटा को अनदेखा करना

विफलता पैटर्न: हर (denominator) में लापता पैरेंट या टोकन गणना वाले रिकॉर्ड शामिल करना। यह विफल क्यों होता है: डैशबोर्ड पूरा दिखाई देता है लेकिन अपनी संख्याओं की व्याख्या नहीं कर सकता है। सुधार: पूर्णता गेट्स, एक बैड-डेटा कतार और एक गुणवत्ता डैशबोर्ड परिभाषित करें जो लापता डेटा को वास्तविक शून्य से अलग करता है।

अनुवर्ती प्रश्न और उत्तर

क्या होगा यदि टीम संपूर्ण तर्क प्रक्रिया (reasoning process) को रिकॉर्ड करने के लिए कहे?

स्पष्ट करें कि क्या व्यवसाय को ऑडिट योग्य साक्ष्य, टूल ट्रेसेस, या आंतरिक मॉडल तर्क की आवश्यकता है। इनपुट संदर्भों, टूल कॉल्स, संस्करणों, मूल्यांकन साक्ष्य और परिणाम सारांशों को प्राथमिकता दें; अनावश्यक संवेदनशील सामग्री या आंतरिक तर्क टेक्स्ट को बनाए न रखें।

क्या होगा यदि GenAI कन्वेन्शन्स माइग्रेट होते हैं?

कलेक्टर्स और वेयरहाउस में स्कीमा संस्करणों को संग्रहीत करें, पुराने फ़ील्ड्स को नए फ़ील्ड्स से मैप करें, और माइग्रेशन के दौरान डुअल राइट्स या कम्पैटिबिलिटी व्यूज़ का उपयोग करें। अर्थों को मिलाने के बजाय डैशबोर्ड को कन्वेन्शन संस्करण के अनुसार समूहित करें।

क्या होगा यदि पीक ट्रैफ़िक पूर्ण ट्रेसेस को बहुत महंगा बना देता है?

त्रुटियों और अत्यधिक लेटेंसी के लिए पूर्ण ट्रेसेस रखें, सामान्य ट्रैफ़िक को एक निश्चित दर पर सैंपल करें, और कुल मेट्रिक्स और इवेंट सारांश बनाए रखें। गुणवत्ता मेटाडेटा के रूप में सैंपलिंग दर, ट्रिगर नियम और ड्रॉप कारणों को रिकॉर्ड करें।

क्या होगा यदि लेटेंसी में सुधार होने पर मूल्यांकन स्कोर गिर जाते हैं?

मॉडल, प्रॉम्प्ट टेम्पलेट, पुनर्प्राप्ति डेटासेट, टूल संस्करण और टेनेंट द्वारा स्लाइस करें, और सत्यापित करें कि डेटासेट और मूल्यांकनकर्ता नहीं बदले हैं। रिलीज गेट को केवल एक मेट्रिक स्वीकार करने के बजाय प्रदर्शन लाभ के मुकाबले गुणवत्ता प्रतिगमन को तौलने दें।

आप कैसे साबित करेंगे कि ट्रेसेस टेनेंट सीमाओं को पार नहीं करते हैं?

संग्रह, परिवहन, भंडारण और क्वेरी परतों पर टेनेंट-सीमा परीक्षण चलाएं। सिंथेटिक डेटा को विशेषताओं, इवेंट्स और संदर्भों पर टेनेंट स्कोप को सत्यापित करना चाहिए; असामान्य क्वेरीज़ ऑडिट अलर्ट जारी करती हैं। विलोपन अनुरोधों को एक इंडेक्स के माध्यम से प्रत्येक व्युत्पन्न इवेंट का पता लगाने में सक्षम होना चाहिए।

सार्वजनिक स्रोत

संबंधित प्रश्न