प्रॉम्प्ट और दायरा
आप एक एंटरप्राइज AI असिस्टेंट के ओनर हैं। कभी-कभी इसे उत्तर देना चाहिए, कभी-कभी स्पष्टीकरण मांगना चाहिए, और कभी-कभी अस्वीकार या एस्केलेट करना चाहिए। रूटिंग नीति, लक्षित उपयोगकर्ता (target user), और सफलता के मेट्रिक्स को परिभाषित करें। समझाएं कि आप गलत उत्तरों, अत्यधिक अस्वीकृति (over-refusal), प्राइवेसी जोखिम, मानव क्षमता (human capacity), और लॉन्च वैलिडेशन को कैसे संभालते हैं।
हालिया सार्वजनिक Copilot PM इंटरव्यू सामग्री AI की गहराई, प्रोडक्ट के निर्णय और मूल्यांकन डिज़ाइन को जोड़ती है। OpenAI Model Spec भी अनिश्चितता व्यक्त करने को इस बात से जोड़ता है कि उपयोगकर्ता कैसे कार्य कर सकता है, गलत होने की लागत क्या है, और कौन सी जानकारी गायब है। इसलिए प्रोडक्ट की चुनौती अनिश्चितता को उपयोगकर्ता के लिए दृश्यमान और संचालन योग्य निर्णय नीति में बदलना है।
इंटरव्यूअर क्या जांच रहा है
- क्या आप मॉडल्स पर चर्चा करने से पहले उपयोगकर्ता के कार्य, जोखिम श्रेणी और स्वीकार्य त्रुटि को परिभाषित करते हैं।
- क्या उत्तर देना, स्पष्ट करना, अस्वीकार करना और एस्केलेट करना परस्पर अनन्य (mutually exclusive) और अवलोकनीय (observable) अवस्थाएं हैं।
- क्या आप आंतरिक मॉडल संकेतों को उत्तर की गुणवत्ता और सुरक्षित उपयोगकर्ता कार्रवाई से अलग पहचानते हैं।
- क्या आप उपयोगिता, हानिकारक त्रुटियों, अत्यधिक अस्वीकृति, मानवीय लागत और प्रतीक्षा समय को एक साथ मापते हैं।
- क्या आप एकल औसत संतुष्टि स्कोर के बजाय चरणबद्ध रोलआउट, ऑफ़लाइन मूल्यांकन और वास्तविक फीडबैक के साथ सत्यापन करते हैं।
पहले पूछे जाने वाले स्पष्टीकरण
- प्राथमिक उपयोगकर्ता कौन है? मान लें कि वह एक कर्मचारी है जिसके पास संगठन के ज्ञान तक पहुंच है, लेकिन उपयोगकर्ता की ओर से उच्च जोखिम वाले निर्णय लेने का अधिकार नहीं है।
- किन कार्यों को स्वचालित किया जा सकता है? मान लें कि कम जोखिम वाली जानकारी प्राप्त करने (retrieval) और ड्राफ्टिंग की अनुमति है; उच्च जोखिम वाले कार्यों के लिए पुष्टि या मानव समीक्षा की आवश्यकता होती है।
- मानव-टीम की क्षमता क्या है? मान लें कि शिफ्ट और प्रतिक्रिया लक्ष्य मौजूद हैं; प्रत्येक अनिश्चित अनुरोध को एस्केलेट नहीं किया जा सकता है।
- कौन सी विफलता अधिक महंगी है? यदि अनिर्दिष्ट है, तो एकल वैश्विक दर को अनुकूलित करने के बजाय गलत उत्तरों और अत्यधिक अस्वीकृति को जोखिम के आधार पर वर्गीकृत करें।
- क्या सुधार के लिए बातचीत को सहेजकर रखा जाएगा? मापने से पहले डेटा रिडक्शन (redaction), एक्सेस, रिटेंशन और ऑप्ट-आउट को स्पष्ट करें।
30-सेकंड का उत्तर
मैं कार्य के जोखिम और साक्ष्य के आधार पर रूट करूंगा: पर्याप्त साक्ष्य वाले कम जोखिम वाले अनुरोधों का उत्तर दें; जब संदर्भ की कमी उत्तर को बदल दे तो न्यूनतम स्पष्टीकरण प्रश्न पूछें; उच्च-जोखिम, अनधिकृत या असत्यापनीय अनुरोधों के लिए अस्वीकार करें और एक सुरक्षित अगला कदम सुझाएं; जब पेशेवर निर्णय या किसी जटिल मामले में मानव की आवश्यकता हो तो एस्केलेट करें। मॉडल द्वारा रिपोर्ट की गई संभावना केवल एक संकेत है, सत्यता की गारंटी नहीं। मैं कार्य और उपयोगकर्ता खंड द्वारा सही-उपयोगी दर, गंभीर त्रुटि दर, स्पष्टीकरण समाधान, अत्यधिक अस्वीकृति, एस्केलेशन दर और प्रतिक्रिया समय को मापूँगा, फिर चरणबद्ध रोलआउट के साथ मान्य करूंगा।
चरण-दर-चरण गहन विश्लेषण
चरण 1: एक कार्य और जोखिम मैट्रिक्स बनाएं
कार्यों को प्रभाव के आधार पर वर्गीकृत करें और चिह्नित करें कि क्या उन्हें संगठन की अनुमतियों, नए तथ्यों या किसी अपरिवर्तनीय कार्रवाई की आवश्यकता है। कम जोखिम वाले रिट्रीवल में शब्दों की मामूली समस्याओं को सहन किया जा सकता है; भुगतान, अनुपालन, चिकित्सा या अनुमति परिवर्तनों के लिए उच्च साक्ष्य सीमा की आवश्यकता होती है। यह मैट्रिक्स मॉडल के सक्षम होने के अस्पष्ट विश्वास के बजाय रूटिंग को नियंत्रित करता है।
चरण 2: चार परिणाम अनुबंध परिभाषित करें
answer में साक्ष्य का दायरा, नयापन और संपादन योग्य परिणाम शामिल हैं। clarify केवल वही प्रश्न पूछता है जो उत्तर को बदल सकते हैं। refuse सीमा और एक सुरक्षित विकल्प बताता है। escalate बताता है कि ऐसा क्यों किया गया, न्यूनतम संदर्भ ले जाता है, और मानव प्रतिक्रिया लक्ष्य बताता है। प्रत्येक परिणाम को मूल्यांकन और अपील के लिए एक कारण कोड (reason code) मिलता है।
चरण 3: साक्ष्य और अनिश्चितता के संकेत स्थापित करें
साक्ष्य अधिकृत रिट्रीवल, संरचित व्यावसायिक स्थिति या मानव पुष्टि से आ सकते हैं। किसी मॉडल के स्व-स्कोर को "सटीकता प्रतिशत" के रूप में प्रदर्शित न करें; प्रत्येक जोखिम श्रेणी के लिए लेबल किए गए डेटा के साथ कैलिब्रेशन, कवरेज और त्रुटि लागत का मूल्यांकन करें। जब साक्ष्य अपर्याप्त होते हैं, तो स्पष्टीकरण या एस्केलेशन एक प्रोडक्ट व्यवहार है, न कि कोई छिपा हुआ मॉडल फेलियर।
चरण 4: स्पष्टीकरण की लागत को नियंत्रित करें
प्रत्येक प्रश्न को एक महत्वपूर्ण अनिश्चितता को कम करना चाहिए। ओपन-एंडेड प्रश्न पूछने से पहले वस्तु, समय सीमा या अनुमति के दायरे के बारे में पूछें। एक प्रश्न सीमा निर्धारित करें, फिर विकल्प दें या एस्केलेट करें। स्पष्टीकरण के चरणों की संख्या, स्पष्टीकरण के बाद समाधान और परित्याग (abandonment) को ट्रैक करें।
चरण 5: अस्वीकृति और एस्केलेशन डिज़ाइन करें
असुरक्षित, अनधिकृत, अपूर्ण-निर्दिष्ट और सेवा-विफलता अस्वीकृतियों को अलग करें क्योंकि उनके अगले कदम अलग होते हैं। एक एस्केलेशन न्यूनतम आवश्यक संदर्भ और अपेक्षित प्रतीक्षा समय साथ ले जाता है। जब कतार भरी हो, तो उच्च प्रभाव वाले मामलों को प्राथमिकता दें; कम जोखिम वाले अनुरोधों को संपादन योग्य ड्राफ्ट या सेल्फ-सर्विस पाथ मिल सकता है।
चरण 6: एक मूल्यांकन सेट और मेट्रिक ट्री बनाएं
सामान्य, अस्पष्ट, प्रतिकूल (adversarial), अनुमति-सीमा और उच्च जोखिम वाले लॉन्ग-टेल अनुरोधों को शामिल करें। शीर्ष-स्तरीय लक्ष्य अस्वीकार्य नुकसान के बिना उपयोगी व्यवहार है। इसे सही-उपयोगी दर, गंभीर त्रुटि दर, अत्यधिक अस्वीकृति, स्पष्टीकरण समाधान, सफल एस्केलेशन, हैंडलिंग समय और लागत में विभाजित करें। प्रत्येक मेट्रिक को कार्य, उपयोगकर्ता, भाषा और अनुमति के अनुसार विभाजित करें।
चरण 7: रोलआउट, रोलबैक और अपील की योजना बनाएं
कम जोखिम वाले कार्यों और आंतरिक उपयोगकर्ताओं के साथ शुरुआत करें। गंभीर त्रुटि, अत्यधिक अस्वीकृति और मानव-क्षमता की सीमाओं को पहले से परिभाषित करें। सीमा पार होने पर विस्तार रोकें या नीति संस्करण को रोलबैक करें। उपयोगकर्ताओं को किसी उत्तर को गलत, अनसुलझा या गलत तरीके से अस्वीकृत के रूप में चिह्नित करने की अनुमति दें; उच्च प्रभाव वाले मामलों को समीक्षा के लिए रूट करें और उन्हें मूल्यांकन सेट में जोड़ें।
चरण 8: प्राइवेसी की रक्षा करें और पुनरावृति (iterate) करें
नीति संस्करण, कारण कोड और केवल आवश्यक संशोधित (redacted) साक्ष्य संग्रहीत करें। रॉ (raw) बातचीत तक पहुंच को प्रतिबंधित करें। प्रशिक्षण और मूल्यांकन डेटा के लिए रिटेंशन, विलोपन और एक्सेस-ऑडिट नियमों की आवश्यकता होती है। एक निश्चित रिग्रेशन सेट पर उपयोगिता, हानि, अस्वीकृति और मानवीय लागत के आधार पर प्रत्येक नीति परिवर्तन की तुलना करें ताकि एक स्थानीय मेट्रिक किसी रिग्रेशन को छिपा न सके।
उच्च-गुणवत्ता वाला नमूना उत्तर
मैं इसे जोखिम-वर्गीकृत निर्णय उत्पाद के रूप में परिभाषित करूंगा। अधिकृत साक्ष्य के साथ कम जोखिम वाले कार्यों का उत्तर दें; जब संदर्भ की कमी उत्तर को बदल दे तो न्यूनतम स्पष्टीकरण प्रश्न पूछें; एक सुरक्षित अगले कदम के साथ उच्च जोखिम वाले, अनधिकृत या असत्यापनीय अनुरोधों को अस्वीकार करें; और न्यूनतम आवश्यक संदर्भ के साथ पेशेवर निर्णय या जटिल विवादों को एस्केलेट करें। एक आंतरिक संभावना केवल एक संकेत है, उपयोगकर्ता के सामने सटीकता का वादा नहीं। मैं सामान्य, अस्पष्ट, प्रतिकूल और उच्च जोखिम वाले मामलों को कवर करने वाला एक मूल्यांकन सेट बनाऊंगा, फिर सही-उपयोगी दर, गंभीर त्रुटियों, अत्यधिक अस्वीकृति, स्पष्टीकरण के बाद के समाधान, एस्केलेशन प्रतीक्षा और लागत को खंडित करूंगा। मैं एक्सेस और रिटेंशन नियंत्रणों के तहत नीति और साक्ष्य रिकॉर्ड को बनाए रखते हुए, स्पष्ट स्टॉप थ्रेसहोल्ड, रोलबैक संस्करणों और अपील पथ के साथ कम जोखिम वाले समूहों में लॉन्च करूंगा।
सामान्य गलतियां
- उपयोगकर्ता कार्यों और त्रुटि लागतों को परिभाषित करने से पहले मॉडल आकारों की तुलना करना।
- मॉडल के स्व-स्कोर को सटीकता के वादे के रूप में दिखाना।
- अंतहीन स्पष्टीकरण प्रश्न पूछना जिससे परित्याग दर बढ़ती है।
- मानव-क्षमता नीति के बिना प्रत्येक अनिश्चित अनुरोध को एस्केलेट करना।
- गंभीर त्रुटियों, अत्यधिक अस्वीकृति और खंडों के बजाय केवल औसत संतुष्टि को मापना।
- बिना किसी कारण या अगले कदम के अस्वीकार करना, जिससे उपयोगकर्ता कार्य पूरा करने या अपील करने में असमर्थ हो जाते हैं।
- एक्सेस, रिडक्शन या विलोपन नियंत्रण के बिना प्रशिक्षण के लिए रॉ बातचीत को अनिश्चित काल तक बनाए रखना।
फॉलो-अप प्रश्न और उत्तर
व्यवसाय न्यूनतम संभव एस्केलेशन दर चाहता है। आप क्या प्रतिक्रिया देंगे?
स्पष्ट करें कि क्या लक्ष्य अनावश्यक एस्केलेशन को कम करना है या हर प्रकार के एस्केलेशन को कम करना है। उच्च जोखिम वाले न्यूनतम स्तर को बनाए रखते हुए कम जोखिम वाले, अच्छी तरह से प्रमाणित कार्यों के लिए स्वचालन का विस्तार करें। यह दिखाने के लिए गंभीर त्रुटियों और मानवीय सुधार लागत का उपयोग करें कि केवल एस्केलेशन दर कैसे छिपे हुए नुकसान पैदा कर सकती है।
उपयोगकर्ता कहता है, "स्पष्टीकरण छोड़ें और इसे मेरे लिए निष्पादित करें।" आप क्या करेंगे?
अपरिवर्तनीय कार्रवाइयों को संपादन योग्य सुझावों से अलग करें। कम जोखिम वाले कार्यों के लिए सारांश और पुष्टि दिखाएं; भुगतान, अनुमति या बाहरी-भेजने की कार्रवाइयों के लिए स्पष्ट प्राधिकरण और ऑडिटेबिलिटी की आवश्यकता रखें। उपयोगकर्ता की प्राथमिकता प्राधिकरण या सुरक्षा सीमाओं को बायपास नहीं कर सकती है।
आपको कैसे पता चलेगा कि कोई स्पष्टीकरण प्रश्न मूल्यवान है?
ऑफ़लाइन डेटा पर प्रश्न से पहले और बाद में उत्तर की गुणवत्ता और समाधान की तुलना करें। सूचना लाभ (information gain), अतिरिक्त टर्न और परित्याग को रिकॉर्ड करें। ऐसे प्रश्न हटाएं जो रूटिंग या उत्तर को नहीं बदलते हैं; जब किसी उच्च-मूल्य वाले प्रश्न का उत्तर देना कठिन हो तो विकल्प प्रदान करें।
मॉडल अपग्रेड के बाद सटीकता में सुधार होता है, लेकिन शिकायतें बढ़ जाती हैं। आप कैसे जांच करेंगे?
गलत उत्तरों, टोन परिवर्तन, अत्यधिक अस्वीकृति और एस्केलेशन में देरी को अलग करने के लिए जोखिम, उपयोगकर्ता समूह, भाषा, अनुमति और नीति संस्करण द्वारा विभाजित करें। विस्तार को रोकें, उच्च प्रभाव वाले मामलों को दोबारा चलाएं (replay), वास्तविक फीडबैक के साथ पुराने और नए मूल्यांकन सेटों की तुलना करें, फिर रोलबैक करें, समूह को सीमित करें, या रूटिंग सीमाओं को समायोजित करें।