प्रॉम्प्ट और संदर्भ
यह प्रश्न किसी इंसिडेंट के बाद सीखने की प्रक्रिया (learning loop) का परीक्षण करता है, न कि केवल डिबगिंग की कहानी सुनाने का। एक मजबूत उत्तर में प्रभाव, टाइमलाइन, ट्रिगर और योगदान देने वाले कारक, प्रतिक्रिया, एक्शन आइटम, समीक्षा और साझाकरण शामिल होते हैं। मान लें कि इंसिडेंट को शांत कर दिया गया है और साक्ष्यों में अलर्ट, डिप्लॉयमेंट, परिवर्तन, लॉग, ऑन-कॉल नोट्स और उपयोगकर्ता-प्रभाव डेटा शामिल हैं; पहले गंभीरता और समय-सीमा स्पष्ट करें।
ब्लेमलेस (दोषमुक्त) होने का मतलब जिम्मेदारी से मुक्त होना नहीं है। यह मानकर चलता है कि प्रतिभागियों ने उस समय उपलब्ध जानकारी के आधार पर उचित इरादे से काम किया था, और फिर यह सिस्टम, प्रक्रिया, टूल और जानकारी में मौजूद कमियों की जांच करता है। इसमें अभी भी एक इंसिडेंट ओनर, एक्शन ओनर और देय तिथियां तय की जाती हैं। दुर्भावनापूर्ण आचरण, नीति उल्लंघन या अनुपालन जांच को एक अलग अधिकृत प्रक्रिया का पालन करना चाहिए।
यह परिदृश्य SRE, बैकएंड, प्लेटफॉर्म, टेक्निकल-लीड और क्रॉस-फंक्शनल इंजीनियरिंग इंटरव्यू के लिए उपयुक्त है। एक सामान्य भूमिका के लिए, यह यह भी जांचता है कि क्या आप किसी एक व्यक्ति पर दोष मढ़ने या खुद को हीरो साबित करने के बजाय विफलता को एक पुन: प्रयोज्य प्रक्रिया सुधार में बदल सकते हैं।
इंटरव्यूअर क्या मूल्यांकन करते हैं
पहला, क्या आप उद्देश्य और दायरे को परिभाषित कर सकते हैं? Google SRE पोस्टमॉर्टम को प्रभाव को दस्तावेज करने, मूल और योगदान देने वाले कारणों को समझने और निवारक उपायों को लागू करने के तरीके के रूप में देखता है; सेवा की बहाली केवल शुरुआती बिंदु है।
दूसरा, क्या आप पश्चदृष्टि पूर्वाग्रह (hindsight bias) से बचते हुए तथ्यों का पुनर्निर्माण कर सकते हैं? टाइमलाइन की प्रत्येक प्रविष्टि में एक स्रोत, समय क्षेत्र (timezone) और विश्वसनीयता स्तर होना चाहिए। "कोई लापरवाह था" के बजाय उस अवलोकन योग्य संकेत, अनुमति, डिफ़ॉल्ट या प्रक्रिया अंतराल को दर्ज करें जिसने उस निर्णय को प्रभावित किया।
तीसरा, क्या आप मनोवैज्ञानिक सुरक्षा और निष्पादन दोनों को बनाए रख सकते हैं? कार्रवाइयों के लिए एक अकेला ओनर, प्राथमिकता, ट्रैकर और एक सत्यापन योग्य अंतिम स्थिति की आवश्यकता होती है। "मॉनिटरिंग में सुधार करें" या "अधिक सावधान रहें" यह साबित नहीं कर सकते कि कोई बदलाव हुआ है।
चौथा, क्या आप दबाव को संभाल सकते हैं? जब कोई हितधारक दोष मढ़ना चाहता है, तो आचरण जांच को सिस्टम से सीखने की प्रक्रिया से अलग करें, रिपोर्टिंग जोखिम को समझाने के लिए प्रभाव और साक्ष्य का उपयोग करें, और फिर भी समाधान के लिए स्वामित्व को स्पष्ट रखें।
स्पष्टीकरण के लिए प्रश्न
- गंभीरता और उपयोगकर्ता पर क्या प्रभाव पड़ा? प्रभावित उपयोगकर्ता, अवधि, डेटा अखंडता और SLO प्रभाव समीक्षा की गहराई निर्धारित करते हैं।
- समीक्षा का उद्देश्य क्या है? क्या यह सीखना और रोकथाम है, या कोई अनुपालन, कदाचार या प्रदर्शन जांच भी शामिल है?
- कौन भाग ले सकता है और दस्तावेज़ पढ़ सकता है? संवेदनशील डेटा को संभालते हुए ऑन-कॉल, रिलीज़, सपोर्ट, प्रभावित सेवाओं और व्यावसायिक भागीदारों को शामिल करें।
- साक्ष्य कहाँ सुरक्षित रखे गए हैं? लॉग, अलर्ट, डिप्लॉयमेंट रिकॉर्ड, टिकट, संचार, डेटा प्रतिधारण (retention) और समय क्षेत्र की पुष्टि करें।
- कार्रवाइयां सामान्य कार्य में कैसे शामिल होती हैं? ट्रैकर, प्राथमिकता नियम, ओनर मॉडल और स्वीकृति साक्ष्य को समझें ताकि मीटिंग के बाद भी फॉलो-अप जारी रहे।
30-सेकंड का उत्तर
"मैं पहले दायरे, प्रभाव और उद्देश्य की पुष्टि करता हूँ, सीखने की समीक्षा को किसी भी अधिकृत आचरण जांच से अलग रखता हूँ। बैठक से पहले मैं अलर्ट, परिवर्तन, लॉग और संचार को संरक्षित करके स्रोतों के साथ एक टाइमलाइन तैयार करता हूँ। बैठक में मैं दोषमुक्त भाषा का उपयोग करता हूँ और बलि का बकरा खोजने के बजाय ट्रिगर, योगदान देने वाले कारकों, प्रतिक्रिया की ताकत व कमियों और गायब सुरक्षा उपायों की जांच करता हूँ। मैं निष्कर्षों को प्रकार, प्राथमिकता, एकल ओनर, देय तिथि, ट्रैकर और सत्यापन मीट्रिक के साथ एक्शन आइटम में बदलता हूँ, फिर दस्तावेज़ की समीक्षा करके उन टीमों के साथ साझा करता हूँ जो इससे सीख सकती हैं या कार्रवाई कर सकती हैं। यदि कोई किसी दोषी की मांग करता है, तो मैं साक्ष्य और रिपोर्टिंग जोखिम प्रस्तुत करता हूँ, जांच को स्वतंत्र रखता हूँ, और सिस्टम व प्रक्रिया में सुधार जारी रखता हूँ।"
चरण-दर-चरण उत्तर
चरण 1: ट्रिगर और प्रतिभागियों को परिभाषित करें
पुष्टि करें कि क्या इंसिडेंट समीक्षा मानदंडों को पूरा करता है जैसे उपयोगकर्ता-दृश्यमान डाउनटाइम, डेटा हानि, मैन्युअल रोलबैक, अत्यधिक रिकवरी समय या मॉनिटरिंग विफलता। एक फैसिलिटेटर और एक दस्तावेज़ ओनर असाइन करें। उन लोगों को आमंत्रित करें जो तथ्य जोड़ सकते हैं या कार्रवाइयों को लागू कर सकते हैं, न कि किसी मुकदमे के दर्शकों को।
चरण 2: कहानी लिखने से पहले साक्ष्य एकत्र करें
एक ही समय क्षेत्र में एक टाइमलाइन बनाएं। प्रत्येक पंक्ति समय, घटना, स्रोत और विश्वसनीयता दर्ज करती है। डिटेक्शन, मिटिगेशन, रिकवरी और पुनर्स्थापित प्रभाव की पुष्टि को अलग-अलग रखें। "मूल कारण ऑपरेटर की त्रुटि थी" से शुरुआत न करें; उस इंटरफ़ेस, डिफ़ॉल्ट, अनुमति, प्रशिक्षण और अनुमोदन पथ को रिकॉर्ड करें जो उस समय दिखाई दे रहे थे।
Time | Fact | Source | Confidence
10:02 | Deployment started | Release system | High
10:07 | Error rate crossed threshold | Metrics panel | High
10:11 | Rollback completed | Change record | Highचरण 3: ट्रिगर, योगदानकर्ताओं और अनुपस्थित सुरक्षा उपायों को अलग करें
ट्रिगर तात्कालिक घटना है। योगदान देने वाले कारक बताते हैं कि प्रभाव क्यों बढ़ा या अधिक समय तक बना रहा। अनुपस्थित सुरक्षा उपाय बताते हैं कि घटना का पहले पता क्यों नहीं चला या उसे रोका क्यों नहीं गया। पूछें कि उस समय वह निर्णय क्यों उचित लगा, कौन सी जानकारी गायब थी, और कौन सा चेकपॉइंट प्रभाव के दायरे (blast radius) को सीमित कर सकता था। Five Whys या फॉल्ट ट्री मदद कर सकते हैं, लेकिन किसी जटिल इंसिडेंट को केवल एक कारण में न समेटें।
चरण 4: प्रतिक्रिया की समीक्षा करें
रिकॉर्ड करें कि क्या अच्छा रहा, क्या खराब रहा, और क्या बाल-बाल बचा। मूल्यांकन करें कि क्या मिटिगेशन ने प्रभाव के दायरे को कम किया, क्या समय पर एस्केलेशन हुआ, और क्या संचार ने निर्णय लेने में मदद की। केवल रिकवरी की गति ही पर्याप्त नहीं है; रोलबैक नियंत्रणों की कमी, अनुमति सीमाओं और भूमिका की स्पष्टता का निरीक्षण करें।
चरण 5: कार्रवाइयों को सत्यापन योग्य प्रतिबद्धताएं बनाएं
Google SRE उदाहरण एक्शन आइटम को एक प्रकार, प्राथमिकता, एकल ओनर, ट्रैकिंग पहचानकर्ता और मापने योग्य अंतिम स्थिति देते हैं। आवश्यकतानुसार रोकथाम, डिटेक्शन, मिटिगेशन, रिकवरी या सीखने को कवर करें। प्रत्येक आइटम को साक्ष्य के साथ उत्तर देना चाहिए कि "क्या यह पूरा हो गया है?"
| कार्रवाई | प्रकार | ओनर / देय तिथि | सत्यापन |
|---|---|---|---|
| बिना रोलबैक वाले रिलीज़ को ब्लॉक करें | Prevent | रिलीज़ प्लेटफ़ॉर्म / 2 सप्ताह | CI ब्लॉकिंग टेस्ट पास होता है और असुरक्षित रिलीज़ मर्ज नहीं हो सकती |
| त्रुटि दर और प्रभाव के दायरे पर अलर्ट | Detect | ऑन-कॉल लीड / 1 सप्ताह | अभ्यास अभ्यास (exercise) अलर्ट ट्रिगर करता है और अधिसूचना 5 मिनट के भीतर आती है |
| वन-क्लिक रोलबैक जोड़ें | Mitigate | सर्विस ओनर / 3 सप्ताह | नियंत्रित अभ्यास लक्ष्य के भीतर सेवा को पुनर्स्थापित करता है |
| इंसिडेंट भूमिकाओं और एस्केलेशन को अपडेट करें | Learn | इंसिडेंट मैनेजर / 1 सप्ताह | एक नया रिस्पॉन्डर रनबुक से हैंडऑफ़ पूरा करता है |
चरण 6: समीक्षा करें, साझा करें और ट्रैक करें
सर्विस और तकनीकी ओनर पूर्णता, प्रभाव, विश्लेषण की गहराई और प्राथमिकताओं की समीक्षा करते हैं। स्वीकृत दस्तावेज़ को गोपनीयता नियंत्रणों के साथ एक खोजने योग्य इंसिडेंट रिपॉजिटरी में प्रकाशित करें। कार्रवाइयों को सामान्य कार्य से जोड़ें, फिर समय सीमा समाप्त हो चुके आइटम, बार-बार होने वाले इंसिडेंट और इस बात के साक्ष्य का निरीक्षण करें कि पूर्ण किए गए परिवर्तन जोखिम को कम करते हैं। एक असमीक्षित या अनट्रैक किया गया दस्तावेज़ संगठनात्मक सीखने में बहुत कम योगदान देता है।
चरण 7: दोषी खोजने के दबाव को संभालें
जवाबदेही और जोखिम नियंत्रण की आवश्यकता को स्वीकार करें, फिर दो समानांतर रास्तों की व्याख्या करें: अधिकृत जांचकर्ता साक्ष्य का उपयोग करके कदाचार या अनुपालन को संभालते हैं; सीखने की समीक्षा यह पूछती है कि सिस्टम ने इंसिडेंट की अनुमति कैसे दी और पुनरावृत्ति को कैसे रोका जाए। प्रासंगिक होने पर बताएं कि किसी व्यक्ति ने क्या किया, लेकिन चरित्र हनन या अपमानजनक भाषा से बचें। एक एक्शन ओनर डिलीवरी का मालिक होता है, व्यक्तिगत दोष का नहीं।
उच्च गुणवत्ता वाला नमूना उत्तर
"मैं सबसे पहले गंभीरता, उपयोगकर्ता प्रभाव, डेटा जोखिम और समीक्षा के उद्देश्य की पुष्टि करूँगा। यदि उद्देश्य सीखना और रोकथाम है, तो मैं प्रदर्शन या आचरण की किसी भी जांच को अलग रखूँगा। बैठक से पहले मैं अलर्ट, लॉग, डिप्लॉयमेंट रिकॉर्ड, टिकट और संचार को सुरक्षित रखूँगा, समय क्षेत्र को सामान्य करूँगा और स्रोतों के साथ एक टाइमलाइन तैयार करूँगा। मैं ऑन-कॉल, रिलीज़, सपोर्ट, प्रभावित सेवा और एक्शन ओनर्स को आमंत्रित करूँगा।
मैं एक दोषमुक्त कार्य समझौते के साथ शुरुआत करूँगा: लोगों को लेबल किए बिना, उस समय उपलब्ध जानकारी, सिस्टम और प्रक्रियाओं का विश्लेषण करना। हम टाइमलाइन को सत्यापित करेंगे, फिर ट्रिगर, योगदानकर्ताओं, गायब सुरक्षा उपायों और क्या अच्छा हुआ, खराब हुआ या लगभग गलत होने वाला था, इसे अलग करेंगे। प्रत्येक निष्कर्ष के लिए मैं पूछूँगा कि यह किस सिस्टम, टूल या प्रक्रिया परिवर्तन का समर्थन करता है।
प्रत्येक कार्रवाई एक रोकथाम, डिटेक्शन, मिटिगेशन या रिकवरी प्रकार, प्राथमिकता, एकल ओनर, देय तिथि, ट्रैकर और स्वीकृति साक्ष्य निर्दिष्ट करेगी। उदाहरण के लिए, 'मॉनिटरिंग में सुधार करें' को बदलकर 'जब त्रुटि दर और प्रभावित इंस्टेंस का हिस्सा सहमत सीमा को पार कर जाए, तो ओनर को पेज करें और एक अभ्यास में पांच मिनट के भीतर डिलीवरी प्रदर्शित करें' करेंगे। ओनर्स ड्राफ्ट की समीक्षा करते हैं, यह टीम के बैकलॉग में प्रवेश करता है, और हम इसके पूरा होने व जोखिम में कमी का निरीक्षण करते हैं।
यदि कोई हितधारक दोषी की मांग करता है, तो मैं समझाऊंगा कि जवाबदेही की जांच स्वतंत्र और साक्ष्य-आधारित होनी चाहिए, और दोष मढ़ने से भविष्य की रिपोर्टिंग में देरी हो सकती है। मैं तथ्यों या स्वामित्व को नहीं छिपाऊंगा। इसका परिणाम एक प्रलेखित शिक्षण मार्ग और सिस्टम में स्थायी सुधार है।"
सामान्य गलतियाँ
- दोषमुक्त को जिम्मेदारी-मुक्त मानना → कार्रवाइयों के पास कोई डिलीवरी पथ नहीं होता → आचरण जांच को कार्रवाई के स्वामित्व से अलग करें।
- केवल एक मूल कारण बताना → प्रभाव को बढ़ाने वाली परिस्थितियां गायब हो जाती हैं → ट्रिगर, योगदानकर्ताओं और गायब सुरक्षा उपायों को अलग करें।
- याददाश्त पर भरोसा करना → पश्चदृष्टि पूर्वाग्रह टाइमलाइन को विकृत कर देता है → साक्ष्य सुरक्षित रखें और स्रोतों व विश्वसनीयता को रिकॉर्ड करें।
- 'मॉनिटरिंग में सुधार करें' लिखना → पूर्णता का आकलन नहीं किया जा सकता → सीमाएं, डिलीवरी का समय, अभ्यास और साक्ष्य जोड़ें।
- प्रत्येक कार्रवाई को समान प्राथमिकता देना → गंभीर जोखिम प्रतीक्षा में रहता है → प्रभाव, पुनरावृत्ति की संभावना और प्रयास के आधार पर रैंक करें।
- केवल ऑन-कॉल लोगों को आमंत्रित करना → क्रॉस-टीम तथ्य और प्रभावित उपयोगकर्ता छूट जाते हैं → योगदानकर्ताओं और कार्यान्वयनकर्ताओं को आमंत्रित करें।
- दस्तावेज़ लिखे जाने पर प्रक्रिया समाप्त कर देना → कार्रवाइयां दैनिक कार्य में खो जाती हैं → उन्हें ट्रैक करें और समय सीमा समाप्त या बार-बार होने वाले इंसिडेंट का निरीक्षण करें।
- जवाबदेही बनाने के लिए शर्मिंदा करने का सहारा लेना → रिपोर्टिंग कम सुरक्षित हो जाती है → साक्ष्य के साथ सिस्टम की कमियों का वर्णन करें और अलग से जांच करें।
फॉलो-अप और उत्तर
फॉलो-अप 1: क्या दोषमुक्त संस्कृति किसी स्पष्ट नीति उल्लंघन को माफ करती है?
नहीं। समीक्षा का लक्ष्य सीखना है; अधिकृत प्रक्रियाएं दुर्भावनापूर्ण व्यवहार, जानबूझकर किए गए उल्लंघनों या अनुपालन मुद्दों की जांच करती हैं। समीक्षा अभी भी तथ्यों, अनुमतियों और गायब नियंत्रणों को रिकॉर्ड करती है और समाधान ओनर्स को नियुक्त करती है।
फॉलो-अप 2: आप कैसे जानते हैं कि कोई कार्रवाई केवल दिखावा नहीं है?
एकल ओनर, देय तिथि, ट्रैकर और सत्यापन योग्य अंतिम स्थिति की आवश्यकता रखें। एक रोकथाम आइटम में एक ब्लॉकिंग परीक्षण हो सकता है, डिटेक्शन आइटम में एक अभ्यास, और एक मिटिगेशन आइटम में एक रिकवरी लक्ष्य हो सकता है। "जागरूकता बढ़ाएं" के पास कोई स्वीकृति साक्ष्य नहीं होता है।
फॉलो-अप 3: क्या आप हर कारण का पता चलने से पहले इसे प्रकाशित कर सकते हैं?
अनिश्चितता लेबल, ज्ञात प्रभाव, टाइमलाइन, वर्तमान परिकल्पनाओं और खुले प्रश्नों के साथ एक तथ्यात्मक ड्राफ्ट प्रकाशित करें। योगदानकर्ताओं और कार्रवाइयों को बाद में जोड़ें। एक समय पर, ईमानदार ड्राफ्ट महीनों बाद याददाश्त से पुनर्निर्मित दस्तावेज़ की तुलना में अधिक सीख सुरक्षित रखता है।
फॉलो-अप 4: आप साझा करने वाले दर्शकों का चयन कैसे करते हैं?
व्यक्तिगत, ग्राहक और अनावश्यक संवेदनशील डेटा को हटाते हुए उन लोगों के साथ साझा करें जो सीख सकते हैं या बदलाव लागू कर सकते हैं। क्रॉस-टीम समीक्षा समान जोखिमों का पता लगाती है; यदि कानूनी या सुरक्षा सीमाएं लागू होती हैं, तो कारण का दस्तावेजीकरण करें और एक सुरक्षित सारांश प्रदान करें।