प्रॉम्प्ट और संदर्भ
एक बहुभाषी साइट में सार्वजनिक पृष्ठ, प्रमाणित (authenticated) पृष्ठ और अस्थायी पूर्वावलोकन पृष्ठ हैं। टीम ने Disallow के साथ robots.txt में पूर्वावलोकन पथ जोड़ा, पृष्ठ पर noindex जोड़ा, और प्रत्येक भाषा के लिए एक canonical URL का उपयोग किया। लॉन्च के बाद, पूर्वावलोकन URL अभी भी खोज में दिखाई दे रहे हैं और कुछ भाषा पृष्ठों में गलत इंडेक्स किया गया URL है। तीनों सिग्नलों की सीमाओं को समझाएं और माइग्रेशन व सत्यापन योजना का प्रस्ताव दें।
साक्षात्कारकर्ता क्या जांच रहा है
- क्या आप क्रॉलिंग, इंडेक्सिंग और पसंदीदा-URL चयन को अलग करते हैं।
- क्या आप जानते हैं कि robots.txt द्वारा ब्लॉक किया गया क्रॉलर noindex को नहीं देख सकता है।
- क्या आप HTML meta robots, HTTP
X-Robots-Tag, canonical, रीडायरेक्ट और विरोधों (conflicts) को संभाल सकते हैं। - क्या आप बहुभाषी, कैश, रोलबैक और Search Console जांच डिज़ाइन कर सकते हैं।
पहले पूछे जाने वाले स्पष्टीकरण प्रश्न
- क्या लक्ष्य क्रॉलिंग को ब्लॉक करना, इंडेक्सिंग को ब्लॉक करना, या डुप्लिकेट URL को समेकित करना है?
- क्या खोज क्रॉलर को noindex या canonical खोजने के लिए पृष्ठ को फ़ेच करना होगा?
- क्या पूर्वावलोकन पृष्ठ प्रमाणित हैं, और क्या बाहरी लिंक या साइटमैप उन्हें संदर्भित कर सकते हैं?
- क्या भाषा पृष्ठ अपने स्वयं के canonical और hreflang के साथ आमने-सामने (one-to-one) अनुवाद हैं?
- ये हेडर और टैग कहाँ सेट किए गए हैं: CDN, एप्लिकेशन सर्वर, या HTML टेम्पलेट?
30-सेकंड उत्तर ढांचा
मैं क्रॉलिंग, इंडेक्सिंग और कैनोनिकलाइज़ेशन को अलग करता हूँ। robots.txt नियंत्रित करता है कि क्या कोई क्रॉलर संसाधन का अनुरोध कर सकता है; noindex नियंत्रित करता है कि क्या फ़ेच किया गया पृष्ठ इंडेक्स में प्रवेश करता है; canonical डुप्लिकेट या लगभग-डुप्लिकेट URL के लिए एक प्राथमिकता है, रीडायरेक्ट नहीं। पूर्वावलोकन पृष्ठ प्रमाणित होने चाहिए या noindex के साथ क्रॉल करने योग्य होने चाहिए। प्रोडक्शन भाषा पृष्ठों को स्व-कैनोनिकलाइज़ (self-canonicalize) होना चाहिए और hreflang के साथ एक-दूसरे को क्रॉस-रेफ़रेंस करना चाहिए। मैं रेंडर किए गए रिस्पॉन्स, क्रॉलर एक्सेस, कैश व्यवहार और Search Console रिपोर्टों को सत्यापित करूँगा।
चरण-दर-चरण गहन उत्तर
चरण 1: तीन नियंत्रण तलों (control planes) को परिभाषित करें
साइट रूट पर robots.txt यह उत्तर देता है कि क्या क्रॉलर किसी पथ का अनुरोध कर सकता है। यह इंडेक्स किए गए URL को नहीं हटाता है और यह गारंटी नहीं देता है कि बाहरी लिंक के माध्यम से खोजा गया URL परिणामों से बाहर रहेगा। noindex पूर्वावलोकन, खोज-परिणाम, या अन्य गैर-सार्वजनिक पृष्ठों के लिए एक पृष्ठ-स्तरीय इंडेक्सिंग निर्देश है। canonical डुप्लिकेट या लगभग-डुप्लिकेट सामग्री के लिए एक URL-चयन सिग्नल है।
चरण 2: Disallow के पीछे noindex को न छिपाएं
जब कोई पथ Disallow भी होता है, तो हो सकता है कि क्रॉलर पृष्ठ को फ़ेच न करे और इसलिए वह इसके meta robots टैग या X-Robots-Tag: noindex को नहीं देख सकता है। noindex को दृश्यमान बनाने के लिए, क्रॉलिंग की अनुमति दें और HTML या HTTP हेडर में noindex लौटाएं। संवेदनशील सामग्री के लिए क्रॉलर निर्देशों के बजाय प्रमाणीकरण या प्राधिकरण की आवश्यकता होती है। माइग्रेशन के दौरान, क्रॉल ब्लॉक को हटाएं और पुनः क्रॉलिंग व इंडेक्स अपडेट की प्रतीक्षा करें।
चरण 3: पृष्ठ-स्तरीय noindex वाहक चुनें
HTML meta name="robots" content="noindex,follow" का उपयोग कर सकता है; गैर-HTML संसाधन और गेटवे X-Robots-Tag का उपयोग कर सकते हैं। टेम्पलेट और रिस्पॉन्स हेडर का परीक्षण करें, और पुराने CDN ऑब्जेक्ट को अमान्य (invalidate) करें। follow उस पृष्ठ के लिए लिंक खोज को बनाए रख सकता है जिसे इंडेक्स से बाहर रखा जाना है, लेकिन यह एक्सेस नियंत्रण नहीं है और क्रॉलर व्यवहार अभी भी लागू होता है।
चरण 4: canonical और भाषा मैपिंग डिज़ाइन करें
प्रत्येक इंडेक्स करने योग्य भाषा पृष्ठ में आम तौर पर सुसंगत स्थिति, स्कीम, होस्ट और पथ के साथ एक पूर्ण (absolute), पहुंच योग्य, स्व-संदर्भित canonical होना चाहिए। प्रत्येक अनुवाद को डिफ़ॉल्ट भाषा में कैनोनिकलाइज़ न करें अन्यथा अनुवादों को डुप्लिकेट के रूप में समेकित किया जा सकता है। विकल्पों के लिए hreflang का उपयोग करें, और सुनिश्चित करें कि साइटमैप, आंतरिक लिंक और canonical समान कैनोनिकल URL सेट का उपयोग करते हैं।
चरण 5: माइग्रेशन, रीडायरेक्ट और कैश संभालें
URL माइग्रेशन के लिए सर्वर-साइड स्थायी रीडायरेक्ट का उपयोग करें; पुराने पृष्ठ का canonical रीडायरेक्ट की जगह नहीं लेता है। साइटमैप सबमिट करने से पहले, नए पृष्ठ के 200 रिस्पॉन्स, canonical, robots निर्देशों और hreflang को सत्यापित करें। URL और हेडर द्वारा CDN रिस्पॉन्स को अमान्य करें ताकि एज आपस में सहमत हों। रोलबैक को मिश्रित संस्करणों को उजागर करने के बजाय पुरानी रीडायरेक्ट और इंडेक्सिंग नीति को बनाए रखना चाहिए।
चरण 6: एक अवलोकन योग्य निदान पथ बनाएं
पहले robots.txt एक्सेस की जांच करें, फिर टेम्पलेट के साथ noindex और canonical की तुलना करने के लिए लाइव HTML और रिस्पॉन्स हेडर का निरीक्षण करें। इसके बाद Search Console क्रॉल और इंडेक्स स्थिति, Google-चयनित canonical, अंतिम क्रॉल समय और साइटमैप खोज का निरीक्षण करें। ऑडिटेबिलिटी के लिए URL, भाषा, स्थिति, canonical, robots निर्देश, कैश आयु और रिलीज़ संस्करण को लॉग करें।
चरण 7: स्वीकृति और प्रतिगमन (regression) परीक्षण परिभाषित करें
प्रत्येक पृष्ठ प्रकार के लिए अभिकथन (assertions) बनाएं: पूर्वावलोकन क्रॉल करने योग्य और noindex हैं; प्रोडक्शन भाषा पृष्ठ 200 लौटाते हैं और स्व-कैनोनिकलाइज़ करते हैं; पुराने URL नए URL पर 301 करते हैं; सुरक्षित पृष्ठ सामग्री लीक नहीं करते हैं। केस और ट्रेलिंग-स्लैश सीमाओं के लिए robots नियमों, HTML/हेडर विरोधों, मल्टी-एज कैश अमान्यकरण और नमूनाकृत Search Console स्थितियों का परीक्षण करें।
उच्च-गुणवत्ता वाला नमूना उत्तर
सिग्नल विभिन्न समस्याओं को हल करते हैं: robots.txt अनुरोधों को नियंत्रित करता है, noindex इंडेक्स समावेशन को नियंत्रित करता है, और canonical डुप्लिकेट के बीच पसंदीदा URL का सुझाव देता है। पूर्वावलोकन पृष्ठ को ब्लॉक भी नहीं किया जा सकता और साथ ही noindex को प्रदर्शित करने की अपेक्षा भी नहीं की जा सकती; क्रॉलरों को इसे noindex के साथ फ़ेच करने दें, और रहस्यों (secrets) के लिए प्रमाणीकरण का उपयोग करें। प्रत्येक प्रोडक्शन भाषा पृष्ठ को स्व-कैनोनिकलाइज़ करना चाहिए और hreflang का उपयोग करना चाहिए, जबकि साइटमैप और आंतरिक लिंक सहमत हों। माइग्रेशन के लिए 301 रीडायरेक्ट का उपयोग करें, फिर robots, लाइव रिस्पॉन्स, कैश, क्रॉल लॉग और Search Console को परत-दर-परत सत्यापित करें।
सामान्य गलतियाँ
- robots.txt को एक गारंटीकृत निष्कासन तंत्र के रूप में मानना।
- किसी पृष्ठ को ब्लॉक करना और क्रॉलरों द्वारा उसके noindex को पढ़ने की अपेक्षा करना।
- प्रत्येक भाषा पृष्ठ को एक ही भाषा में कैनोनिकलाइज़ करना।
- CDN हेडर और पुराने ऑब्जेक्ट को अनदेखा करते हुए केवल स्रोत HTML की जांच करना।
- आवश्यक रीडायरेक्ट या एक्सेस नियंत्रण के बजाय canonical का उपयोग करना।
अनुवर्ती प्रश्न और उत्तर
अनुवर्ती 1: ब्लॉक किया गया URL अभी भी परिणामों में क्यों दिखाई दे सकता है?
एक क्रॉलर बाहरी लिंक के माध्यम से URL की खोज कर सकता है लेकिन उसकी सामग्री को फ़ेच करने में असमर्थ हो सकता है। खोज इंजन अभी भी URL या सीमित जानकारी प्रदर्शित कर सकता है। इंडेक्सिंग को ब्लॉक करने के लिए, पृष्ठ को noindex के साथ फ़ेच करने योग्य बनाएं या प्रमाणीकरण की आवश्यकता लागू करें।
अनुवर्ती 2: क्या canonical एक अनिवार्य निर्देश है?
यह एक सिग्नल है जिसे अनदेखा किया जा सकता है। सामग्री, रीडायरेक्ट, आंतरिक लिंक, साइटमैप और canonical टैग सहमत होने चाहिए; canonical कोई एक्सेस नियंत्रण या हटाने की गारंटी नहीं है।
अनुवर्ती 3: क्या होगा यदि पूर्वावलोकन को लिंक के माध्यम से खोजने योग्य रहना चाहिए?
क्रॉलिंग की अनुमति दें और noindex लौटाएं। यदि पूर्वावलोकन संवेदनशील है, तो लॉगिन, हस्ताक्षरित URL, या किसी अन्य एक्सेस-नियंत्रण तंत्र का उपयोग करें। रहस्यों को छिपाने के लिए robots.txt पर निर्भर न रहें।
अनुवर्ती 4: आप HTTP-हेडर और meta-robots विरोध को कैसे हल करते हैं?
दोनों को एक ही पृष्ठ-नीति स्रोत से उत्पन्न करें और मूल (origin) व एज रिस्पॉन्स का नमूना लें। यह अनुमान न लगाएं कि कौन सा सिग्नल जीता; वास्तविक रिस्पॉन्स, HTML और लक्षित खोज-इंजन दस्तावेज़ीकरण का निरीक्षण करें, फिर एक स्पष्ट नीति जारी करें।
अनुवर्ती 5: आप बहुभाषी canonical लूप का परीक्षण कैसे करते हैं?
प्रत्येक भाषा URL को फ़ेच करें और एक पूर्ण, पहुंच योग्य, स्व-संदर्भित canonical को सत्यापित करें। फिर hreflang पारस्परिकता और भाषा कोड सत्यापित करें, और जांचें कि साइटमैप और आंतरिक लिंक किसी पुराने होस्ट या गलत भाषा की ओर इंगित नहीं करते हैं।