Knowledgebase Profitserver सेवासँग काम गर्ने सरल निर्देशनहरू
मुख्य Knowledgebase रोबोट.txt

रोबोट.txt


यस लेखमा, हामी वेबसाइटहरूमा ट्राफिक व्यवस्थापनमा robots.txt फाइलको प्रमुख भूमिकाको जाँच गर्नेछौं, यसको उपस्थितिको आवश्यकताको बारेमा छलफल गर्नेछौं, र प्रभावकारी पृष्ठ अनुक्रमणिका व्यवस्थापनको लागि यसलाई सेटअप गर्न सिफारिसहरू प्रदान गर्नेछौं। थप रूपमा, हामी robots.txt फाइलमा सही निर्देशनहरूको प्रयोगका उदाहरणहरूको विश्लेषण गर्नेछौं र यसको सेटिङहरूको शुद्धता कसरी जाँच गर्ने भन्ने बारे मार्गदर्शन प्रदान गर्नेछौं।

Robots.txt किन आवश्यक छ?

Robots.txt साइटको सर्भरमा यसको रूट डाइरेक्टरीमा अवस्थित फाइल हो। यसले खोज इन्जिन रोबोटहरूलाई स्रोतको सामग्री कसरी स्क्यान गर्ने भनेर जानकारी दिन्छ। यस फाइलको उचित प्रयोगले अनावश्यक पृष्ठहरूको अनुक्रमणिका रोक्न मद्दत गर्दछ, गोप्य डेटा सुरक्षित गर्दछ, र खोज परिणामहरूमा SEO अनुकूलन र साइटको दृश्यताको दक्षता सुधार गर्न सक्छ। robots.txt को कन्फिगरेसन निर्देशनहरू मार्फत गरिन्छ, जुन हामी थप हेर्नेछौं।

Robots.txt मा निर्देशनहरू सेट गर्दै

प्रयोगकर्ता एजेन्ट

प्राथमिक निर्देशनलाई प्रयोगकर्ता-एजेन्ट भनेर चिनिन्छ, जहाँ हामी रोबोटहरूको लागि विशेष किवर्ड सेट गर्छौं। यो शब्द पत्ता लगाएपछि, रोबोटले बुझ्छ कि यो नियम विशेष रूपमा यसको लागि हो।

robots.txt फाइलमा प्रयोगकर्ता-एजेन्ट प्रयोग गर्ने उदाहरण विचार गर्नुहोस्:

User-Agent: *
Disallow: /private/

यो उदाहरणले संकेत गर्छ कि सबै खोज रोबोटहरू (" * " प्रतीक द्वारा प्रतिनिधित्व गरिएको ) ले /private/ निर्देशिकामा अवस्थित पृष्ठहरूलाई बेवास्ता गर्नुपर्छ ।

विशिष्ट खोज रोबोटहरूको लागि निर्देशन कस्तो देखिन्छ भनेर यहाँ दिइएको छ:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

यस अवस्थामा, गुगलबोट खोज रोबोटले /admin/ निर्देशिकामा रहेका पृष्ठहरूलाई बेवास्ता गर्नुपर्छ , जबकि बिंगबोटले /private/ निर्देशिकामा रहेका पृष्ठहरूलाई बेवास्ता गर्नुपर्छ ।

नदिनुहोस्

Disallow ले खोज रोबोटहरूलाई वेबसाइटमा कुन URL हरू छोड्ने वा अनुक्रमणिका नगर्ने भनेर बताउँछ। यो निर्देशन खोज इन्जिनहरूद्वारा अनुक्रमित हुनबाट संवेदनशील डेटा वा कम-गुणस्तरको सामग्री पृष्ठहरू लुकाउन चाहँदा उपयोगी हुन्छ। यदि robots.txt फाइलमा प्रविष्टि Disallow: /directory/ समावेश छ भने, रोबोटहरूलाई निर्दिष्ट निर्देशिकाको सामग्रीहरूमा पहुँच अस्वीकार गरिनेछ। उदाहरणका लागि,

User-agent: *
Disallow: /admin/

यो मानले सबै रोबोटहरूले /admin/ बाट सुरु हुने URL हरूलाई बेवास्ता गर्नुपर्छ भन्ने संकेत गर्छ । कुनै पनि रोबोटद्वारा सम्पूर्ण साइटलाई अनुक्रमित हुनबाट रोक्नको लागि, नियमको रूपमा रूट डाइरेक्टरी सेट गर्नुहोस्:

User-agent: *
Disallow: /

अनुमति

"अनुमति दिनुहोस्" मान "अस्वीकार गर्नुहोस्" को विपरीत कार्य गर्दछ: यसले खोज रोबोटहरूलाई विशेष पृष्ठ वा निर्देशिकामा पहुँच गर्न अनुमति दिन्छ, यद्यपि robots.txt फाइलमा रहेका अन्य निर्देशनहरूले यसमा पहुँच निषेध गर्दछन्।

एउटा उदाहरण विचार गर्नुहोस्:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

यस उदाहरणमा, यो निर्दिष्ट गरिएको छ कि रोबोटहरूलाई /admin/ डाइरेक्टरीमा पहुँच गर्न अनुमति छैन , /admin/login.html पृष्ठ बाहेक , जुन अनुक्रमणिका र स्क्यानिङको लागि उपलब्ध छ।

Robots.txt र साइटम्याप

साइटम्याप एउटा XML फाइल हो जसमा साइटमा रहेका सबै पृष्ठहरू र फाइलहरूको URL हरूको सूची हुन्छ जुन खोज इन्जिनहरूद्वारा अनुक्रमित गर्न सकिन्छ। जब खोज रोबोटले robots.txt फाइल पहुँच गर्छ र साइटम्याप XML फाइलको लिङ्क देख्छ, यसले साइटमा उपलब्ध सबै URL हरू र स्रोतहरू फेला पार्न यो फाइल प्रयोग गर्न सक्छ। निर्देशन ढाँचामा निर्दिष्ट गरिएको छ:

Sitemap: https://yoursite.com/filesitemap.xml

यो नियम सामान्यतया कागजातको अन्त्यमा कुनै विशेष प्रयोगकर्ता-एजेन्टसँग बाँधिएको बिना राखिन्छ र अपवाद बिना सबै रोबोटहरूद्वारा प्रशोधन गरिन्छ। यदि साइट मालिकले sitemap.xml प्रयोग गर्दैन भने, नियम थप्न आवश्यक छैन।

कन्फिगर गरिएको Robots.txt का उदाहरणहरू

WordPress को लागि Robots.txt सेटअप गर्दै

यस खण्डमा, हामी WordPress को लागि तयार कन्फिगरेसनलाई विचार गर्नेछौं। हामी गोप्य डेटामा पहुँच रोक्ने र मुख्य पृष्ठहरूमा पहुँच अनुमति दिने तरिकाहरूको अन्वेषण गर्नेछौं।

तयार समाधानको रूपमा, तपाईं निम्न कोड प्रयोग गर्न सक्नुहुन्छ:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

यद्यपि सबै निर्देशनहरू टिप्पणीहरू सहित छन्, निष्कर्षहरूमा गहिरिएर हेरौं।

  1. रोबोटहरूले संवेदनशील फाइलहरू र निर्देशिकाहरूलाई अनुक्रमणिका गर्दैनन्।
  2. एकै समयमा, रोबोटहरूलाई साइटको मुख्य पृष्ठहरू र स्रोतहरूमा पहुँच गर्न अनुमति दिइएको छ।
  3. सामग्रीको दोहोरिनबाट रोक्नको लागि पोस्टहरूको पुरानो संस्करणहरू र प्यारामिटराइज्ड क्वेरीहरूको अनुक्रमणिकामा प्रतिबन्ध लगाइएको छ।
  4. साइटम्यापको स्थान सुधारिएको अनुक्रमणिकाको लागि संकेत गरिएको छ।

यसरी, हामीले तयार कन्फिगरेसनको सामान्य उदाहरण विचार गर्यौं, जसमा केही संवेदनशील फाइलहरू र मार्गहरू अनुक्रमणिकाबाट लुकेका छन्, तर मुख्य निर्देशिकाहरू पहुँचयोग्य छन्।

धेरै लोकप्रिय CMS वा अनुकूलित-लिखित साइटहरू भन्दा फरक, WordPress मा धेरै प्लगइनहरू छन् जसले robots.txt फाइलको सिर्जना र व्यवस्थापनलाई सहज बनाउँछ। यस उद्देश्यका लागि लोकप्रिय समाधानहरू मध्ये एक Yoast SEO हो ।

यसलाई स्थापना गर्न, तपाईंले आवश्यक पर्दछ:

  1. वर्डप्रेस एडमिन प्यानलमा जानुहोस्।
  2. "प्लगइनहरू" खण्डमा, "नयाँ थप्नुहोस्" चयन गर्नुहोस्।
  3. "Yoast SEO" प्लगइन खोज्नुहोस् र यसलाई स्थापना गर्नुहोस्।
  4. प्लगइन सक्रिय गर्नुहोस्।

robots.txt फाइल सम्पादन गर्न, तपाईंले निम्न कुराहरू गर्नुपर्छ:

  1. एडमिन प्यानलको साइड मेनुमा रहेको "SEO" खण्डमा जानुहोस् र "सामान्य" चयन गर्नुहोस्।
  2. "उपकरणहरू" ट्याबमा जानुहोस्।
  3. "फाइलहरू" मा क्लिक गर्नुहोस्। यहाँ तपाईंले robots.txt सहित विभिन्न फाइलहरू देख्नुहुनेछ।
  4. तपाईंको आवश्यकता अनुसार आवश्यक अनुक्रमणिका नियमहरू प्रविष्ट गर्नुहोस्।
  5. फाइलमा परिवर्तनहरू गरेपछि, "रोबोट.txt मा परिवर्तनहरू बचत गर्नुहोस्" बटनमा क्लिक गर्नुहोस्।

ध्यान दिनुहोस् कि WordPress को लागि प्रत्येक robots.txt फाइल सेटिङ अद्वितीय छ र साइटको विशिष्ट आवश्यकता र सुविधाहरूमा निर्भर गर्दछ। अपवाद बिना सबै स्रोतहरू अनुरूप हुने कुनै विश्वव्यापी टेम्प्लेट छैन। यद्यपि, यो उदाहरण र प्लगइनहरूको प्रयोगले कार्यलाई उल्लेखनीय रूपमा सरल बनाउन सक्छ।

Robots.txt को म्यानुअल सेटिङ

त्यसैगरी, साइटको लागि तयार CMS नभएको अवस्थामा पनि तपाईंले फाइलको कन्फिगरेसन सेट अप गर्न सक्नुहुन्छ। प्रयोगकर्ताले साइटको रूट डाइरेक्टरीमा robots.txt फाइल अपलोड गर्नुपर्नेछ र आवश्यक नियमहरू निर्दिष्ट गर्नुपर्नेछ। यहाँ एउटा उदाहरण छ, जसमा सबै उपलब्ध निर्देशनहरू संकेत गरिएका छन्:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Robots.txt फाइल कसरी जाँच गर्ने

त्रुटिहरूको लागि robots.txt फाइल जाँच गर्दा सहायक उपकरणको रूपमा, अनलाइन सेवाहरू प्रयोग गर्न सिफारिस गरिन्छ।

Yandex Webmaster सेवाको उदाहरणलाई विचार गर्नुहोस् । जाँच गर्न, फाइल पहिले नै सर्भरमा अपलोड गरिएको छ कि छैन भनेर सम्बन्धित क्षेत्रमा तपाईंको साइटको लिङ्क घुसाउनु पर्छ। त्यसपछि, उपकरण आफैंले फाइल कन्फिगरेसन लोड गर्नेछ। म्यानुअल रूपमा कन्फिगरेसन प्रविष्ट गर्ने विकल्प पनि छ:

Robots.txt कन्फिगरेसन

अर्को, तपाईंले जाँचको लागि अनुरोध गर्नुपर्छ र नतिजाको लागि पर्खनु पर्छ:

Robots.txt सेटिङ परिणाम

दिइएको उदाहरणमा, कुनै त्रुटिहरू छैनन्। यदि कुनै त्रुटिहरू छन् भने, सेवाले समस्याग्रस्त क्षेत्रहरू र तिनीहरूलाई समाधान गर्ने तरिकाहरू देखाउनेछ।

निष्कर्ष

संक्षेपमा, हामीले साइटमा ट्राफिक नियन्त्रण गर्न robots.txt फाइल कति महत्त्वपूर्ण छ भन्ने कुरामा जोड दियौं। हामीले खोज इन्जिनहरूले पृष्ठहरूलाई कसरी अनुक्रमणिका बनाउँछन् भनेर व्यवस्थापन गर्न यसलाई कसरी राम्रोसँग सेट अप गर्ने भन्ने बारे सल्लाह प्रदान गर्यौं। यसका अतिरिक्त, हामीले यो फाइल कसरी सही रूपमा प्रयोग गर्ने भन्ने उदाहरणहरू पनि हेर्यौं र सबै सेटिङहरू सही रूपमा काम गरिरहेका छन् भनी कसरी जाँच गर्ने भन्ने बारे निर्देशनहरू दियौं।

❮ अघिल्लो लेख SSH मार्फत लिनक्स सर्भरमा कसरी जडान गर्ने
अर्को लेख ❯ Linux मा वेब सर्भर (Apache-PHP-MySQL/MariaDB) कसरी कन्फिगर गर्ने

VPS को बारेमा हामीलाई सोध्नुहोस्

हामी दिन होस् वा रात, कुनै पनि समयमा तपाईंका प्रश्नहरूको जवाफ दिन सधैं तयार छौं।