அறிவுத் தளம் Profitserver சேவையுடன் பணிபுரிய எளிய வழிமுறைகள்.

robots.txt


இந்தக் கட்டுரையில், வலைத்தளங்களில் போக்குவரத்தை நிர்வகிப்பதில் robots.txt கோப்பின் முக்கிய பங்கை ஆராய்வோம், அதன் இருப்பின் அவசியத்தைப் பற்றி விவாதிப்போம், மேலும் பயனுள்ள பக்க அட்டவணைப்படுத்தல் மேலாண்மைக்காக அதை அமைப்பதற்கான பரிந்துரைகளை வழங்குவோம். கூடுதலாக, robots.txt கோப்பில் சரியான வழிமுறைகள் பயன்பாட்டின் எடுத்துக்காட்டுகளை நாங்கள் பகுப்பாய்வு செய்வோம் மற்றும் அதன் அமைப்புகளின் சரியான தன்மையை எவ்வாறு சரிபார்க்க வேண்டும் என்பதற்கான வழிகாட்டியை வழங்குவோம்.

ஏன் Robots.txt தேவைப்படுகிறது?

Robots.txt என்பது தளத்தின் சேவையகத்தில் அதன் மூல கோப்பகத்தில் அமைந்துள்ள ஒரு கோப்பு. இது தேடுபொறி ரோபோக்களுக்கு வளத்தின் உள்ளடக்கத்தை எவ்வாறு ஸ்கேன் செய்ய வேண்டும் என்பதைத் தெரிவிக்கிறது. இந்த கோப்பின் சரியான பயன்பாடு தேவையற்ற பக்கங்களின் அட்டவணைப்படுத்தலைத் தடுக்க உதவுகிறது, ரகசியத் தரவைப் பாதுகாக்கிறது, மேலும் தேடல் முடிவுகளில் தளத்தின் SEO உகப்பாக்கம் மற்றும் தெரிவுநிலையின் செயல்திறனை மேம்படுத்தலாம். robots.txt இன் உள்ளமைவு வழிமுறைகள் மூலம் செய்யப்படுகிறது, அதை நாங்கள் மேலும் பார்ப்போம்.

Robots.txt இல் வழிமுறைகளை அமைத்தல்

பயனர் முகவர்

முதன்மை உத்தரவு பயனர்-முகவர் என்று அழைக்கப்படுகிறது, அங்கு நாம் ரோபோக்களுக்கு ஒரு சிறப்பு முக்கிய சொல்லை அமைக்கிறோம். இந்த வார்த்தையைக் கண்டறிந்ததும், இந்த விதி குறிப்பாக அதற்காகவே உருவாக்கப்பட்டது என்பதை ரோபோ புரிந்துகொள்கிறது.

robots.txt கோப்பில் பயனர்-முகவரைப் பயன்படுத்துவதற்கான ஒரு எடுத்துக்காட்டைக் கவனியுங்கள்:

User-Agent: *
Disallow: /private/

இந்த எடுத்துக்காட்டு அனைத்து தேடல் ரோபோக்களையும் (" என்ற குறியீட்டால் குறிக்கப்படுகிறது) குறிக்கிறது.*") இல் அமைந்துள்ள பக்கங்களைப் புறக்கணிக்க வேண்டும் /தனியார்/ அடைவு.

குறிப்பிட்ட தேடல் ரோபோக்களுக்கான வழிமுறைகள் இங்கே:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

இந்த வழக்கில், கூகள் தேடல் ரோபோ பக்கங்களைப் புறக்கணிக்க வேண்டும் /நிர்வாகம்/ அடைவு, அதே நேரத்தில் பிங்பாட் பக்கங்களைப் புறக்கணிக்க வேண்டும் /தனியார்/ அடைவு.

அனுமதிக்காதே

அனுமதிக்காதே வலைத்தளத்தில் எந்த URLகளைத் தவிர்க்க வேண்டும் அல்லது அட்டவணைப்படுத்தக்கூடாது என்பதை தேடல் ரோபோக்களுக்குச் சொல்கிறது. தேடுபொறிகளால் குறியிடப்படும் முக்கியமான தரவு அல்லது குறைந்த தரம் வாய்ந்த உள்ளடக்கப் பக்கங்களை மறைக்க விரும்பும்போது இந்த உத்தரவு பயனுள்ளதாக இருக்கும். robots.txt கோப்பில் உள்ளீடு இருந்தால் அனுமதிக்காதே: / அடைவு/, பின்னர் குறிப்பிட்ட கோப்பகத்தின் உள்ளடக்கங்களை அணுக ரோபோக்கள் மறுக்கப்படும். எடுத்துக்காட்டாக,

User-agent: *
Disallow: /admin/

இந்த மதிப்பு அதைக் குறிக்கிறது எல்லா ரோபோக்களும் தொடங்கும் URL களைப் புறக்கணிக்க வேண்டும் /நிர்வாகம்/. எந்த ரோபோக்களாலும் முழு தளமும் அட்டவணைப்படுத்தப்படுவதைத் தடுக்க, ரூட் கோப்பகத்தை ஒரு விதியாக அமைக்கவும்:

User-agent: *
Disallow: /

அனுமதி

"அனுமதி" மதிப்பு "அனுமதிக்க வேண்டாம்" என்பதற்கு நேர்மாறாக செயல்படுகிறது: robots.txt கோப்பில் உள்ள பிற வழிமுறைகள் அதை அணுகுவதைத் தடைசெய்தாலும் கூட, தேடல் ரோபோக்கள் ஒரு குறிப்பிட்ட பக்கம் அல்லது கோப்பகத்தை அணுக அனுமதிக்கிறது.

ஒரு உதாரணத்தைக் கவனியுங்கள்:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

இந்த எடுத்துக்காட்டில், ரோபோக்கள் அணுக அனுமதிக்கப்படவில்லை என்று குறிப்பிடப்பட்டுள்ளது /நிர்வாகம்/ கோப்பகம், தவிர /நிர்வாகி/உள்நுழைவு.html பக்கம், இது அட்டவணைப்படுத்தல் மற்றும் ஸ்கேனிங்கிற்குக் கிடைக்கிறது.

Robots.txt மற்றும் தளவரைபடம்

தளவரைபடம் என்பது தேடுபொறிகளால் அட்டவணைப்படுத்தக்கூடிய தளத்தில் உள்ள அனைத்து பக்கங்கள் மற்றும் கோப்புகளின் URLகளின் பட்டியலைக் கொண்ட ஒரு XML கோப்பாகும். ஒரு தேடல் ரோபோ robots.txt கோப்பை அணுகி, தளவரைபட XML கோப்பிற்கான இணைப்பைப் பார்க்கும்போது, ​​தளத்தில் கிடைக்கும் அனைத்து URLகள் மற்றும் ஆதாரங்களைக் கண்டறிய இந்தக் கோப்பைப் பயன்படுத்தலாம். இந்த உத்தரவு பின்வரும் வடிவத்தில் குறிப்பிடப்பட்டுள்ளது:

Sitemap: https://yoursite.com/filesitemap.xml

இந்த விதி வழக்கமாக ஒரு குறிப்பிட்ட பயனர் முகவருடன் இணைக்கப்படாமல் ஆவணத்தின் இறுதியில் வைக்கப்படும், மேலும் விதிவிலக்கு இல்லாமல் அனைத்து ரோபோக்களாலும் செயலாக்கப்படும். தள உரிமையாளர் sitemap.xml ஐப் பயன்படுத்தவில்லை என்றால், விதியைச் சேர்க்க வேண்டிய அவசியமில்லை.

உள்ளமைக்கப்பட்ட Robots.txt இன் எடுத்துக்காட்டுகள்

WordPress-க்கு Robots.txt-ஐ அமைத்தல்

இந்தப் பிரிவில், WordPress-க்கான ஆயத்த உள்ளமைவைப் பரிசீலிப்போம். ரகசியத் தரவை அணுகுவதைத் தடுப்பது மற்றும் முக்கிய பக்கங்களை அணுக அனுமதிப்பது எப்படி என்பதை ஆராய்வோம்.

ஒரு ஆயத்த தீர்வாக, நீங்கள் பின்வரும் குறியீட்டைப் பயன்படுத்தலாம்:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

அனைத்து உத்தரவுகளும் கருத்துகளுடன் இருந்தாலும், முடிவுகளை ஆழமாக ஆராய்வோம்.

  1. ரோபோக்கள் முக்கியமான கோப்புகள் மற்றும் கோப்பகங்களை அட்டவணைப்படுத்தாது.
  2. அதே நேரத்தில், தளத்தின் முக்கிய பக்கங்கள் மற்றும் வளங்களை ரோபோக்கள் அணுக அனுமதிக்கப்படுகின்றன.
  3. உள்ளடக்க நகலெடுப்பைத் தடுக்க, இடுகைகளின் பழைய பதிப்புகள் மற்றும் அளவுருவாக்கப்பட்ட வினவல்களை அட்டவணைப்படுத்துவதற்கு தடை விதிக்கப்பட்டுள்ளது.
  4. மேம்படுத்தப்பட்ட அட்டவணைப்படுத்தலுக்காக தளவரைபடத்தின் இருப்பிடம் குறிப்பிடப்பட்டுள்ளது.

எனவே, சில முக்கியமான கோப்புகள் மற்றும் பாதைகள் அட்டவணைப்படுத்தலில் இருந்து மறைக்கப்பட்டிருக்கும், ஆனால் முக்கிய கோப்பகங்களை அணுகக்கூடிய ஒரு தயாராக உள்ளமைவின் பொதுவான எடுத்துக்காட்டை நாங்கள் கருத்தில் கொண்டுள்ளோம்.

பல பிரபலமான CMS அல்லது தனிப்பயன்-எழுதப்பட்ட தளங்களைப் போலல்லாமல், WordPress இல் robots.txt கோப்பை உருவாக்குவதற்கும் நிர்வகிப்பதற்கும் உதவும் பல செருகுநிரல்கள் உள்ளன. இந்த நோக்கத்திற்கான பிரபலமான தீர்வுகளில் ஒன்று Yoast எஸ்சிஓ.

அதை நிறுவ, நீங்கள் செய்ய வேண்டியது:

  1. வேர்ட்பிரஸ் நிர்வாக குழுவிற்குச் செல்லவும்.
  2. "செருகுநிரல்கள்" பிரிவில், "புதியதைச் சேர்" என்பதைத் தேர்ந்தெடுக்கவும்.
  3. "Yoast SEO" செருகுநிரலைக் கண்டுபிடித்து அதை நிறுவவும்.
  4. சொருகி செயல்படுத்தவும்.

robots.txt கோப்பைத் திருத்த, நீங்கள் செய்ய வேண்டியது:

  1. நிர்வாக பலகத்தின் பக்கவாட்டு மெனுவில் உள்ள "SEO" பகுதிக்குச் சென்று "பொது" என்பதைத் தேர்ந்தெடுக்கவும்.
  2. "கருவிகள்" தாவலுக்குச் செல்லவும்.
  3. "கோப்புகள்" என்பதைக் கிளிக் செய்யவும். இங்கே நீங்கள் robots.txt உட்பட பல்வேறு கோப்புகளைக் காண்பீர்கள்.
  4. உங்கள் தேவைகளுக்கு ஏற்ப தேவையான அட்டவணைப்படுத்தல் விதிகளை உள்ளிடவும்.
  5. கோப்பில் மாற்றங்களைச் செய்த பிறகு, "robots.txt இல் மாற்றங்களைச் சேமி" பொத்தானைக் கிளிக் செய்யவும்.

WordPress-க்கான ஒவ்வொரு robots.txt கோப்பு அமைப்பும் தனித்துவமானது மற்றும் தளத்தின் குறிப்பிட்ட தேவைகள் மற்றும் அம்சங்களைப் பொறுத்தது என்பதை நினைவில் கொள்ளவும். விதிவிலக்கு இல்லாமல் அனைத்து வளங்களுக்கும் பொருந்தக்கூடிய உலகளாவிய டெம்ப்ளேட் எதுவும் இல்லை. இருப்பினும், இந்த எடுத்துக்காட்டு மற்றும் செருகுநிரல்களின் பயன்பாடு பணியை கணிசமாக எளிதாக்கும்.

Robots.txt இன் கையேடு அமைப்பு

இதேபோல், தளத்திற்குத் தயாராக CMS இல்லாவிட்டாலும், கோப்பின் உள்ளமைவை நீங்கள் அமைக்கலாம். பயனர் robots.txt கோப்பை தளத்தின் மூல கோப்பகத்தில் பதிவேற்றி தேவையான விதிகளைக் குறிப்பிட வேண்டும். கிடைக்கக்கூடிய அனைத்து வழிமுறைகளும் சுட்டிக்காட்டப்பட்ட எடுத்துக்காட்டுகளில் ஒன்று இங்கே:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Robots.txt கோப்பை எவ்வாறு சரிபார்ப்பது

பிழைகளுக்கு robots.txt கோப்பைச் சரிபார்க்கும்போது துணைக் கருவியாக, ஆன்லைன் சேவைகளைப் பயன்படுத்த பரிந்துரைக்கப்படுகிறது.

உதாரணத்தைக் கவனியுங்கள் யாண்டெக்ஸ் வெப்மாஸ்டர் சேவை. கோப்பு ஏற்கனவே சேவையகத்தில் பதிவேற்றப்பட்டிருந்தால், சரிபார்க்க, தொடர்புடைய புலத்தில் உங்கள் தளத்திற்கான இணைப்பைச் செருக வேண்டும். அதன் பிறகு, கருவியே கோப்பு உள்ளமைவை ஏற்றும். உள்ளமைவை கைமுறையாக உள்ளிடுவதற்கான விருப்பமும் உள்ளது:

Robots.txt உள்ளமைவு

அடுத்து, நீங்கள் ஒரு காசோலையைக் கோரி முடிவுகளுக்காகக் காத்திருக்க வேண்டும்:

Robots.txt அமைப்பு முடிவு

கொடுக்கப்பட்ட எடுத்துக்காட்டில், எந்த பிழைகளும் இல்லை. ஏதேனும் இருந்தால், சேவை சிக்கலான பகுதிகளையும் அவற்றை சரிசெய்வதற்கான வழிகளையும் காண்பிக்கும்.

தீர்மானம்

சுருக்கமாக, தளத்தில் போக்குவரத்தை கட்டுப்படுத்த robots.txt கோப்பு எவ்வளவு முக்கியமானது என்பதை நாங்கள் வலியுறுத்தினோம். தேடுபொறிகள் பக்கங்களை எவ்வாறு அட்டவணைப்படுத்துகின்றன என்பதை நிர்வகிக்க அதை எவ்வாறு சரியாக அமைப்பது என்பது குறித்த ஆலோசனைகளை வழங்கினோம். இதனுடன் கூடுதலாக, இந்த கோப்பை எவ்வாறு சரியாகப் பயன்படுத்துவது என்பதற்கான எடுத்துக்காட்டுகளையும் நாங்கள் பார்த்தோம், மேலும் அனைத்து அமைப்புகளும் சரியாக வேலை செய்கின்றனவா என்பதை எவ்வாறு சரிபார்க்க வேண்டும் என்பதற்கான வழிமுறைகளையும் வழங்கினோம்.

❮ முந்தைய கட்டுரை SSH வழியாக லினக்ஸ் சேவையகத்துடன் எவ்வாறு இணைப்பது
அடுத்த கட்டுரை ❯ லினக்ஸில் ஒரு வலை சேவையகத்தை (Apache-PHP-MySQL/MariaDB) எவ்வாறு கட்டமைப்பது

VPS பற்றி எங்களிடம் கேளுங்கள்

பகல் அல்லது இரவின் எந்த நேரத்திலும் உங்கள் கேள்விகளுக்கு பதிலளிக்க நாங்கள் எப்போதும் தயாராக இருக்கிறோம்.