දැනුම් පදනම Profitserver සේවාව සමඟ වැඩ කිරීම සඳහා සරල උපදෙස්

Robots.txt


මෙම ලිපියෙන්, වෙබ් අඩවි වල ගමනාගමනය කළමනාකරණය කිරීමේදී robots.txt ගොනුවේ ප්‍රධාන කාර්යභාරය අපි පරීක්ෂා කරන්නෙමු, එහි පැවැත්මේ අවශ්‍යතාවය සාකච්ඡා කරන්නෙමු, සහ ඵලදායී පිටු සුචිගත කිරීමේ කළමනාකරණය සඳහා එය සැකසීම සඳහා නිර්දේශ ලබා දෙන්නෙමු. අතිරේකව, robots.txt ගොනුවේ නිවැරදි නියෝග භාවිතය පිළිබඳ උදාහරණ විශ්ලේෂණය කර එහි සැකසුම් වල නිවැරදි බව පරීක්ෂා කරන්නේ කෙසේද යන්න පිළිබඳ මාර්ගෝපදේශයක් අපි ලබා දෙන්නෙමු.

Robots.txt අවශ්‍ය වන්නේ ඇයි?

Robots.txt යනු වෙබ් අඩවියේ සේවාදායකයේ එහි මූල නාමාවලියෙහි පිහිටා ඇති ගොනුවකි. එය සෙවුම් යන්ත්‍ර රොබෝවරුන්ට සම්පත් අන්තර්ගතය පරිලෝකනය කළ යුතු ආකාරය දැනුම් දෙයි. මෙම ගොනුව නිසි ලෙස භාවිතා කිරීම අනවශ්‍ය පිටු සුචිගත කිරීම වැළැක්වීමට, රහස්‍ය දත්ත ආරක්ෂා කිරීමට සහ සෙවුම් ප්‍රතිඵලවල SEO ප්‍රශස්තිකරණයේ සහ වෙබ් අඩවියේ දෘශ්‍යතාවේ කාර්යක්ෂමතාව වැඩි දියුණු කිරීමට උපකාරී වේ. robots.txt හි වින්‍යාසය සිදු කරනු ලබන්නේ නියෝග හරහා වන අතර, එය අපි තවදුරටත් සලකා බලමු.

Robots.txt හි විධාන සැකසීම

පරිශීලක-නියෝජිත

ප්‍රාථමික විධානය පරිශීලක-නියෝජිතයා ලෙස හැඳින්වේ, එහිදී අපි රොබෝවරුන් සඳහා විශේෂ මූල පදයක් සකසමු. මෙම වචනය හඳුනාගත් පසු, රීතිය විශේෂයෙන් ඒ සඳහා අදහස් කර ඇති බව රොබෝවරයා තේරුම් ගනී.

robots.txt ගොනුවේ User-Agent භාවිතා කිරීමේ උදාහරණයක් සලකා බලන්න:

User-Agent: *
Disallow: /private/

මෙම උදාහරණයෙන් පෙන්නුම් කරන්නේ සියලුම සෙවුම් රොබෝවරු (" සංකේතයෙන් නිරූපණය වන බවයි*") හි පිහිටා ඇති පිටු නොසලකා හැරිය යුතුය /පෞද්ගලික/ නාමාවලිය.

නිශ්චිත සෙවුම් රොබෝවරුන් සඳහා උපදෙස් පෙනෙන්නේ මෙයයි:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

මෙම අවස්ථාවේ දී, Googlebot සෙවුම් රොබෝවරයා පිටු නොසලකා හැරිය යුතුය /පරිපාලක/ නාමාවලිය, අතරතුර bingbot පිටු නොසලකා හැරිය යුතුය /පෞද්ගලික/ නාමාවලිය.

අවසර නොදෙන්න

අවසර නොදෙන්න වෙබ් අඩවියේ සුචිගත කළ යුතු හෝ නොකළ යුතු URL සෙවුම් රොබෝවරුන්ට කියයි. සෙවුම් යන්ත්‍ර මගින් සුචිගත කිරීමෙන් සංවේදී දත්ත හෝ අඩු ගුණාත්මක අන්තර්ගත පිටු සැඟවීමට ඔබට අවශ්‍ය විට මෙම නියෝගය ප්‍රයෝජනවත් වේ. robots.txt ගොනුවේ ඇතුළත් කිරීම අඩංගු නම් ඉඩ නොදෙන්න: / නාමාවලිය/, එවිට නිශ්චිත නාමාවලියෙහි අන්තර්ගතයට රොබෝවරුන්ට ප්‍රවේශය ප්‍රතික්ෂේප කරනු ලැබේ. උදාහරණයක් ලෙස,

User-agent: *
Disallow: /admin/

මෙම අගය පෙන්නුම් කරන්නේ සියලුම රොබෝවරු සමඟ ආරම්භ වන URL නොසලකා හැරිය යුතුය /පරිපාලක/. ඕනෑම රොබෝවරයෙකු විසින් මුළු අඩවියම සුචිගත කිරීම අවහිර කිරීමට, රීතියක් ලෙස මූල නාමාවලිය සකසන්න:

User-agent: *
Disallow: /

ඉඩ දෙන්න

"Allow" අගය "Disallow" අගයට ප්‍රතිවිරුද්ධව ක්‍රියා කරයි: එය robots.txt ගොනුවේ ඇති අනෙකුත් විධානයන් එයට ප්‍රවේශ වීම තහනම් කළත්, සෙවුම් රොබෝවරුන්ට නිශ්චිත පිටුවකට හෝ නාමාවලියකට ප්‍රවේශ වීමට ඉඩ සලසයි.

උදාහරණයක් සලකා බලන්න:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

මෙම උදාහරණයේ දී, රොබෝවරුන්ට ප්‍රවේශ වීමට අවසර නොමැති බව නිශ්චිතව දක්වා ඇත /පරිපාලක/ නාමාවලිය, හැර /පරිපාලක/පිවිසුම්.html පිටුව, එය සුචිගත කිරීම සහ ස්කෑන් කිරීම සඳහා ලබා ගත හැකිය.

Robots.txt සහ අඩවි සිතියම

අඩවි සිතියම යනු සෙවුම් යන්ත්‍ර මගින් සුචිගත කළ හැකි අඩවියේ ඇති සියලුම පිටු සහ ගොනු වල URL ලැයිස්තුවක් අඩංගු XML ගොනුවකි. සෙවුම් රොබෝවක් robots.txt ගොනුවට ප්‍රවේශ වී අඩවි සිතියමේ XML ගොනුවකට සබැඳියක් දකින විට, අඩවියේ ඇති සියලුම URL සහ සම්පත් සොයා ගැනීමට එයට මෙම ගොනුව භාවිතා කළ හැක. විධානය ආකෘතියෙන් දක්වා ඇත:

Sitemap: https://yoursite.com/filesitemap.xml

මෙම රීතිය සාමාන්‍යයෙන් නිශ්චිත පරිශීලක-නියෝජිතයෙකුට සම්බන්ධ නොකර ලේඛනයේ අවසානයේ තබා ඇති අතර ව්‍යතිරේකයකින් තොරව සියලුම රොබෝවරුන් විසින් සකසනු ලැබේ. අඩවි හිමිකරු sitemap.xml භාවිතා නොකරන්නේ නම්, රීතිය එකතු කිරීම අවශ්‍ය නොවේ.

වින්‍යාස කරන ලද Robots.txt සඳහා උදාහරණ

WordPress සඳහා Robots.txt සැකසීම

මෙම කොටසේදී, අපි WordPress සඳහා සූදානම් කළ වින්‍යාසයක් සලකා බලමු. රහස්‍ය දත්ත වෙත ප්‍රවේශය අවහිර කිරීම සහ ප්‍රධාන පිටු වෙත ප්‍රවේශ වීමට ඉඩ දීම අපි ගවේෂණය කරන්නෙමු.

සූදානම් විසඳුමක් ලෙස, ඔබට පහත කේතය භාවිතා කළ හැකිය:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

සියලුම නියෝග අදහස් දැක්වීම් සමඟ ඇතත්, අපි නිගමන ගැඹුරට යමු.

  1. රොබෝවරු සංවේදී ගොනු සහ නාමාවලි සුචිගත නොකරනු ඇත.
  2. ඒ සමඟම, රොබෝවරුන්ට වෙබ් අඩවියේ ප්‍රධාන පිටු සහ සම්පත් වෙත ප්‍රවේශ වීමට අවසර ඇත.
  3. අන්තර්ගත අනුපිටපත් වීම වැළැක්වීම සඳහා පළ කිරීම් සහ පරාමිතිගත විමසුම් වල පැරණි අනුවාද සුචිගත කිරීම තහනම් කර ඇත.
  4. වැඩිදියුණු කළ සුචිගත කිරීම සඳහා අඩවි සිතියමේ පිහිටීම දක්වා ඇත.

මේ අනුව, අපි සූදානම් වින්‍යාසයක සාමාන්‍ය උදාහරණයක් සලකා බැලුවෙමු, එහි සමහර සංවේදී ගොනු සහ මාර්ග සුචිගත කිරීමෙන් සැඟවී ඇත, නමුත් ප්‍රධාන නාමාවලි වෙත ප්‍රවේශ විය හැකිය.

බොහෝ ජනප්‍රිය CMS හෝ අභිරුචි-ලිඛිත අඩවි මෙන් නොව, WordPress හි robots.txt ගොනුව නිර්මාණය කිරීමට සහ කළමනාකරණය කිරීමට පහසුකම් සපයන ප්ලගීන කිහිපයක් තිබේ. මේ සඳහා ජනප්‍රිය විසඳුම්වලින් එකක් වන්නේ යෝගට් සෙවුම්.

එය ස්ථාපනය කිරීමට, ඔබට අවශ්‍ය වන්නේ:

  1. WordPress පරිපාලක පැනලය වෙත යන්න.
  2. "ප්ලගීන" කොටසේ, "නව එකතු කරන්න" තෝරන්න.
  3. "Yoast SEO" ප්ලගිනය සොයාගෙන එය ස්ථාපනය කරන්න.
  4. ප්ලගිනය සක්රිය කරන්න.

robots.txt ගොනුව සංස්කරණය කිරීමට, ඔබට අවශ්‍ය වන්නේ:

  1. පරිපාලක පැනලයේ පැති මෙනුවේ "SEO" කොටසට ගොස් "සාමාන්‍ය" තෝරන්න.
  2. "මෙවලම්" ටැබයට යන්න.
  3. "ගොනු" මත ක්ලික් කරන්න. මෙහිදී ඔබට robots.txt ඇතුළු විවිධ ගොනු පෙනෙනු ඇත.
  4. ඔබේ අවශ්‍යතා අනුව අවශ්‍ය සුචිගත කිරීමේ නීති ඇතුළත් කරන්න.
  5. ගොනුවට වෙනස්කම් සිදු කිරීමෙන් පසු, "robots.txt වෙත වෙනස්කම් සුරකින්න" බොත්තම ක්ලික් කරන්න.

WordPress සඳහා සෑම robots.txt ගොනු සැකසුමක්ම අද්විතීය වන අතර එය අඩවියේ නිශ්චිත අවශ්‍යතා සහ විශේෂාංග මත රඳා පවතින බව සලකන්න. ව්‍යතිරේකයකින් තොරව සියලුම සම්පත් වලට ගැලපෙන විශ්වීය සැකිල්ලක් නොමැත. කෙසේ වෙතත්, මෙම උදාහරණය සහ ප්ලගීන භාවිතය මඟින් කාර්යය සැලකිය යුතු ලෙස සරල කළ හැකිය.

Robots.txt හි අතින් සැකසීම

ඒ හා සමානව, අඩවිය සඳහා සූදානම් CMS එකක් නොමැති විට පවා ඔබට ගොනුවේ වින්‍යාසය සැකසිය හැක. පරිශීලකයා robots.txt ගොනුව අඩවියේ මූල නාමාවලියට උඩුගත කර අවශ්‍ය නීති නියම කළ යුතුය. ලබා ගත හැකි සියලුම විධාන දක්වා ඇති උදාහරණ වලින් එකක් මෙන්න:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Robots.txt ගොනුව පරීක්ෂා කරන්නේ කෙසේද?

දෝෂ සඳහා robots.txt ගොනුව පරීක්ෂා කිරීමේදී සහායක මෙවලමක් ලෙස, මාර්ගගත සේවාවන් භාවිතා කිරීම රෙකමදාරු කරනු ලැබේ.

උදාහරණය සලකා බලන්න යාන්ඩෙක්ස් වෙබ්මාස්ටර් සේවාව. පරීක්ෂා කිරීමට, ගොනුව දැනටමත් සේවාදායකයට උඩුගත කර ඇත්නම්, ඔබ අදාළ ක්ෂේත්‍රයේ ඔබේ වෙබ් අඩවියට සබැඳියක් ඇතුළත් කළ යුතුය. ඊට පසු, මෙවලම විසින්ම ගොනු වින්‍යාසය පූරණය කරනු ඇත. වින්‍යාසය අතින් ඇතුළත් කිරීමට විකල්පයක් ද ඇත:

Robots.txt වින්‍යාසය

ඊළඟට, ඔබ චෙක්පතක් ඉල්ලා සිටිය යුතු අතර ප්‍රතිඵල එනතෙක් බලා සිටිය යුතුය:

Robots.txt සැකසුම් ප්‍රතිඵලය

දී ඇති උදාහරණයේ කිසිදු දෝෂයක් නොමැත. ඒවා තිබේ නම්, සේවාව ගැටළු සහගත ප්‍රදේශ සහ ඒවා නිවැරදි කිරීමට ක්‍රම පෙන්වනු ඇත.

නිගමනය

සාරාංශයක් ලෙස, වෙබ් අඩවියේ ගමනාගමනය පාලනය කිරීම සඳහා robots.txt ගොනුව කොතරම් වැදගත්ද යන්න අපි අවධාරණය කළෙමු. සෙවුම් යන්ත්‍ර සුචිගත කරන පිටු කළමනාකරණය කිරීම සඳහා එය නිසි ලෙස සකසන්නේ කෙසේද යන්න පිළිබඳ උපදෙස් අපි ලබා දුන්නෙමු. මීට අමතරව, මෙම ගොනුව නිවැරදිව භාවිතා කරන්නේ කෙසේද යන්න පිළිබඳ උදාහරණ ද අපි සොයා බැලූ අතර සියලු සැකසුම් නිවැරදිව ක්‍රියාත්මක වන බව පරීක්ෂා කරන්නේ කෙසේද යන්න පිළිබඳ උපදෙස් ද ලබා දුන්නෙමු.

❮ පෙර ලිපිය SSH හරහා Linux සේවාදායකයකට සම්බන්ධ වන්නේ කෙසේද
ඊළඟ ලිපිය ❯ ලිනක්ස් මත වෙබ් සේවාදායකයක් (Apache-PHP-MySQL/MariaDB) වින්‍යාස කරන්නේ කෙසේද?

VPS ගැන අපෙන් අහන්න.

දිවා හෝ රාත්‍රියේ ඕනෑම වේලාවක ඔබගේ ප්‍රශ්නවලට පිළිතුරු දීමට අපි සැමවිටම සූදානම්.