Knowledgebase Maagizo rahisi ya kufanya kazi na huduma ya Profitserver

robots.txt


Katika makala haya, tutachunguza jukumu muhimu la faili ya robots.txt katika kudhibiti trafiki kwenye tovuti, kujadili umuhimu wa kuwepo kwake, na kutoa mapendekezo ya kuiweka kwa ajili ya usimamizi bora wa kuorodhesha ukurasa. Zaidi ya hayo, tutachanganua mifano ya matumizi sahihi ya maagizo katika faili ya robots.txt na kutoa mwongozo wa jinsi ya kuangalia usahihi wa mipangilio yake.

Kwa nini Robots.txt Inahitajika

Robots.txt ni faili iliyo kwenye seva ya tovuti katika saraka yake ya mizizi. Hufahamisha roboti za injini tafuti jinsi zinavyopaswa kuchanganua maudhui ya rasilimali. Matumizi sahihi ya faili hii husaidia kuzuia uwekaji faharasa wa kurasa zisizohitajika, hulinda data ya siri, na inaweza kuboresha ufanisi wa uboreshaji wa SEO na mwonekano wa tovuti katika matokeo ya utafutaji. Usanidi wa robots.txt unafanywa kwa njia ya maagizo, ambayo tutaangalia zaidi.

Kuweka Maagizo katika Robots.txt

Wakala wa Mtumiaji

Maagizo ya msingi yanajulikana kama Ajenti wa Mtumiaji, ambapo tunaweka nenomsingi maalum la roboti. Baada ya kugundua neno hili, roboti inaelewa kuwa sheria hiyo imekusudiwa mahsusi.

Fikiria mfano wa kutumia User-Agent katika faili ya robots.txt:

User-Agent: *
Disallow: /private/

Mfano huu unaonyesha kwamba roboti zote za utafutaji (zinazowakilishwa na alama " * ") zinapaswa kupuuza kurasa zilizo kwenye saraka ya /private/.

Hivi ndivyo maagizo yanavyotafuta roboti maalum za utaftaji:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

Katika hali hii, roboti ya utafutaji ya Googlebot inapaswa kupuuza kurasa katika saraka ya /admin/ , huku Bingbot ikipuuza kurasa katika saraka ya /private/.

Usiruhusu

Kipengele cha Kutoruhusu huambia roboti za utafutaji ni URL zipi za kuruka au kutoziorodhesha kwenye tovuti. Mwongozo huu ni muhimu unapotaka kuficha data nyeti au kurasa za maudhui zenye ubora wa chini zisiorodheshwe na injini za utafutaji. Ikiwa faili ya robots.txt ina ingizo la Kutoruhusu: /directory/ , basi roboti zitakataliwa ufikiaji wa maudhui ya saraka iliyobainishwa. Kwa mfano,

User-agent: *
Disallow: /admin/

Thamani hii inaonyesha kwamba roboti zote zinapaswa kupuuza URL zinazoanza na /admin/ . Ili kuzuia tovuti nzima isiorodheshwe na roboti yoyote, weka saraka ya mzizi kama sheria:

User-agent: *
Disallow: /

Kuruhusu

Thamani ya "Ruhusu" inafanya kazi kinyume na "Usiruhusu": huruhusu roboti za utafutaji kufikia ukurasa au saraka mahususi, hata kama maagizo mengine katika faili ya robots.txt yanakataza kuifikia.

Fikiria mfano:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

Katika mfano huu, imebainishwa kuwa roboti haziruhusiwi kufikia saraka ya /admin/ , isipokuwa ukurasa wa /admin/login.html , ambao unapatikana kwa ajili ya kuorodhesha na kuchanganua.

Robots.txt na Ramani ya Tovuti

Ramani ya tovuti ni faili ya XML ambayo ina orodha ya URL za kurasa na faili zote kwenye tovuti ambazo zinaweza kuorodheshwa na injini za utafutaji. Roboti ya utafutaji inapofikia faili ya robots.txt na kuona kiungo cha faili ya XML ya ramani ya tovuti, inaweza kutumia faili hii kupata URL na nyenzo zote zinazopatikana kwenye tovuti. Maagizo yameainishwa katika muundo:

Sitemap: https://yoursite.com/filesitemap.xml

Sheria hii kwa kawaida huwekwa mwishoni mwa hati bila kuunganishwa na Wakala mahususi wa Mtumiaji na huchakatwa na roboti zote bila ubaguzi. Ikiwa mmiliki wa tovuti hatumii sitemap.xml, si lazima kuongeza sheria.

Mifano ya Roboti Zilizosanidiwa.txt

Kuanzisha Robots.txt kwa WordPress

Katika sehemu hii, tutazingatia usanidi uliotengenezwa tayari kwa WordPress. Tutachunguza kuzuia ufikiaji wa data ya siri na kuruhusu ufikiaji wa kurasa kuu.

Kama suluhisho tayari, unaweza kutumia nambari ifuatayo:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

Ingawa maagizo yote yanaambatana na maoni, wacha tuzame kwa undani hitimisho.

  1. Roboti hazitaorodhesha faili na saraka nyeti.
  2. Wakati huo huo, roboti zinaruhusiwa kufikia kurasa kuu na rasilimali za tovuti.
  3. marufuku imewekwa kwenye kuorodhesha matoleo ya zamani ya machapisho na hoja zilizoainishwa ili kuzuia kunakili maudhui.
  4. Eneo la ramani ya tovuti limeonyeshwa kwa uwekaji faharasa ulioboreshwa.

Kwa hivyo, tumezingatia mfano wa jumla wa usanidi tayari, ambapo baadhi ya faili nyeti na njia zimefichwa kutoka kwa indexing, lakini saraka kuu zinapatikana.

Tofauti na tovuti nyingi maarufu za CMS au zilizoandikwa maalum, WordPress ina programu-jalizi kadhaa zinazowezesha uundaji na usimamizi wa faili ya robots.txt. Mojawapo ya suluhisho maarufu kwa kusudi hili ni Yoast SEO.

Ili kuiweka, unahitaji:

  1. Nenda kwenye paneli ya msimamizi ya WordPress.
  2. Katika sehemu ya "Plugins", chagua "Ongeza Mpya".
  3. Pata programu-jalizi ya "Yoast SEO" na uisakinishe.
  4. Ondoa Plugin.

Ili kuhariri faili ya robots.txt, unahitaji:

  1. Nenda kwenye sehemu ya "SEO" kwenye menyu ya upande wa paneli ya msimamizi na uchague "Jumla".
  2. Nenda kwenye kichupo cha "Zana".
  3. Bonyeza "Faili". Hapa utaona faili mbalimbali, ikiwa ni pamoja na robots.txt.
  4. Ingiza sheria muhimu za kuorodhesha kulingana na mahitaji yako.
  5. Baada ya kufanya mabadiliko kwenye faili, bofya kitufe cha "Hifadhi mabadiliko kwenye robots.txt".

Kumbuka kuwa kila mpangilio wa faili wa robots.txt kwa WordPress ni wa kipekee na unategemea mahitaji na vipengele mahususi vya tovuti. Hakuna kiolezo cha ulimwengu wote ambacho kingefaa rasilimali zote bila ubaguzi. Walakini, mfano huu na utumiaji wa programu-jalizi zinaweza kurahisisha kazi kwa kiasi kikubwa.

Mpangilio wa Mwongozo wa Robots.txt

Vile vile, unaweza kuanzisha usanidi wako wa faili hata kwa kutokuwepo kwa CMS tayari kwa tovuti. Mtumiaji pia anahitaji kupakia faili ya robots.txt kwenye saraka ya mizizi ya tovuti na kutaja sheria zinazohitajika. Hapa kuna moja ya mifano, ambayo maagizo yote yanayopatikana yanaonyeshwa:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Jinsi ya Kuangalia Faili ya Robots.txt

Kama zana kisaidizi unapokagua faili ya robots.txt kwa hitilafu, inashauriwa kutumia huduma za mtandaoni.

Fikiria mfano wa huduma ya Yandex Webmaster . Ili kuangalia, unahitaji kuingiza kiungo cha tovuti yako katika sehemu inayolingana ikiwa faili tayari imepakiwa kwenye seva. Baada ya hapo, kifaa chenyewe kitapakia usanidi wa faili. Pia kuna chaguo la kuingiza usanidi mwenyewe:

Usanidi wa Robots.txt

Ifuatayo, unahitaji kuomba ukaguzi na usubiri matokeo:

Matokeo ya Mipangilio ya Robots.txt

Katika mfano uliotolewa, hakuna makosa. Ikiwa kuna yoyote, huduma itaonyesha maeneo yenye shida na njia za kuzirekebisha.

Hitimisho

Kwa muhtasari, tulisisitiza jinsi faili ya robots.txt ilivyo muhimu kwa kudhibiti trafiki kwenye tovuti. Tulitoa ushauri wa jinsi ya kuiweka vizuri ili kudhibiti jinsi kurasa za faharasa za injini za utafutaji. Mbali na hili, tuliangalia pia mifano ya jinsi ya kutumia faili hii kwa usahihi na tukatoa maagizo ya jinsi ya kuangalia kwamba mipangilio yote inafanya kazi kwa usahihi.

❮ Makala iliyotangulia Jinsi ya kuunganishwa na seva ya Linux kupitia SSH
Makala yanayofuata ❯ Jinsi ya kusanidi seva ya wavuti (Apache-PHP-MySQL/MariaDB) kwenye Linux

Tuulize kuhusu VPS

Daima tuko tayari kujibu maswali yako wakati wowote wa mchana au usiku.