Knowledgebase Cyfarwyddiadau syml i weithio gyda'r gwasanaeth Profitserver
Prif Knowledgebase robots.txt

robots.txt


Yn yr erthygl hon, byddwn yn archwilio rôl allweddol y ffeil robots.txt wrth reoli traffig ar wefannau, yn trafod anghenraid ei bresenoldeb, ac yn darparu argymhellion ar gyfer ei sefydlu ar gyfer rheoli mynegeio tudalennau yn effeithiol. Yn ogystal, byddwn yn dadansoddi enghreifftiau o ddefnydd cywir o gyfarwyddebau yn y ffeil robots.txt ac yn darparu canllaw ar sut i wirio cywirdeb ei osodiadau.

Pam Mae Angen Robots.txt

Mae Robots.txt yn ffeil sydd wedi'i lleoli ar weinydd y safle yn ei gyfeiriadur gwraidd. Mae'n hysbysu robotiaid peiriannau chwilio sut y dylent sganio cynnwys yr adnodd. Mae defnydd priodol o'r ffeil hon yn helpu i atal mynegeio tudalennau diangen, yn diogelu data cyfrinachol, a gall wella effeithlonrwydd optimeiddio SEO a gwelededd y wefan mewn canlyniadau chwilio. Mae cyfluniad robots.txt yn cael ei wneud trwy gyfarwyddebau, y byddwn yn edrych arnynt ymhellach.

Gosod Cyfarwyddebau yn Robots.txt

Asiant Defnyddiwr

Gelwir y brif gyfarwyddeb yn Asiant Defnyddiwr, lle rydym yn gosod allweddair arbennig ar gyfer robotiaid. Ar ôl canfod y gair hwn, mae'r robot yn deall bod y rheol wedi'i bwriadu'n benodol ar ei gyfer.

Ystyriwch enghraifft o ddefnyddio Asiant Defnyddiwr yn y ffeil robots.txt:

User-Agent: *
Disallow: /private/

Mae'r enghraifft hon yn nodi bod pob robot chwilio (a gynrychiolir gan y symbol "*") anwybyddu tudalennau sydd wedi'u lleoli yn y /preifat/ cyfeiriadur.

Dyma sut mae'r cyfarwyddyd yn edrych am robotiaid chwilio penodol:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

Yn yr achos hwn, y Googlebot Dylai robot chwilio anwybyddu tudalennau yn y /gweinyddol/ cyfeiriadur, tra Bingbot Dylai anwybyddu tudalennau yn y /preifat/ cyfeiriadur.

Caniatáu

Caniatáu yn dweud wrth robotiaid chwilio pa URLau i'w hepgor neu beidio â mynegeio ar y wefan. Mae'r gyfarwyddeb hon yn ddefnyddiol pan fyddwch am guddio data sensitif neu dudalennau cynnwys o ansawdd isel rhag cael eu mynegeio gan beiriannau chwilio. Os yw ffeil robots.txt yn cynnwys y cofnod Gwrthod: /cyfeiriadur/, yna gwrthodir mynediad i robotiaid i gynnwys y cyfeiriadur penodedig. Er enghraifft,

User-agent: *
Disallow: /admin/

Mae'r gwerth hwn yn dynodi hynny holl robotiaid Dylai anwybyddu URLs gan ddechrau /gweinyddol/. I rwystro'r wefan gyfan rhag cael ei mynegeio gan unrhyw robotiaid, gosodwch y cyfeiriadur gwraidd fel rheol:

User-agent: *
Disallow: /

Caniatáu

Mae'r gwerth "Caniatáu" yn gweithredu gyferbyn â "Disallow": mae'n caniatáu mynediad i robotiaid chwilio i dudalen neu gyfeiriadur penodol, hyd yn oed os yw cyfarwyddebau eraill yn y ffeil robots.txt yn gwahardd mynediad iddo.

Ystyriwch enghraifft:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

Yn yr enghraifft hon, nodir na chaniateir i robotiaid gael mynediad i'r /gweinyddol/ cyfeiriadur, heblaw am y /admin/login.html tudalen, sydd ar gael ar gyfer mynegeio a sganio.

Robots.txt a Map o'r wefan

Ffeil XML yw Map Safle sy'n cynnwys rhestr o URLau o'r holl dudalennau a ffeiliau ar y wefan y gellir eu mynegeio gan beiriannau chwilio. Pan fydd robot chwilio yn cyrchu'r ffeil robots.txt ac yn gweld dolen i ffeil XML map gwefan, gall ddefnyddio'r ffeil hon i ddod o hyd i'r holl URLau ac adnoddau sydd ar gael ar y wefan. Mae'r gyfarwyddeb wedi'i nodi yn y fformat:

Sitemap: https://yoursite.com/filesitemap.xml

Mae'r rheol hon fel arfer yn cael ei gosod ar ddiwedd y ddogfen heb gael ei chlymu i Asiant Defnyddiwr penodol ac yn cael ei phrosesu gan bob robot yn ddieithriad. Os nad yw perchennog y safle yn defnyddio sitemap.xml, nid oes angen ychwanegu'r rheol.

Enghreifftiau o Robots wedi'u Ffurfweddu.txt

Sefydlu Robots.txt ar gyfer WordPress

Yn yr adran hon, byddwn yn ystyried cyfluniad parod ar gyfer WordPress. Byddwn yn ymchwilio i rwystro mynediad at ddata cyfrinachol a chaniatáu mynediad i'r prif dudalennau.

Fel datrysiad parod, gallwch ddefnyddio'r cod canlynol:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

Er bod sylwadau yn cyd-fynd â phob cyfarwyddeb, gadewch i ni ymchwilio'n ddyfnach i'r casgliadau.

  1. Ni fydd robotiaid yn mynegeio ffeiliau a chyfeiriaduron sensitif.
  2. Ar yr un pryd, mae robotiaid yn cael mynediad i brif dudalennau ac adnoddau'r wefan.
  3. gosodir gwaharddiad ar fynegeio hen fersiynau o bostiadau ac ymholiadau paramedr i atal dyblygu cynnwys.
  4. Mae lleoliad y map safle wedi'i nodi ar gyfer gwell mynegeio.

Felly, rydym wedi ystyried enghraifft gyffredinol o ffurfweddiad parod, lle mae rhai ffeiliau a llwybrau sensitif wedi'u cuddio rhag mynegeio, ond mae'r prif gyfeiriaduron yn hygyrch.

Yn wahanol i lawer o CMS poblogaidd neu wefannau a ysgrifennwyd yn arbennig, mae gan WordPress nifer o ategion sy'n hwyluso creu a rheoli'r ffeil robots.txt. Un o'r atebion poblogaidd at y diben hwn yw Yoast SEO.

Er mwyn ei osod, mae angen i chi:

  1. Ewch i banel gweinyddol WordPress.
  2. Yn yr adran "Ategion", dewiswch "Ychwanegu Newydd".
  3. Dewch o hyd i'r ategyn "Yoast SEO" a'i osod.
  4. Gweithredwch yr ategyn.

I olygu'r ffeil robots.txt, mae angen i chi:

  1. Ewch i'r adran "SEO" yn newislen ochr y panel gweinyddol a dewis "General".
  2. Ewch i'r tab "Tools".
  3. Cliciwch ar "Ffeiliau". Yma fe welwch ffeiliau amrywiol, gan gynnwys robots.txt.
  4. Rhowch y rheolau mynegeio angenrheidiol yn unol â'ch gofynion.
  5. Ar ôl gwneud newidiadau i'r ffeil, cliciwch ar y botwm "Cadw newidiadau i robots.txt".

Sylwch fod pob gosodiad ffeil robots.txt ar gyfer WordPress yn unigryw ac yn dibynnu ar anghenion a nodweddion penodol y wefan. Nid oes templed cyffredinol a fyddai'n addas ar gyfer pob adnodd yn ddieithriad. Fodd bynnag, gall yr enghraifft hon a'r defnydd o ategion symleiddio'r dasg yn sylweddol.

Gosod Robots.txt â Llaw

Yn yr un modd, gallwch chi osod eich ffurfweddiad o'r ffeil hyd yn oed os nad oes CMS parod ar gyfer y wefan. Mae angen i'r defnyddiwr hefyd uwchlwytho'r ffeil robots.txt i gyfeiriadur gwraidd y wefan a nodi'r rheolau angenrheidiol. Dyma un o'r enghreifftiau, lle nodir yr holl gyfarwyddebau sydd ar gael:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Sut i Wirio Ffeil Robots.txt

Fel offeryn ategol wrth wirio'r ffeil robots.txt am wallau, argymhellir defnyddio gwasanaethau ar-lein.

Ystyriwch esiampl y Gwefeistr Yandex gwasanaeth. I wirio, mae angen i chi fewnosod dolen i'ch gwefan yn y maes cyfatebol os yw'r ffeil eisoes wedi'i huwchlwytho i'r gweinydd. Ar ôl hynny, bydd yr offeryn ei hun yn llwytho cyfluniad y ffeil. Mae yna hefyd opsiwn i fynd i mewn i'r ffurfweddiad â llaw:

Ffurfweddiad Robots.txt

Nesaf, mae angen i chi ofyn am wiriad ac aros am y canlyniadau:

Canlyniad Gosod Robots.txt

Yn yr enghraifft a roddir, nid oes unrhyw wallau. Os oes rhai, bydd y gwasanaeth yn dangos y meysydd problemus a ffyrdd o'u trwsio.

Casgliad

I grynhoi, fe wnaethom bwysleisio pa mor bwysig yw'r ffeil robots.txt ar gyfer rheoli traffig ar y wefan. Fe wnaethom ddarparu cyngor ar sut i'w osod yn gywir i reoli sut mae peiriannau chwilio yn mynegeio tudalennau. Yn ogystal â hyn, fe wnaethom hefyd edrych ar enghreifftiau o sut i ddefnyddio'r ffeil hon yn gywir a rhoi cyfarwyddiadau ar sut i wirio bod pob lleoliad yn gweithio'n gywir.

❮ Erthygl flaenorol Sut i gysylltu â gweinydd Linux trwy SSH
Erthygl nesaf ❯ Sut i ffurfweddu gweinydd gwe (Apache-PHP-MySQL/MariaDB) ar Linux

Gofynnwch i ni am VPS

Rydym bob amser yn barod i ateb eich cwestiynau ar unrhyw adeg o'r dydd neu'r nos.