In hierdie artikel sal ons die sleutelrol van die robots.txt-lêer in die bestuur van verkeer op webwerwe ondersoek, die noodsaaklikheid van die teenwoordigheid daarvan bespreek en aanbevelings gee vir die opstel daarvan vir effektiewe bladsyindekseringsbestuur. Daarbenewens sal ons voorbeelde van korrekte aanwysingsgebruik in die robots.txt-lêer ontleed en 'n gids verskaf oor hoe om die korrektheid van sy instellings na te gaan.
Waarom Robots.txt nodig is
Robots.txt is 'n lêer wat op die werf se bediener in sy wortelgids geleë is. Dit lig soekenjinrobotte in hoe hulle die inhoud van die hulpbron moet skandeer. Behoorlike gebruik van hierdie lêer help om die indeksering van ongewenste bladsye te voorkom, beskerm vertroulike data en kan die doeltreffendheid van SEO-optimering en sigbaarheid van die webwerf in soekresultate verbeter. Die konfigurasie van robots.txt word gedoen deur middel van voorskrifte, waarna ons verder sal kyk.
Stel riglyne in Robots.txt
Gebruikersagent
Die primêre opdrag staan bekend as User-Agent, waar ons 'n spesiale sleutelwoord vir robotte stel. By die opsporing van hierdie woord, verstaan die robot dat die reël spesifiek daarvoor bedoel is.
Oorweeg 'n voorbeeld van die gebruik van User-Agent in die robots.txt-lêer:
User-Agent: *
Disallow: /private/
Hierdie voorbeeld dui aan dat alle soekrobotte (verteenwoordig deur die simbool "*") moet bladsye wat in die /privaat/ gids.
Hier is hoe die instruksie vir spesifieke soekrobotte lyk:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
In hierdie geval is die Googlebot soekrobot moet bladsye in die ignoreer /admin/ gids, terwyl bingbot moet bladsye in die ignoreer /privaat/ gids.
Verbied
Verbied vertel soekrobotte watter URL's om oor te slaan of nie op die webwerf te indekseer nie. Hierdie opdrag is nuttig wanneer jy sensitiewe data of laegehalte-inhoudbladsye wil versteek sodat dit nie deur soekenjins geïndekseer word nie. As die robots.txt-lêer die inskrywing bevat Verbied: /directory/, dan sal robotte toegang tot die inhoud van die gespesifiseerde gids geweier word. Byvoorbeeld,
User-agent: *
Disallow: /admin/
Hierdie waarde dui daarop alle robotte moet URL's ignoreer wat begin met /admin/. Om te keer dat die hele webwerf deur enige robotte geïndekseer word, stel die wortelgids as 'n reël in:
User-agent: *
Disallow: /
Laat
Die "Allow"-waarde tree teenoor "Disallow" op: dit laat soekrobotte toegang tot 'n spesifieke bladsy of gids toe, selfs al verbied ander voorskrifte in die robots.txt-lêer toegang daartoe.
Oorweeg 'n voorbeeld:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
In hierdie voorbeeld word gespesifiseer dat robotte nie toegang tot die /admin/ gids, behalwe vir die /admin/login.html bladsy, wat beskikbaar is vir indeksering en skandering.
Robots.txt en werfkaart
Sitemap is 'n XML-lêer wat 'n lys URL's van alle bladsye en lêers op die webwerf bevat wat deur soekenjins geïndekseer kan word. Wanneer 'n soekrobot toegang tot die robots.txt-lêer verkry en 'n skakel na 'n werfkaart-XML-lêer sien, kan dit hierdie lêer gebruik om alle beskikbare URL's en hulpbronne op die werf te vind. Die opdrag word gespesifiseer in die formaat:
Sitemap: https://yoursite.com/filesitemap.xml
Hierdie reël word gewoonlik aan die einde van die dokument geplaas sonder om aan 'n spesifieke gebruiker-agent gekoppel te wees en word sonder uitsondering deur alle robotte verwerk. As die werfeienaar nie sitemap.xml gebruik nie, is dit nie nodig om die reël by te voeg nie.
Voorbeelde van gekonfigureerde robots.txt
Stel Robots.txt vir WordPress op
In hierdie afdeling sal ons 'n klaargemaakte konfigurasie vir WordPress oorweeg. Ons sal die blokkering van toegang tot vertroulike data en toegang tot die hoofbladsye ondersoek.
As 'n gereed oplossing kan jy die volgende kode gebruik:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Alhoewel alle voorskrifte met kommentaar vergesel word, kom ons delf dieper in die gevolgtrekkings.
- Robotte sal nie sensitiewe lêers en gidse indekseer nie.
- Terselfdertyd word robots toegang tot die hoofbladsye en hulpbronne van die webwerf toegelaat.
- verbod is ingestel op die indeksering van ou weergawes van plasings en geparameteriseerde navrae om inhoudduplisering te voorkom.
- Die ligging van die werfkaart word aangedui vir verbeterde indeksering.
Ons het dus 'n algemene voorbeeld van 'n gereed konfigurasie oorweeg, waarin sommige sensitiewe lêers en paaie weggesteek word vir indeksering, maar die hoofgidse is toeganklik.
Anders as baie gewilde CMS of pasgemaakte webwerwe, het WordPress verskeie inproppe wat die skep en bestuur van die robots.txt-lêer vergemaklik. Een van die gewilde oplossings vir hierdie doel is Yoast SEO.
Om dit te installeer, moet jy:
- Gaan na die WordPress-administrasiepaneel.
- Kies "Voeg nuwe by" in die afdeling "Plugins".
- Soek die "Yoast SEO"-inprop en installeer dit.
- Aktiveer die prop.
Om die robots.txt-lêer te wysig, moet jy:
- Gaan na die "SEO"-afdeling in die adminpaneel se sykieslys en kies "Algemeen".
- Gaan na die blad "Gereedskap".
- Klik op "Lêers". Hier sal jy verskeie lêers sien, insluitend robots.txt.
- Voer die nodige indekseringsreëls in volgens jou vereistes.
- Nadat jy veranderinge aan die lêer gemaak het, klik die "Stoor veranderinge in robots.txt"-knoppie.
Let daarop dat elke robots.txt-lêerinstelling vir WordPress uniek is en afhang van die spesifieke behoeftes en kenmerke van die webwerf. Daar is geen universele sjabloon wat sonder uitsondering by alle hulpbronne sal pas nie. Hierdie voorbeeld en die gebruik van plugins kan egter die taak aansienlik vereenvoudig.
Handmatige instelling van Robots.txt
Net so kan u u konfigurasie van die lêer opstel, selfs in die afwesigheid van 'n gereed CMS vir die webwerf. Die gebruiker moet ook die robots.txt-lêer na die wortelgids van die webwerf oplaai en die nodige reëls spesifiseer. Hier is een van die voorbeelde, waarin alle beskikbare riglyne aangedui word:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Hoe om die Robots.txt-lêer na te gaan
As 'n hulpinstrument wanneer die robots.txt-lêer vir foute nagegaan word, word dit aanbeveel om aanlyndienste te gebruik.
Beskou die voorbeeld van die Yandex Webmeester diens. Om na te gaan, moet u 'n skakel na u webwerf in die ooreenstemmende veld invoeg as die lêer reeds na die bediener opgelaai is. Daarna sal die instrument self die lêerkonfigurasie laai. Daar is ook 'n opsie om die konfigurasie handmatig in te voer:
Vervolgens moet u 'n tjek aanvra en wag vir die resultate:
In die gegewe voorbeeld is daar geen foute nie. As daar enige is, sal die diens die problematiese areas en maniere wys om dit reg te stel.
Gevolgtrekking
Opsommend het ons beklemtoon hoe belangrik die robots.txt-lêer is vir die beheer van verkeer op die werf. Ons het raad gegee oor hoe om dit behoorlik op te stel om te bestuur hoe soekenjins bladsye indekseer. Daarbenewens het ons ook na voorbeelde gekyk van hoe om hierdie lêer korrek te gebruik en instruksies gegee oor hoe om te kontroleer dat alle instellings reg werk.