I den här artikeln kommer vi att undersöka vilken nyckelroll robots.txt-filen har för att hantera trafik på webbplatser, diskutera nödvändigheten av dess närvaro och ge rekommendationer för hur du ställer in den för effektiv sidindexering. Dessutom kommer vi att analysera exempel på korrekt användning av direktiv i robots.txt-filen och ge en guide om hur man kontrollerar att dess inställningar är korrekta.
Varför Robots.txt behövs
Robots.txt är en fil som finns på webbplatsens server i dess rotkatalog. Den informerar sökmotorrobotar hur de ska skanna innehållet i resursen. Korrekt användning av den här filen hjälper till att förhindra indexering av oönskade sidor, skyddar konfidentiell data och kan förbättra effektiviteten för SEO-optimering och webbplatsens synlighet i sökresultat. Konfigurationen av robots.txt görs genom direktiv, som vi kommer att titta närmare på.
Ange direktiv i Robots.txt
User-Agent
Det primära direktivet är känt som User-Agent, där vi sätter ett speciellt nyckelord för robotar. När roboten detekterar detta ord förstår den att regeln är avsedd specifikt för det.
Tänk på ett exempel på hur man använder User-Agent i robots.txt-filen:
User-Agent: *
Disallow: /private/
Detta exempel indikerar att alla sökrobotar (representerade av symbolen "*") bör ignorera sidor som finns i /privat/ katalog.
Så här ser instruktionen ut för specifika sökrobotar:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
I det här fallet Googlebot sökrobot bör ignorera sidor i /administration/ katalog, medan Bingbot bör ignorera sidor i /privat/ katalog.
Tillåt
Tillåt talar om för sökrobotar vilka webbadresser som ska hoppa över eller inte indexeras på webbplatsen. Det här direktivet är användbart när du vill dölja känsliga data eller innehållssidor av låg kvalitet från att indexeras av sökmotorer. Om robots.txt-filen innehåller posten Disallow: /kataloger/, kommer robotar att nekas åtkomst till innehållet i den angivna katalogen. Till exempel,
User-agent: *
Disallow: /admin/
Detta värde indikerar det alla robotar bör ignorera webbadresser som börjar med /administration/. För att blockera hela webbplatsen från att indexeras av någon robot, ställ in rotkatalogen som regel:
User-agent: *
Disallow: /
Tillåt
"Allow"-värdet fungerar motsatsen till "Disallow": det tillåter sökrobotar åtkomst till en specifik sida eller katalog, även om andra direktiv i robots.txt-filen förbjuder åtkomst till den.
Tänk på ett exempel:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
I det här exemplet är det specificerat att robotar inte tillåts åtkomst till /administration/ katalogen, förutom /admin/login.html sida, som är tillgänglig för indexering och skanning.
Robots.txt och webbplatskarta
Webbplatskarta är en XML-fil som innehåller en lista över webbadresser till alla sidor och filer på webbplatsen som kan indexeras av sökmotorer. När en sökrobot kommer åt robots.txt-filen och ser en länk till en XML-fil för webbplatskarta, kan den använda den här filen för att hitta alla tillgängliga webbadresser och resurser på webbplatsen. Direktivet specificeras i formatet:
Sitemap: https://yoursite.com/filesitemap.xml
Denna regel placeras vanligtvis i slutet av dokumentet utan att vara bunden till en specifik User-Agent och bearbetas av alla robotar utan undantag. Om webbplatsens ägare inte använder sitemap.xml är det inte nödvändigt att lägga till regeln.
Exempel på konfigurerade Robots.txt
Konfigurera Robots.txt för WordPress
I det här avsnittet kommer vi att överväga en färdig konfiguration för WordPress. Vi kommer att utforska blockering av åtkomst till konfidentiell data och tillåta åtkomst till huvudsidorna.
Som en färdig lösning kan du använda följande kod:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Även om alla direktiv åtföljs av kommentarer, låt oss fördjupa oss i slutsatserna.
- Robotar kommer inte att indexera känsliga filer och kataloger.
- Samtidigt tillåts robotar åtkomst till sajtens huvudsidor och resurser.
- ban är inställd på att indexera gamla versioner av inlägg och parametriserade frågor för att förhindra innehållsduplicering.
- Platsen för webbplatskartan anges för förbättrad indexering.
Därför har vi övervägt ett allmänt exempel på en färdig konfiguration, där vissa känsliga filer och sökvägar är dolda från indexering, men huvudkatalogerna är tillgängliga.
Till skillnad från många populära CMS eller specialskrivna webbplatser har WordPress flera plugins som underlättar skapandet och hanteringen av robots.txt-filen. En av de populära lösningarna för detta ändamål är Yoast SEO.
För att installera den behöver du:
- Gå till WordPress adminpanel.
- I avsnittet "Plugins" väljer du "Lägg till nytt".
- Hitta "Yoast SEO" plugin och installera den.
- Aktivera plugin.
För att redigera robots.txt-filen måste du:
- Gå till avsnittet "SEO" i adminpanelens sidomeny och välj "Allmänt".
- Gå till fliken "Verktyg".
- Klicka på "Filer". Här kommer du att se olika filer, inklusive robots.txt.
- Ange nödvändiga indexeringsregler enligt dina krav.
- När du har gjort ändringar i filen klickar du på knappen "Spara ändringar i robots.txt".
Observera att varje robots.txt-filinställning för WordPress är unik och beror på webbplatsens specifika behov och funktioner. Det finns ingen universell mall som skulle passa alla resurser utan undantag. Detta exempel och användningen av plugins kan dock avsevärt förenkla uppgiften.
Manuell inställning av Robots.txt
På samma sätt kan du ställa in din konfiguration av filen även om det inte finns ett färdigt CMS för webbplatsen. Användaren måste också ladda upp robots.txt-filen till webbplatsens rotkatalog och ange nödvändiga regler. Här är ett av exemplen där alla tillgängliga direktiv anges:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Hur man kontrollerar filen Robots.txt
Som ett hjälpverktyg när du kontrollerar robots.txt-filen för fel, rekommenderas att du använder onlinetjänster.
Tänk på exemplet på Yandex Webmaster service. För att kontrollera måste du infoga en länk till din webbplats i motsvarande fält om filen redan är uppladdad till servern. Efter det kommer själva verktyget att ladda filkonfigurationen. Det finns också ett alternativ att ange konfigurationen manuellt:
Därefter måste du begära en kontroll och vänta på resultaten:
I det givna exemplet finns inga fel. Om det finns några kommer tjänsten att visa de problematiska områdena och sätt att åtgärda dem.
Slutsats
Sammanfattningsvis betonade vi hur viktig robots.txt-filen är för att kontrollera trafiken på webbplatsen. Vi gav råd om hur man ställer in det korrekt för att hantera hur sökmotorer indexerar sidor. Utöver detta har vi också tittat på exempel på hur man korrekt använder den här filen och gav instruktioner om hur man kontrollerar att alla inställningar fungerar korrekt.