I denne artikel vil vi undersøge robots.txt-filens nøglerolle i styring af trafik på websteder, diskutere nødvendigheden af dens tilstedeværelse og give anbefalinger til opsætning af den til effektiv sideindekseringsstyring. Derudover vil vi analysere eksempler på korrekt brug af direktiver i robots.txt-filen og give en guide til, hvordan man kontrollerer korrektheden af dens indstillinger.
Hvorfor Robots.txt er nødvendig
Robots.txt er en fil placeret på webstedets server i dets rodbibliotek. Den informerer søgemaskinerobotter om, hvordan de skal scanne indholdet af ressourcen. Korrekt brug af denne fil hjælper med at forhindre indeksering af uønskede sider, beskytter fortrolige data og kan forbedre effektiviteten af SEO-optimering og synlighed af webstedet i søgeresultaterne. Konfigurationen af robots.txt sker gennem direktiver, som vi vil se nærmere på.
Indstilling af direktiver i Robots.txt
User-Agent
Det primære direktiv er kendt som User-Agent, hvor vi sætter et særligt nøgleord for robotter. Efter at have opdaget dette ord, forstår robotten, at reglen er beregnet specifikt til det.
Overvej et eksempel på brug af User-Agent i robots.txt-filen:
User-Agent: *
Disallow: /private/
Dette eksempel angiver, at alle søgerobotter (repræsenteret ved symbolet "*") bør ignorere sider, der er placeret i /privat/ mappe.
Sådan ser instruktionen ud for specifikke søgerobotter:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
I dette tilfælde er Googlebot søgerobot bør ignorere sider i /admin/ mappe, mens Bingbot bør ignorere sider i /privat/ mappe.
Forbyd
Forbyd fortæller søgerobotter, hvilke URL'er der skal springes over eller ikke indekseres på hjemmesiden. Dette direktiv er nyttigt, når du vil skjule følsomme data eller indholdssider af lav kvalitet fra at blive indekseret af søgemaskiner. Hvis robots.txt-filen indeholder posten Disallow: /mapper/, så vil robotter blive nægtet adgang til indholdet af den angivne mappe. f.eks.
User-agent: *
Disallow: /admin/
Denne værdi angiver det alle robotter bør ignorere URL'er, der starter med /admin/. For at blokere hele webstedet fra at blive indekseret af nogen robotter, skal du indstille rodmappen som en regel:
User-agent: *
Disallow: /
Tillad
"Allow"-værdien virker modsat "Disallow": den tillader søgerobotter adgang til en specifik side eller mappe, selvom andre direktiver i robots.txt-filen forbyder adgang til den.
Overvej et eksempel:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
I dette eksempel er det specificeret, at robotter ikke har adgang til /admin/ bibliotek, bortset fra /admin/login.html side, som er tilgængelig til indeksering og scanning.
Robots.txt og sitemap
Sitemap er en XML-fil, der indeholder en liste over URL'er på alle sider og filer på webstedet, som kan indekseres af søgemaskiner. Når en søgerobot får adgang til robots.txt-filen og ser et link til en sitemap-XML-fil, kan den bruge denne fil til at finde alle tilgængelige URL'er og ressourcer på webstedet. Direktivet er specificeret i formatet:
Sitemap: https://yoursite.com/filesitemap.xml
Denne regel er normalt placeret i slutningen af dokumentet uden at være bundet til en specifik User-Agent og behandles af alle robotter uden undtagelse. Hvis webstedsejeren ikke bruger sitemap.xml, er det ikke nødvendigt at tilføje reglen.
Eksempler på konfigurerede Robots.txt
Opsætning af Robots.txt til WordPress
I dette afsnit vil vi overveje en færdiglavet konfiguration til WordPress. Vi vil undersøge blokering af adgang til fortrolige data og tillade adgang til hovedsiderne.
Som en klar løsning kan du bruge følgende kode:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Selvom alle direktiver er ledsaget af kommentarer, lad os dykke dybere ned i konklusionerne.
- Robotter vil ikke indeksere følsomme filer og mapper.
- Samtidig får robotter adgang til webstedets hovedsider og ressourcer.
- ban er indstillet til at indeksere gamle versioner af indlæg og parametriserede forespørgsler for at forhindre duplikering af indhold.
- Placeringen af sitemap er angivet for forbedret indeksering.
Vi har således overvejet et generelt eksempel på en klar konfiguration, hvor nogle følsomme filer og stier er skjult fra indeksering, men hovedbibliotekerne er tilgængelige.
I modsætning til mange populære CMS eller specialskrevne websteder, har WordPress flere plugins, der letter oprettelsen og administrationen af robots.txt-filen. En af de populære løsninger til dette formål er Yoast SEO.
For at installere det skal du:
- Gå til WordPress-administrationspanelet.
- I sektionen "Plugins" skal du vælge "Tilføj ny".
- Find "Yoast SEO"-pluginnet og installer det.
- Aktivér plugin.
For at redigere robots.txt-filen skal du:
- Gå til "SEO"-sektionen i admin-panelets sidemenu, og vælg "Generelt".
- Gå til fanen "Værktøjer".
- Klik på "Filer". Her vil du se forskellige filer, herunder robots.txt.
- Indtast de nødvendige indekseringsregler i henhold til dine krav.
- Når du har foretaget ændringer i filen, skal du klikke på knappen "Gem ændringer til robots.txt".
Bemærk, at hver robots.txt-filindstilling for WordPress er unik og afhænger af webstedets specifikke behov og funktioner. Der er ingen universel skabelon, der ville passe til alle ressourcer uden undtagelse. Dette eksempel og brugen af plugins kan dog forenkle opgaven markant.
Manuel indstilling af Robots.txt
På samme måde kan du opsætte din konfiguration af filen, selv i mangel af et klar CMS til webstedet. Brugeren skal også uploade robots.txt-filen til webstedets rodbibliotek og angive de nødvendige regler. Her er et af eksemplerne, hvor alle tilgængelige direktiver er angivet:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Sådan tjekker du Robots.txt-filen
Som et hjælpeværktøj, når du kontrollerer robots.txt-filen for fejl, anbefales det at bruge onlinetjenester.
Overvej eksemplet med Yandex webmaster service. For at kontrollere, skal du indsætte et link til dit websted i det tilsvarende felt, hvis filen allerede er uploadet til serveren. Derefter vil selve værktøjet indlæse filkonfigurationen. Der er også en mulighed for at indtaste konfigurationen manuelt:
Dernæst skal du anmode om en kontrol og vente på resultaterne:
I det givne eksempel er der ingen fejl. Hvis der er nogen, vil tjenesten vise de problematiske områder og måder at løse dem på.
Konklusion
Sammenfattende understregede vi, hvor vigtig robots.txt-filen er for at kontrollere trafikken på webstedet. Vi gav råd om, hvordan man konfigurerer det korrekt for at styre, hvordan søgemaskiner indekserer sider. Udover dette har vi også set på eksempler på, hvordan man bruger denne fil korrekt, og vi gav instruktioner til, hvordan man kontrollerer, at alle indstillinger fungerer korrekt.