U ovom ćemo članku ispitati ključnu ulogu datoteke robots.txt u upravljanju prometom na web stranicama, raspravljati o nužnosti njezine prisutnosti i dati preporuke za njezino postavljanje za učinkovito upravljanje indeksiranjem stranica. Dodatno, analizirat ćemo primjere ispravne upotrebe direktiva u datoteci robots.txt i dati vodič za provjeru ispravnosti njenih postavki.
Zašto je Robots.txt potreban
Robots.txt je datoteka koja se nalazi na poslužitelju stranice u njenom korijenskom direktoriju. Obavještava robote tražilice kako bi trebali skenirati sadržaj izvora. Ispravno korištenje ove datoteke pomaže u sprječavanju indeksiranja neželjenih stranica, štiti povjerljive podatke i može poboljšati učinkovitost SEO optimizacije i vidljivost stranice u rezultatima pretraživanja. Konfiguracija robots.txt se vrši putem direktiva, koje ćemo pogledati dalje.
Postavljanje direktiva u Robots.txt
User-agent
Primarna direktiva je poznata kao User-Agent, gdje postavljamo posebnu ključnu riječ za robote. Nakon otkrivanja ove riječi, robot razumije da je pravilo namijenjeno upravo njemu.
Razmotrite primjer korištenja korisničkog agenta u datoteci robots.txt:
User-Agent: *
Disallow: /private/
Ovaj primjer pokazuje da svi roboti za pretraživanje (predstavljeni simbolom "*") treba zanemariti stranice koje se nalaze u /privatno/ katalog.
Evo kako izgledaju upute za određene robote za pretraživanje:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
U ovom slučaju, Googlebot robot za pretraživanje trebao bi zanemariti stranice u /administrator/ imenik, dok Bingbot treba zanemariti stranice u /privatno/ katalog.
opovrgavati
opovrgavati govori robotima za pretraživanje koje URL-ove da preskoče ili ne indeksiraju na web stranici. Ova je direktiva korisna kada želite sakriti osjetljive podatke ili stranice sa sadržajem niske kvalitete od indeksiranja na tražilicama. Ako datoteka robots.txt sadrži unos Zabrani: /direktorij/, tada će robotima biti uskraćen pristup sadržaju navedenog direktorija. Na primjer,
User-agent: *
Disallow: /admin/
Ova vrijednost ukazuje na to svi roboti treba zanemariti URL-ove koji počinju s /administrator/. Kako biste blokirali indeksiranje cijele stranice od strane bilo kojeg robota, postavite korijenski direktorij kao pravilo:
User-agent: *
Disallow: /
dopustiti
Vrijednost "Dopusti" djeluje suprotno od "Disallow": dopušta robotima za pretraživanje pristup određenoj stranici ili direktoriju, čak i ako druge direktive u datoteci robots.txt zabranjuju pristup.
Razmotrite primjer:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
U ovom primjeru navedeno je da robotima nije dopušten pristup /administrator/ imenik, osim za /admin/login.html stranicu koja je dostupna za indeksiranje i skeniranje.
Robots.txt i Sitemap
Sitemap je XML datoteka koja sadrži popis URL-ova svih stranica i datoteka na web mjestu koje tražilice mogu indeksirati. Kada robot za pretraživanje pristupi datoteci robots.txt i vidi vezu na XML datoteku karte web-mjesta, može upotrijebiti tu datoteku za pronalaženje svih dostupnih URL-ova i resursa na web-mjestu. Direktiva je navedena u formatu:
Sitemap: https://yoursite.com/filesitemap.xml
Ovo se pravilo obično postavlja na kraj dokumenta bez povezivanja s određenim korisničkim agentom i obrađuju ga svi roboti bez iznimke. Ako vlasnik stranice ne koristi sitemap.xml, nije potrebno dodati pravilo.
Primjeri konfiguriranih robota.txt
Postavljanje Robots.txt za WordPress
U ovom odjeljku razmotrit ćemo gotovu konfiguraciju za WordPress. Istražit ćemo blokiranje pristupa povjerljivim podacima i dopuštanje pristupa glavnim stranicama.
Kao gotovo rješenje možete koristiti sljedeći kod:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Iako su sve direktive popraćene komentarima, zaronimo dublje u zaključke.
- Roboti neće indeksirati osjetljive datoteke i direktorije.
- U isto vrijeme, robotima je dopušten pristup glavnim stranicama i resursima stranice.
- postavljena je zabrana indeksiranja starih verzija objava i parametriziranih upita kako bi se spriječilo dupliciranje sadržaja.
- Lokacija karte web mjesta naznačena je radi poboljšanog indeksiranja.
Stoga smo razmotrili opći primjer gotove konfiguracije, u kojoj su neke osjetljive datoteke i staze skrivene od indeksiranja, ali su glavni direktoriji dostupni.
Za razliku od mnogih popularnih CMS ili prilagođenih stranica, WordPress ima nekoliko dodataka koji olakšavaju stvaranje i upravljanje datotekom robots.txt. Jedno od popularnih rješenja za tu svrhu je Yoast SEO.
Da biste ga instalirali, trebate:
- Idite na WordPress administratorsku ploču.
- U odjeljku "Dodaci" odaberite "Dodaj novi".
- Pronađite dodatak "Yoast SEO" i instalirajte ga.
- Aktivirajte dodatak.
Da biste uredili datoteku robots.txt, trebate:
- Idite na odjeljak "SEO" u bočnom izborniku administrativne ploče i odaberite "Općenito".
- Idite na karticu "Alati".
- Kliknite na "Datoteke". Ovdje ćete vidjeti razne datoteke, uključujući robots.txt.
- Unesite potrebna pravila indeksiranja prema vašim zahtjevima.
- Nakon što izvršite promjene u datoteci, kliknite gumb "Spremi promjene u robots.txt".
Imajte na umu da je svaka postavka datoteke robots.txt za WordPress jedinstvena i ovisi o specifičnim potrebama i značajkama stranice. Ne postoji univerzalni predložak koji bi odgovarao svim resursima bez iznimke. Međutim, ovaj primjer i korištenje dodataka mogu značajno pojednostaviti zadatak.
Ručno postavljanje datoteke Robots.txt
Slično tome, možete postaviti svoju konfiguraciju datoteke čak i u nedostatku spremnog CMS-a za web mjesto. Korisnik također treba učitati datoteku robots.txt u korijenski direktorij stranice i odrediti potrebna pravila. Evo jednog od primjera u kojem su naznačene sve dostupne direktive:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Kako provjeriti datoteku robots.txt
Kao pomoćni alat pri provjeri grešaka u datoteci robots.txt, preporučuje se korištenje mrežnih usluga.
Razmotrite primjer Yandex Webmaster servis. Za provjeru morate u odgovarajuće polje umetnuti poveznicu na svoju stranicu ako je datoteka već postavljena na poslužitelj. Nakon toga će sam alat učitati konfiguraciju datoteke. Također postoji mogućnost ručnog unosa konfiguracije:
Zatim trebate zatražiti provjeru i pričekati rezultate:
U navedenom primjeru nema grešaka. Ako ih ima, servis će pokazati problematična područja i načine kako ih popraviti.
Zaključak
Ukratko, naglasili smo koliko je datoteka robots.txt važna za kontrolu prometa na stranici. Pružili smo savjete o tome kako ga ispravno postaviti za upravljanje načinom na koji tražilice indeksiraju stranice. Osim toga, pogledali smo i primjere kako pravilno koristiti ovu datoteku i dali upute kako provjeriti rade li sve postavke ispravno.