U ovom ćemo članku ispitati ključnu ulogu datoteke robots.txt u upravljanju prometom na web stranicama, raspravljati o nužnosti njezine prisutnosti i dati preporuke za njezino postavljanje za učinkovito upravljanje indeksiranjem stranica. Dodatno, analizirat ćemo primjere ispravne upotrebe direktiva u datoteci robots.txt i dati vodič za provjeru ispravnosti njenih postavki.
Zašto je Robots.txt potreban
Robots.txt je datoteka koja se nalazi na poslužitelju stranice u njenom korijenskom direktoriju. Obavještava robote tražilice kako bi trebali skenirati sadržaj izvora. Ispravno korištenje ove datoteke pomaže u sprječavanju indeksiranja neželjenih stranica, štiti povjerljive podatke i može poboljšati učinkovitost SEO optimizacije i vidljivost stranice u rezultatima pretraživanja. Konfiguracija robots.txt se vrši putem direktiva, koje ćemo pogledati dalje.
Postavljanje direktiva u Robots.txt
User-agent
Primarna direktiva je poznata kao User-Agent, gdje postavljamo posebnu ključnu riječ za robote. Nakon otkrivanja ove riječi, robot razumije da je pravilo namijenjeno upravo njemu.
Razmotrite primjer korištenja korisničkog agenta u datoteci robots.txt:
User-Agent: *
Disallow: /private/
Ovaj primjer pokazuje da svi roboti za pretraživanje (predstavljeni simbolom " * ") trebaju ignorirati stranice koje se nalaze u direktoriju /private/.
Evo kako izgledaju upute za određene robote za pretraživanje:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
U ovom slučaju, robot za pretraživanje Googlebot trebao bi ignorirati stranice u direktoriju /admin/ , dok bi Bingbot trebao ignorirati stranice u direktoriju /private/.
opovrgavati
Disallow govori robotima za pretraživanje koje URL-ove treba preskočiti ili ne indeksirati na web stranici. Ova direktiva je korisna kada želite sakriti osjetljive podatke ili stranice niske kvalitete od indeksiranja od strane tražilica. Ako datoteka robots.txt sadrži unos Disallow: /directory/ , robotima će biti onemogućen pristup sadržaju navedenog direktorija. Na primjer,
User-agent: *
Disallow: /admin/
Ova vrijednost označava da svi roboti trebaju ignorirati URL-ove koji počinju s /admin/ . Da biste blokirali indeksiranje cijele web-lokacije od strane bilo kojeg robota, postavite korijenski direktorij kao pravilo:
User-agent: *
Disallow: /
dopustiti
Vrijednost "Dopusti" djeluje suprotno od "Disallow": dopušta robotima za pretraživanje pristup određenoj stranici ili direktoriju, čak i ako druge direktive u datoteci robots.txt zabranjuju pristup.
Razmotrite primjer:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
U ovom primjeru navedeno je da robotima nije dopušten pristup direktoriju /admin/ , osim stranice /admin/login.html , koja je dostupna za indeksiranje i skeniranje.
Robots.txt i Sitemap
Sitemap je XML datoteka koja sadrži popis URL-ova svih stranica i datoteka na web mjestu koje tražilice mogu indeksirati. Kada robot za pretraživanje pristupi datoteci robots.txt i vidi vezu na XML datoteku karte web-mjesta, može upotrijebiti tu datoteku za pronalaženje svih dostupnih URL-ova i resursa na web-mjestu. Direktiva je navedena u formatu:
Sitemap: https://yoursite.com/filesitemap.xml
Ovo se pravilo obično postavlja na kraj dokumenta bez povezivanja s određenim korisničkim agentom i obrađuju ga svi roboti bez iznimke. Ako vlasnik stranice ne koristi sitemap.xml, nije potrebno dodati pravilo.
Primjeri konfiguriranih robota.txt
Postavljanje Robots.txt za WordPress
U ovom odjeljku razmotrit ćemo gotovu konfiguraciju za WordPress. Istražit ćemo blokiranje pristupa povjerljivim podacima i dopuštanje pristupa glavnim stranicama.
Kao gotovo rješenje možete koristiti sljedeći kod:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Iako su sve direktive popraćene komentarima, zaronimo dublje u zaključke.
- Roboti neće indeksirati osjetljive datoteke i direktorije.
- U isto vrijeme, robotima je dopušten pristup glavnim stranicama i resursima stranice.
- postavljena je zabrana indeksiranja starih verzija objava i parametriziranih upita kako bi se spriječilo dupliciranje sadržaja.
- Lokacija karte web mjesta naznačena je radi poboljšanog indeksiranja.
Stoga smo razmotrili opći primjer gotove konfiguracije, u kojoj su neke osjetljive datoteke i staze skrivene od indeksiranja, ali su glavni direktoriji dostupni.
Za razliku od mnogih popularnih CMS-ova ili web-stranica pisanih po narudžbi, WordPress ima nekoliko dodataka koji olakšavaju izradu i upravljanje datotekom robots.txt. Jedno od popularnih rješenja za tu svrhu je Yoast SEO.
Da biste ga instalirali, trebate:
- Idite na WordPress administratorsku ploču.
- U odjeljku "Dodaci" odaberite "Dodaj novi".
- Pronađite dodatak "Yoast SEO" i instalirajte ga.
- Aktivirajte dodatak.
Da biste uredili datoteku robots.txt, trebate:
- Idite na odjeljak "SEO" u bočnom izborniku administrativne ploče i odaberite "Općenito".
- Idite na karticu "Alati".
- Kliknite na "Datoteke". Ovdje ćete vidjeti razne datoteke, uključujući robots.txt.
- Unesite potrebna pravila indeksiranja prema vašim zahtjevima.
- Nakon što izvršite promjene u datoteci, kliknite gumb "Spremi promjene u robots.txt".
Imajte na umu da je svaka postavka datoteke robots.txt za WordPress jedinstvena i ovisi o specifičnim potrebama i značajkama stranice. Ne postoji univerzalni predložak koji bi odgovarao svim resursima bez iznimke. Međutim, ovaj primjer i korištenje dodataka mogu značajno pojednostaviti zadatak.
Ručno postavljanje datoteke Robots.txt
Slično tome, možete postaviti svoju konfiguraciju datoteke čak i u nedostatku spremnog CMS-a za web mjesto. Korisnik također treba učitati datoteku robots.txt u korijenski direktorij stranice i odrediti potrebna pravila. Evo jednog od primjera u kojem su naznačene sve dostupne direktive:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Kako provjeriti datoteku robots.txt
Kao pomoćni alat pri provjeri grešaka u datoteci robots.txt, preporučuje se korištenje mrežnih usluga.
Razmotrite primjer usluge Yandex Webmaster . Za provjeru morate umetnuti poveznicu na svoju web-lokaciju u odgovarajuće polje je li datoteka već prenesena na poslužitelj. Nakon toga, alat će sam učitati konfiguraciju datoteke. Postoji i mogućnost ručnog unosa konfiguracije:
Zatim trebate zatražiti provjeru i pričekati rezultate:
U navedenom primjeru nema grešaka. Ako ih ima, servis će pokazati problematična područja i načine kako ih popraviti.
Zaključak
Ukratko, naglasili smo koliko je datoteka robots.txt važna za kontrolu prometa na stranici. Pružili smo savjete o tome kako ga ispravno postaviti za upravljanje načinom na koji tražilice indeksiraju stranice. Osim toga, pogledali smo i primjere kako pravilno koristiti ovu datoteku i dali upute kako provjeriti rade li sve postavke ispravno.