Baza znanja Jednostavna uputstva za rad sa uslugom Profitserver
glavni Baza znanja robots.txt

robots.txt


U ovom članku ćemo ispitati ključnu ulogu datoteke robots.txt u upravljanju prometom na web stranicama, razmotriti neophodnost njegovog prisustva i dati preporuke za njegovo postavljanje za efikasno upravljanje indeksiranjem stranica. Osim toga, analizirat ćemo primjere ispravne upotrebe direktiva u datoteci robots.txt i pružiti vodič o tome kako provjeriti ispravnost njegovih postavki.

Zašto je Robots.txt potreban

Robots.txt je datoteka koja se nalazi na serveru stranice u njegovom korijenskom direktoriju. Obavještava robote pretraživača kako bi trebali skenirati sadržaj resursa. Pravilna upotreba ovog fajla pomaže u sprečavanju indeksiranja neželjenih stranica, štiti poverljive podatke i može poboljšati efikasnost SEO optimizacije i vidljivost sajta u rezultatima pretrage. Konfiguracija robots.txt se vrši putem direktiva, koje ćemo dalje pogledati.

Postavljanje direktiva u Robots.txt

Korisnički agent

Primarna direktiva je poznata kao User-Agent, gdje postavljamo posebnu ključnu riječ za robote. Nakon što otkrije ovu riječ, robot razumije da je pravilo namijenjeno posebno za njega.

Razmotrite primjer korištenja User-Agenta u datoteci robots.txt:

User-Agent: *
Disallow: /private/

Ovaj primjer pokazuje da su svi roboti za pretraživanje (predstavljeni simbolom "*") treba zanemariti stranice koje se nalaze u /privatno/ direktorij.

Evo kako izgleda instrukcija za određene robote za pretraživanje:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

U ovom slučaju, Googlebot robot za pretragu treba da ignoriše stranice u /admin/ imenik, dok BingBot treba zanemariti stranice u /privatno/ direktorij.

Onemogući

Onemogući govori robotima za pretraživanje koje URL-ove da preskoče ili ne indeksiraju na web stranici. Ova direktiva je korisna kada želite sakriti osjetljive podatke ili stranice sa sadržajem niske kvalitete od indeksiranja od strane pretraživača. Ako datoteka robots.txt sadrži unos Disallow: /direktoriji/, tada će robotima biti odbijen pristup sadržaju navedenog direktorija. na primjer,

User-agent: *
Disallow: /admin/

Ova vrijednost ukazuje na to svi roboti treba zanemariti URL-ove koji počinju sa /admin/. Da biste blokirali indeksiranje cijele stranice od strane bilo kojeg robota, postavite korijenski direktorij kao pravilo:

User-agent: *
Disallow: /

dopustiti

Vrijednost "Allow" djeluje suprotno od "Disallow": dozvoljava robotima pretraživanja pristup određenoj stranici ili direktoriju, čak i ako druge direktive u datoteci robots.txt zabranjuju pristup.

Razmotrimo primjer:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

U ovom primjeru je navedeno da robotima nije dozvoljen pristup /admin/ imenik, osim za /admin/login.html stranicu koja je dostupna za indeksiranje i skeniranje.

Robots.txt i Sitemap

Sitemap je XML datoteka koja sadrži listu URL-ova svih stranica i datoteka na web mjestu koje pretraživači mogu indeksirati. Kada robot za pretraživanje pristupi datoteci robots.txt i vidi vezu do XML datoteke mape web-lokacije, može koristiti ovu datoteku da pronađe sve dostupne URL-ove i resurse na web lokaciji. Direktiva je navedena u formatu:

Sitemap: https://yoursite.com/filesitemap.xml

Ovo pravilo se obično stavlja na kraj dokumenta bez vezivanja za određenog korisničkog agenta i obrađuju ga svi roboti bez izuzetka. Ako vlasnik stranice ne koristi sitemap.xml, nije potrebno dodavati pravilo.

Primjeri konfiguriranih robota.txt

Postavljanje Robots.txt za WordPress

U ovom odeljku ćemo razmotriti gotovu konfiguraciju za WordPress. Istražit ćemo blokiranje pristupa povjerljivim podacima i dopuštanje pristupa glavnim stranicama.

Kao spremno rješenje možete koristiti sljedeći kod:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

Iako su sve direktive popraćene komentarima, hajde da uđemo dublje u zaključke.

  1. Roboti neće indeksirati osjetljive datoteke i direktorije.
  2. Istovremeno, robotima je dozvoljen pristup glavnim stranicama i resursima stranice.
  3. postavljena je zabrana indeksiranja starih verzija postova i parametriziranih upita kako bi se spriječilo dupliciranje sadržaja.
  4. Lokacija mape sajta je naznačena radi poboljšanog indeksiranja.

Stoga smo razmotrili opći primjer gotove konfiguracije, u kojoj su neke osjetljive datoteke i putanje skrivene od indeksiranja, ali su glavni direktoriji dostupni.

Za razliku od mnogih popularnih CMS ili prilagođenih web lokacija, WordPress ima nekoliko dodataka koji olakšavaju kreiranje i upravljanje datotekom robots.txt. Jedno od popularnih rješenja za ovu svrhu je Yoast SEO.

Da biste ga instalirali, potrebno je:

  1. Idite na WordPress admin panel.
  2. U odjeljku "Dodaci" odaberite "Dodaj novo".
  3. Pronađite dodatak "Yoast SEO" i instalirajte ga.
  4. Aktivirajte dodatak.

Da biste uredili datoteku robots.txt, trebate:

  1. Idite na odjeljak "SEO" u bočnom meniju admin panela i odaberite "Općenito".
  2. Idite na karticu "Alati".
  3. Kliknite na "Files". Ovdje ćete vidjeti razne datoteke, uključujući robots.txt.
  4. Unesite potrebna pravila indeksiranja prema vašim zahtjevima.
  5. Nakon što izvršite izmjene u datoteci, kliknite na dugme "Sačuvaj promjene u robots.txt".

Imajte na umu da je svaka postavka datoteke robots.txt za WordPress jedinstvena i ovisi o specifičnim potrebama i karakteristikama stranice. Ne postoji univerzalni šablon koji bi odgovarao svim resursima bez izuzetka. Međutim, ovaj primjer i korištenje dodataka mogu značajno pojednostaviti zadatak.

Ručno podešavanje Robots.txt

Slično, možete podesiti svoju konfiguraciju datoteke čak iu nedostatku spremnog CMS-a za web lokaciju. Korisnik također treba da učita datoteku robots.txt u korijenski direktorij stranice i navede potrebna pravila. Evo jednog od primjera u kojem su navedene sve dostupne direktive:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Kako provjeriti datoteku Robots.txt

Kao pomoćni alat pri provjeravanju grešaka u fajlu robots.txt, preporučuje se korištenje online usluga.

Razmotrimo primjer Yandex webmaster usluga. Da biste provjerili, morate u odgovarajuće polje umetnuti link do vaše stranice ako je datoteka već otpremljena na server. Nakon toga, sam alat će učitati konfiguraciju datoteke. Postoji i mogućnost ručnog unosa konfiguracije:

Robots.txt konfiguracija

Zatim morate zatražiti provjeru i čekati rezultate:

Rezultat podešavanja Robots.txt

U datom primjeru nema grešaka. Ako ih ima, servis će pokazati problematična područja i načine kako ih popraviti.

zaključak

Ukratko, naglasili smo koliko je robots.txt datoteka važna za kontrolu prometa na stranici. Dali smo savjete o tome kako ga pravilno postaviti da upravlja načinom na koji pretraživači indeksiraju stranice. Osim ovoga, pogledali smo i primjere kako pravilno koristiti ovu datoteku i dali upute kako provjeriti da li sve postavke rade ispravno.

❮ Prethodni članak Kako se povezati na Linux server preko SSH-a
Sljedeći članak ❯ Kako konfigurirati web server (Apache-PHP-MySQL/MariaDB) na Linuxu

Pitajte nas za VPS

Uvek smo spremni da odgovorimo na vaša pitanja u bilo koje doba dana i noći.