Šiame straipsnyje išnagrinėsime pagrindinį robots.txt failo vaidmenį valdant srautą svetainėse, aptarsime jo buvimo būtinybę ir pateiksime rekomendacijas, kaip jį nustatyti efektyviam puslapių indeksavimo valdymui. Be to, mes analizuosime teisingų direktyvų naudojimo robots.txt faile pavyzdžius ir pateiksime vadovą, kaip patikrinti jo nustatymų teisingumą.
Kodėl reikalingas Robots.txt
Robots.txt yra failas, esantis svetainės serveryje, jos šakniniame kataloge. Ji informuoja paieškos sistemų robotus, kaip jie turėtų nuskaityti ištekliaus turinį. Tinkamas šio failo naudojimas padeda išvengti nepageidaujamų puslapių indeksavimo, apsaugo konfidencialius duomenis, gali pagerinti SEO optimizavimo efektyvumą ir svetainės matomumą paieškos rezultatuose. Robots.txt konfigūracija atliekama naudojant direktyvas, kurias panagrinėsime toliau.
Direktyvų nustatymas faile Robots.txt
User-agent
Pirminė direktyva žinoma kaip User-Agent, kurioje nustatome specialų raktinį žodį robotams. Aptikęs šį žodį robotas supranta, kad taisyklė skirta būtent jam.
Apsvarstykite naudotojo agento naudojimo robots.txt faile pavyzdį:
User-Agent: *
Disallow: /private/
Šis pavyzdys rodo, kad visi paieškos robotai (pavaizduoti simboliu "*“) turėtų nepaisyti puslapių, esančių /privatus/ katalogas.
Štai kaip instrukcija ieško konkrečių paieškos robotų:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
Šiuo atveju, Googlebot paieškos robotas turėtų ignoruoti puslapius /admin/ katalogas, o Bingbot turėtų nepaisyti puslapių /privatus/ katalogas.
atmesti
atmesti nurodo paieškos robotams, kuriuos URL svetainėje praleisti ar neindeksuoti. Ši direktyva naudinga, kai norite paslėpti neskelbtinus duomenis arba žemos kokybės turinio puslapius, kad jie nebūtų indeksuojami paieškos sistemų. Jei faile robots.txt yra įrašas Neleisti: /katalogai/, tada robotams bus uždrausta prieiga prie nurodyto katalogo turinio. Pavyzdžiui,
User-agent: *
Disallow: /admin/
Ši vertė rodo, kad visi robotai turėtų nepaisyti URL, prasidedančių /admin/. Norėdami užblokuoti visą svetainę, kad jokie robotai neindeksuotų, nustatykite šakninį katalogą kaip taisyklę:
User-agent: *
Disallow: /
Leisti
Vertė „Allow“ veikia priešingai nei „Disallow“: ji leidžia paieškos robotams pasiekti konkretų puslapį arba katalogą, net jei kitos robots.txt failo direktyvos draudžia prieiti prie jo.
Apsvarstykite pavyzdį:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
Šiame pavyzdyje nurodyta, kad robotams neleidžiama prieiti prie /admin/ katalogą, išskyrus /admin/login.html puslapį, kurį galima indeksuoti ir nuskaityti.
Robots.txt ir svetainės schema
Svetainės schema yra XML failas, kuriame yra visų svetainės puslapių ir failų, kuriuos paieškos sistemos gali indeksuoti, URL sąrašas. Kai paieškos robotas pasiekia robots.txt failą ir pamato nuorodą į svetainės schemos XML failą, jis gali naudoti šį failą, kad surastų visus galimus URL ir išteklius svetainėje. Direktyva nurodyta tokiu formatu:
Sitemap: https://yoursite.com/filesitemap.xml
Ši taisyklė paprastai dedama dokumento pabaigoje, nesusieta su konkrečiu vartotojo agentu ir ją apdoroja visi be išimties robotai. Jei svetainės savininkas nenaudoja sitemap.xml, taisyklės pridėti nebūtina.
Sukonfigūruoto Robots.txt pavyzdžiai
Robots.txt, skirto „WordPress“, nustatymas
Šiame skyriuje apžvelgsime paruoštą „WordPress“ konfigūraciją. Išnagrinėsime, kaip blokuoti prieigą prie konfidencialių duomenų ir suteikti prieigą prie pagrindinių puslapių.
Kaip paruoštą sprendimą galite naudoti šį kodą:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Nors prie visų direktyvų pridedami komentarai, pasigilinkime į išvadas.
- Robotai neindeksuos jautrių failų ir katalogų.
- Tuo pačiu metu robotams leidžiama prieiti prie pagrindinių svetainės puslapių ir išteklių.
- nustatytas draudimas indeksuoti senas įrašų versijas ir parametrizuotas užklausas, kad būtų išvengta turinio dubliavimo.
- Svetainės schemos vieta nurodyta, kad būtų pagerintas indeksavimas.
Taigi, mes išnagrinėjome bendrą paruoštos konfigūracijos pavyzdį, kai kai kurie jautrūs failai ir keliai yra paslėpti nuo indeksavimo, tačiau pagrindiniai katalogai yra prieinami.
Skirtingai nuo daugelio populiarių TVS ar pagal užsakymą parašytų svetainių, „WordPress“ turi kelis papildinius, palengvinančius robots.txt failo kūrimą ir valdymą. Vienas iš populiariausių sprendimų šiam tikslui yra Yoast SEO.
Norėdami jį įdiegti, turite:
- Eikite į „WordPress“ administratoriaus skydelį.
- Skiltyje „Papildiniai“ pasirinkite „Pridėti naują“.
- Raskite „Yoast SEO“ papildinį ir įdiekite jį.
- Įjunkite papildinį.
Norėdami redaguoti robots.txt failą, turite:
- Eikite į skyrių „SEO“ administratoriaus skydelio šoniniame meniu ir pasirinkite „Bendra“.
- Eikite į skirtuką „Įrankiai“.
- Spustelėkite „Failai“. Čia matysite įvairius failus, įskaitant robots.txt.
- Įveskite būtinas indeksavimo taisykles pagal savo poreikius.
- Atlikę failo pakeitimus, spustelėkite mygtuką „Išsaugoti pakeitimus į robots.txt“.
Atminkite, kad kiekvienas „WordPress“ failo robots.txt nustatymas yra unikalus ir priklauso nuo konkrečių svetainės poreikių ir funkcijų. Nėra universalaus šablono, kuris tiktų visiems be išimties ištekliams. Tačiau šis pavyzdys ir įskiepių naudojimas gali žymiai supaprastinti užduotį.
Rankinis failo Robots.txt nustatymas
Panašiai galite nustatyti failo konfigūraciją net ir nesant paruoštos svetainei TVS. Vartotojas taip pat turi įkelti robots.txt failą į šakninį svetainės katalogą ir nurodyti reikiamas taisykles. Štai vienas iš pavyzdžių, kuriame nurodytos visos galimos direktyvos:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Kaip patikrinti failą Robots.txt
Kaip pagalbinį įrankį tikrinant, ar faile robots.txt nėra klaidų, rekomenduojama naudoti internetines paslaugas.
Apsvarstykite pavyzdį „Yandex“ žiniatinklio valdytojas paslauga. Norėdami patikrinti, atitinkamame lauke turite įterpti nuorodą į savo svetainę, jei failas jau įkeltas į serverį. Po to pats įrankis įkels failo konfigūraciją. Taip pat yra galimybė rankiniu būdu įvesti konfigūraciją:
Tada turite paprašyti patikrinimo ir laukti rezultatų:
Pateiktame pavyzdyje klaidų nėra. Jei tokių yra, paslauga parodys problemines vietas ir būdus, kaip jas sutvarkyti.
Išvada
Apibendrinant, pabrėžėme, koks svarbus failas robots.txt yra kontroliuojant srautą svetainėje. Pateikėme patarimų, kaip tinkamai jį nustatyti, kad būtų galima valdyti, kaip paieškos sistemos indeksuoja puslapius. Be to, mes taip pat peržiūrėjome pavyzdžius, kaip teisingai naudoti šį failą, ir davėme instrukcijas, kaip patikrinti, ar visi nustatymai veikia tinkamai.