En ĉi tiu artikolo, ni ekzamenos la ŝlosilan rolon de la robots.txt-dosiero en administrado de trafiko en retejoj, diskutos la neceson de ĝia ĉeesto kaj provizos rekomendojn por agordi ĝin por efika administrado de paĝa indeksado. Aldone, ni analizos ekzemplojn de ĝusta uzado de direktivoj en la robots.txt-dosiero kaj provizos gvidilon pri kiel kontroli la ĝustecon de ĝiaj agordoj.
Kial Robots.txt estas Bezonata
Robots.txt estas dosiero situanta sur la servilo de la retejo en ĝia radika dosierujo. Ĝi informas serĉilon robotojn kiel ili devus skani la enhavon de la rimedo. Ĝusta uzo de ĉi tiu dosiero helpas malhelpi la indeksadon de nedezirataj paĝoj, protektas konfidencajn datumojn kaj povas plibonigi la efikecon de SEO-optimumigo kaj videblecon de la retejo en serĉrezultoj. La agordo de robots.txt estas farita per direktivoj, kiujn ni rigardos plu.
Agordi Direktivojn en Robots.txt
Uzanto-Agento
La ĉefa direktivo estas konata kiel Uzanto-Agente, kie ni starigas specialan ŝlosilvorton por robotoj. Detektante ĉi tiun vorton, la roboto komprenas, ke la regulo estas destinita specife por ĝi.
Konsideru ekzemplon de uzado de User-Agent en la robots.txt dosiero:
User-Agent: *
Disallow: /private/
Ĉi tiu ekzemplo indikas, ke ĉiuj serĉrobotoj (reprezentitaj per la simbolo "*") devus ignori paĝojn situantajn en la /privata/ dosierujo.
Jen kiel la instrukcio aspektas por specifaj serĉrobotoj:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
En ĉi tiu kazo, la googlebot serĉroboto devus ignori paĝojn en la /administranto/ dosierujo, dum bingbot devus ignori paĝojn en la /privata/ dosierujo.
Malpermeso
Malpermeso diras al serĉrobotoj kiuj URL-oj transsalti aŭ ne indeksi en la retejo. Ĉi tiu direktivo estas utila kiam vi volas kaŝi sentemajn datumojn aŭ malaltkvalitajn enhavajn paĝojn por esti indeksitaj de serĉiloj. Se la robots.txt dosiero enhavas la eniron Malpermeso: /dosierujo/, tiam robotoj estos rifuzita aliro al la enhavo de la specifita dosierujo. Ekzemple,
User-agent: *
Disallow: /admin/
Ĉi tiu valoro indikas tion ĉiuj robotoj devus ignori URL-ojn komencantajn per /administranto/. Por malhelpi la tutan retejon esti indeksita de iuj robotoj, agordu la radikan dosierujon kiel regulo:
User-agent: *
Disallow: /
permesus
La valoro "Allow" agas male al "Malpermeso": ĝi permesas al serĉrobotoj aliron al specifa paĝo aŭ dosierujo, eĉ se aliaj direktivoj en la robots.txt dosiero malpermesas aliron al ĝi.
Konsideru ekzemplon:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
En ĉi tiu ekzemplo, estas precizigita ke robotoj ne rajtas aliron al la /administranto/ dosierujo, krom la /admin/login.html paĝo, kiu estas disponebla por indeksado kaj skanado.
Robots.txt kaj Retejmapo
Retejmapo estas XML-dosiero, kiu enhavas liston de URL-oj de ĉiuj paĝoj kaj dosieroj en la retejo, kiuj povas esti indeksitaj de serĉiloj. Kiam serĉroboto aliras la robots.txt-dosieron kaj vidas ligon al retejomapa XML-dosiero, ĝi povas uzi ĉi tiun dosieron por trovi ĉiujn disponeblajn URL-ojn kaj rimedojn en la retejo. La direktivo estas specifita en la formato:
Sitemap: https://yoursite.com/filesitemap.xml
Ĉi tiu regulo estas kutime metita ĉe la fino de la dokumento sen esti ligita al specifa Uzanto-Agente kaj estas prilaborita de ĉiuj robotoj sen escepto. Se la posedanto de la retejo ne uzas sitemap.xml, ne necesas aldoni la regulon.
Ekzemploj de Agordita Robotoj.txt
Agordante Robots.txt por WordPress
En ĉi tiu sekcio, ni konsideros pretan agordon por WordPress. Ni esploros bloki aliron al konfidencaj datumoj kaj permesi aliron al la ĉefaj paĝoj.
Kiel preta solvo, vi povas uzi la jenan kodon:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Kvankam ĉiuj direktivoj estas akompanataj de komentoj, ni pliprofundiĝu en la konkludojn.
- Robotoj ne indeksos sentemajn dosierojn kaj dosierujojn.
- Samtempe, robotoj rajtas aliron al la ĉefaj paĝoj kaj rimedoj de la retejo.
- malpermeso estas fiksita pri indeksado de malnovaj versioj de afiŝoj kaj parametrizitaj demandoj por malhelpi enhavoduobligadon.
- La loko de la retejomapo estas indikita por plibonigita indeksado.
Tiel, ni konsideris ĝeneralan ekzemplon de preta agordo, en kiu iuj sentemaj dosieroj kaj vojoj estas kaŝitaj de indeksado, sed la ĉefaj dosierujoj estas alireblaj.
Male al multaj popularaj CMS aŭ laŭkutime skribitaj retejoj, WordPress havas plurajn kromaĵojn, kiuj faciligas la kreadon kaj administradon de la robots.txt-dosiero. Unu el la popularaj solvoj por ĉi tiu celo estas yoast SEO.
Por instali ĝin, vi devas:
- Iru al la administra panelo de WordPress.
- En la sekcio "Aldonaĵoj", elektu "Aldoni Novan".
- Trovu la kromprogramon "Yoast SEO" kaj instalu ĝin.
- Aktivigu la kromprogramon.
Por redakti la robots.txt-dosieron, vi devas:
- Iru al la sekcio "SEO" en la flanka menuo de la administra panelo kaj elektu "Ĝenerala".
- Iru al la langeto "Iloj".
- Alklaku "Dosieroj". Ĉi tie vi vidos diversajn dosierojn, inkluzive de robots.txt.
- Enigu la necesajn indeksajn regulojn laŭ viaj postuloj.
- Post fari ŝanĝojn al la dosiero, alklaku la butonon "Konservi ŝanĝojn al robots.txt".
Notu, ke ĉiu dosiero robots.txt por WordPress estas unika kaj dependas de la specifaj bezonoj kaj funkcioj de la retejo. Ne ekzistas universala ŝablono, kiu taŭgus al ĉiuj rimedoj senescepte. Tamen, ĉi tiu ekzemplo kaj la uzo de kromaĵoj povas signife simpligi la taskon.
Mana Agordo de Robots.txt
Simile, vi povas agordi vian agordon de la dosiero eĉ en foresto de preta CMS por la retejo. La uzanto ankaŭ bezonas alŝuti la robots.txt-dosieron al la radika dosierujo de la retejo kaj specifi la necesajn regulojn. Jen unu el la ekzemploj, en kiuj ĉiuj disponeblaj direktivoj estas indikitaj:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Kiel Kontroli la Robots.txt-dosieron
Kiel helpa ilo kiam oni kontrolas la robots.txt-dosieron por eraroj, oni rekomendas uzi retajn servojn.
Konsideru la ekzemplon de la Yandex Retejo servo. Por kontroli, vi devas enmeti ligilon al via retejo en la respondan kampon se la dosiero jam estas alŝutita al la servilo. Post tio, la ilo mem ŝarĝos la dosieron agordon. Ankaŭ ekzistas eblo por enmeti la agordon permane:
Poste, vi devas peti kontrolon kaj atendi la rezultojn:
En la donita ekzemplo, ne estas eraroj. Se ekzistas, la servo montros la problemajn areojn kaj manierojn ripari ilin.
konkludo
Resume, ni emfazis kiom gravas la robots.txt dosiero por kontroli trafikon en la retejo. Ni provizis konsilojn pri kiel ĝuste agordi ĝin por administri kiel serĉiloj indekspaĝojn. Krom ĉi tio, ni ankaŭ rigardis ekzemplojn pri kiel ĝuste uzi ĉi tiun dosieron kaj donis instrukciojn pri kiel kontroli, ke ĉiuj agordoj funkcias ĝuste.