Di vê gotarê de, em ê rola sereke ya pelê robots.txt di birêvebirina seyrûsefera li ser malperan de binirxînin, li ser hewcedariya hebûna wê nîqaş bikin, û ji bo sazkirina wê ji bo rêveberiya bibandor îndekskirina rûpelê pêşniyaran peyda bikin. Wekî din, em ê mînakên karanîna rêwerzên rast ên di pelê robots.txt de analîz bikin û rêbernameyek li ser meriv çawa rastbûna mîhengên wê kontrol bike peyda bikin.
Çima Robots.txt Pêdivî ye
Robots.txt pelek e ku li ser servera malperê di pelrêça wê ya root de ye. Ew robotên motora lêgerînê agahdar dike ka ew çawa divê naveroka çavkaniyê bişopînin. Bikaranîna rast a vê pelê dibe alîkar ku pêşî li navnîşkirina rûpelên nedilxwaz bigire, daneyên nepenî diparêze, û dikare karbidestiya xweşbîniya SEO û dîtina malperê di encamên lêgerînê de çêtir bike. Veavakirina robots.txt bi rêwerzanan tê kirin, ku em ê bêtir li wan binêrin.
Sazkirina Rêbernameyên li Robots.txt
Agentê bikarhêner
Rêbernameya bingehîn wekî Bikarhêner-Agent tê zanîn, li wir em ji bo robotan peyvek taybetî destnîşan dikin. Bi dîtina vê peyvê, robot fam dike ku qaîdeyek bi taybetî ji bo wê hatî armanc kirin.
Nimûneyek karanîna bikarhêner-Agent di pelê robots.txt de binihêrin:
User-Agent: *
Disallow: /private/
Ev nimûne destnîşan dike ku hemî robotên lêgerînê (bi nîşana "*") divê rûpelên ku di nav de ne paşguh bike /taybet/ Peldanka
Li vir çawa rêwerz ji bo robotên lêgerînê yên taybetî xuya dike:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
Di vê rewşê de, ya googlebot robotê lêgerînê divê rûpelên di nav de paşguh bike /admin/ pelrêça, dema Bingbot divê rûpelên di nav de paşguh bikin /taybet/ Peldanka
Nepejirandin
Nepejirandin ji robotên lêgerînê re dibêje ka kîjan URL-an li ser malperê paşguh bikin an nehêlin. Ev rêwerz gava ku hûn dixwazin daneyên hesas an rûpelên naverokê yên kêmkalîteyê ji navnîşkirina motorên lêgerînê veşêrin bikêr e. Heke pelê robots.txt têketinê heye Nehêle: /director/, wê hingê dê robotan bigihîjin naveroka pelrêça diyarkirî nehêlin. Bo nimûne,
User-agent: *
Disallow: /admin/
Ev nirx nîşan dide ku hemû robotan divê URL-yên ku bi dest pê dikin paşguh bikin /admin/. Ji bo astengkirina tevaya malperê ji hêla robotan ve were navnîş kirin, pelrêça root wekî qaîdeyek saz bikin:
User-agent: *
Disallow: /
Destûrê bide
Nirxa "Destûr" berevajî "Nehêle" tevdigere: ew destûrê dide robotên lêgerînê bigihîjin rûpelek an pelrêçek taybetî, tevî ku rêwerzên din ên di pelê robots.txt de gihîştina wê qedexe bikin.
Mînakek bifikirin:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
Di vê nimûneyê de, tê destnîşan kirin ku robotan destûr nadin ku bigihîjin /admin/ pelrêça, ji bilî /admin/login.html rûpel, ku ji bo îndekskirin û şopandinê heye.
Robots.txt û Sitemap
Nexşeya malperê pelek XML ye ku navnîşek URL-yên hemî rûpel û pelên li ser malperê hene ku ji hêla motorên lêgerînê ve têne navnîş kirin. Dema ku robotek lêgerînê digihîje pelê robots.txt û lînka pelek XML ya nexşeya malperê dibîne, ew dikare vê pelê bikar bîne da ku hemî URL û çavkaniyên li ser malperê peyda bike. Rêvebir di forma jêrîn de tête diyar kirin:
Sitemap: https://yoursite.com/filesitemap.xml
Ev qaîdeyek bi gelemperî di dawiya belgeyê de bêyî ku bi Bikarhêner-Agentek taybetî ve were girêdan tête danîn û ji hêla hemî robotan ve bê îstîsna tê pêvajo kirin. Ger xwediyê malperê sitemap.xml bikar neyîne, ne hewce ye ku qaîdeyê lê zêde bike.
Nimûneyên Mîhengên Robots.txt
Sazkirina Robots.txt ji bo WordPress
Di vê beşê de, em ê ji bo WordPress vesazkirinek amade binirxînin. Em ê astengkirina gihandina daneyên nepenî û destûrdana gihîştina rûpelên sereke bikolin.
Wekî çareseriyek amade, hûn dikarin koda jêrîn bikar bînin:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Her çend hemî rêwerzan bi şîroveyan re têne hev kirin, bila em di encaman de kûrtir bigerin.
- Robot dê pel û pelrêçên hesas navnîş nekin.
- Di heman demê de, robot têne destûr kirin ku bigihîjin rûpel û çavkaniyên sereke yên malperê.
- qedexe li ser îndekskirina guhertoyên kevin ên mesajan û pirsên parameterkirî tê danîn da ku pêşî li dubarebûna naverokê bigire.
- Cihê nexşeya malperê ji bo pêşdebirina pêşkeftî tê destnîşan kirin.
Bi vî rengî, me mînakek gelemperî ya veavakirinek amade nirxand, ku tê de hin pel û rêçikên hesas ji îndekskirinê têne veşartin, lê pelrêçên sereke têne gihîştin.
Berevajî gelek CMS-ên populer an malperên xwerû-nivîsandî, WordPress xwedan çend pêvekên ku çêkirin û birêvebirina pelê robots.txt hêsantir dike. Yek ji çareseriyên populer ên ji bo vê armancê ye Yoast SEO.
Ji bo sazkirina wê, hûn hewce ne:
- Biçe panela rêveberê WordPress.
- Di beşa "Plugins" de, "Nû zêde bike" hilbijêrin.
- Pêveka "Yoast SEO" bibînin û saz bikin.
- Plugin çalak bike.
Ji bo guherandina pelê robots.txt, divê hûn:
- Herin beşa "SEO" ya di menuya kêleka panela rêveberiyê de û "Giştî" hilbijêrin.
- Biçe tabê "Amûr".
- Li ser "Pelên" bikirtînin. Li vir hûn ê pelên cihêreng bibînin, di nav de robots.txt.
- Li gorî hewcedariyên we qaîdeyên îndekskirina pêwîst binivîsin.
- Piştî guherandina pelê, bişkoka "Guherandinên li robots.txt tomar bike" bikirtînin.
Bala xwe bidinê ku her mîhenga pelê robots.txt ji bo WordPress bêhempa ye û bi hewcedarî û taybetmendiyên taybetî yên malperê ve girêdayî ye. Şablonek gerdûnî tune ku bêyî îstîsna li gorî hemî çavkaniyan be. Lêbelê, ev mînak û karanîna pêvekan dikare karê girîng hêsan bike.
Mîhenga Manual ya Robots.txt
Bi heman rengî, hûn dikarin veavakirina pelê jî di nebûna CMS-ya amade ya malperê de saz bikin. Her weha pêdivî ye ku bikarhêner pelê robots.txt li pelrêça root ya malperê bar bike û qaîdeyên pêwîst diyar bike. Li vir yek ji mînakan e, ku tê de hemî rêwerzên berdest têne destnîşan kirin:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Meriv çawa Pelê Robots.txt kontrol dike
Wekî amûrek alîkar dema ku pelê robots.txt ji bo xeletiyan kontrol dikin, tê pêşniyar kirin ku karûbarên serhêl bikar bînin.
Nimûneya hanê bifikirin Yandex Webmaster xizmetkar. Ji bo kontrolkirinê, hûn hewce ne ku girêdanek malpera xwe di qada têkildar de têxin ger pel jixwe li serverê hatî barkirin. Piştî wê, amûr bixwe dê veavakirina pelê bar bike. Di heman demê de vebijarkek heye ku meriv bi destan veavakirinê têxe:
Dûv re, hûn hewce ne ku ceribandinek bixwazin û li benda encaman bisekinin:
Di mînaka hatî dayîn de xeletî tune. Ger hebin, karûbar dê deverên pirsgirêk û awayên rastkirina wan nîşan bide.
Xelasî
Bi kurtasî, me tekez kir ku pelê robots.txt çiqas girîng e ji bo kontrolkirina seyrûsefera li ser malperê. Me şîret da ku meriv wê çawa bi rêkûpêk saz bike da ku meriv çawa rûpelên îndeksa motorên lêgerînê birêve bibe. Digel vê yekê, me li mînakan jî nihêrî ka meriv çawa vê pelê bi rengek rast bikar tîne û rêwerzên li ser meriv çawa kontrol dike ku hemî mîhengan rast dixebitin dane.