Knowledgebase Profitserver ծառայության հետ աշխատելու պարզ հրահանգներ

Robots.txt


Այս հոդվածում մենք կուսումնասիրենք robots.txt ֆայլի առանցքային դերը կայքերում տրաֆիկի կառավարման գործում, կքննարկենք դրա առկայության անհրաժեշտությունը և առաջարկություններ կներկայացնենք այն կարգավորելու համար՝ էջի ինդեքսավորման արդյունավետ կառավարման համար: Բացի այդ, մենք կվերլուծենք robots.txt ֆայլում հրահանգների ճիշտ օգտագործման օրինակները և կներկայացնենք ուղեցույց, թե ինչպես ստուգել դրա կարգավորումների ճշգրտությունը:

Ինչու է Robots.txt-ը անհրաժեշտ

Robots.txt-ը ֆայլ է, որը գտնվում է կայքի սերվերի վրա՝ նրա արմատային գրացուցակում: Այն տեղեկացնում է որոնման ռոբոտներին, թե ինչպես պետք է սկանավորեն ռեսուրսի բովանդակությունը: Այս ֆայլի ճիշտ օգտագործումը օգնում է կանխել անցանկալի էջերի ինդեքսավորումը, պաշտպանում է գաղտնի տվյալները և կարող է բարելավել SEO-ի օպտիմալացման արդյունավետությունը և կայքի տեսանելիությունը որոնման արդյունքներում: robots.txt-ի կոնֆիգուրացիան կատարվում է դիրեկտիվների միջոցով, որոնց կանդրադառնանք հետագա:

Հրահանգների կարգավորում Robots.txt-ում

Օգտագործողի գործակալ

Առաջնային հրահանգը հայտնի է որպես User-Agent, որտեղ մենք սահմանում ենք հատուկ բանալի բառ ռոբոտների համար: Այս բառը հայտնաբերելուց հետո ռոբոտը հասկանում է, որ կանոնը նախատեսված է հատուկ իր համար։

Դիտարկենք User-Agent-ի օգտագործման օրինակը robots.txt ֆայլում.

User-Agent: *
Disallow: /private/

Այս օրինակը ցույց է տալիս, որ բոլոր որոնման ռոբոտները (ներկայացված են խորհրդանիշով «*«) պետք է անտեսի էջերը, որոնք գտնվում են /մասնավոր/ Հայաստան.

Ահա թե ինչպես է հրահանգը փնտրում հատուկ որոնման ռոբոտների համար.

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

Այս դեպքում, Google- որոնման ռոբոտը պետք է անտեսի էջերը /admin/ գրացուցակը, մինչդեռ Bingbot պետք է անտեսել էջերը /մասնավոր/ Հայաստան.

արգելել

արգելել ասում է որոնման ռոբոտներին, թե որ URL-ները պետք է բաց թողնեն կամ չցուցադրեն կայքում: Այս հրահանգը օգտակար է, երբ ցանկանում եք թաքցնել զգայուն տվյալներ կամ ցածրորակ բովանդակության էջերը որոնողական համակարգերի կողմից ինդեքսավորվելուց: Եթե ​​robots.txt ֆայլը պարունակում է մուտքը Արգելել՝ /directories/, ապա ռոբոտներին կարգելվի մուտք գործել նշված գրացուցակի բովանդակություն: Օրինակ՝

User-agent: *
Disallow: /admin/

Այս արժեքը ցույց է տալիս, որ բոլոր ռոբոտները պետք է անտեսել URL-ները սկսած /admin/. Որպեսզի ամբողջ կայքը արգելափակվի որևէ ռոբոտի կողմից ինդեքսավորվելու համար, որպես կանոն սահմանեք արմատային գրացուցակը.

User-agent: *
Disallow: /

Թույլ տալ

«Թույլատրել» արժեքը հակառակ է «Disallow»-ին. այն թույլ է տալիս որոնման ռոբոտներին մուտք գործել որոշակի էջ կամ գրացուցակ, նույնիսկ եթե robots.txt ֆայլի այլ հրահանգներն արգելում են մուտքը դեպի այն:

Դիտարկենք մի օրինակ.

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

Այս օրինակում նշվում է, որ ռոբոտներին չի թույլատրվում մուտք գործել /admin/ գրացուցակը, բացառությամբ /admin/login.html էջ, որը հասանելի է ինդեքսավորման և սկանավորման համար:

Robots.txt և Կայքի քարտեզ

Կայքի քարտեզը XML ֆայլ է, որը պարունակում է կայքի բոլոր էջերի և ֆայլերի URL-ների ցանկը, որոնք կարող են ինդեքսավորվել որոնման համակարգերի կողմից: Երբ որոնող ռոբոտը մուտք է գործում robots.txt ֆայլ և տեսնում է հղում դեպի կայքի քարտեզ XML ֆայլի, այն կարող է օգտագործել այս ֆայլը՝ գտնելու բոլոր հասանելի URL-ները և ռեսուրսները կայքում: Հրահանգը նշված է ձևաչափով.

Sitemap: https://yoursite.com/filesitemap.xml

Այս կանոնը սովորաբար դրվում է փաստաթղթի վերջում՝ առանց որևէ կոնկրետ օգտատեր-գործակալի հետ կապվելու և մշակվում է բոլոր ռոբոտների կողմից՝ առանց բացառության: Եթե ​​կայքի սեփականատերը չի օգտագործում sitemap.xml, անհրաժեշտ չէ ավելացնել կանոնը։

Կազմաձևված Robots.txt-ի օրինակներ

WordPress-ի համար Robots.txt-ի կարգավորում

Այս բաժնում մենք կքննարկենք WordPress-ի համար պատրաստի կոնֆիգուրացիան: Մենք կուսումնասիրենք գաղտնի տվյալների մուտքն արգելափակելը և հիմնական էջերը մուտքի թույլտվությունը:

Որպես պատրաստի լուծում, կարող եք օգտագործել հետևյալ կոդը.

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

Թեև բոլոր հրահանգներն ուղեկցվում են մեկնաբանություններով, եկեք խորանանք եզրակացությունների մեջ։

  1. Ռոբոտները չեն ինդեքսավորի զգայուն ֆայլերը և գրացուցակները:
  2. Միաժամանակ ռոբոտներին թույլատրվում է մուտք գործել կայքի հիմնական էջեր և ռեսուրսներ։
  3. արգելք է դրված գրառումների հին տարբերակների և պարամետրացված հարցումների ինդեքսավորման վրա՝ բովանդակության կրկնօրինակումը կանխելու համար:
  4. Կայքի քարտեզի գտնվելու վայրը նշված է բարելավված ինդեքսավորման համար:

Այսպիսով, մենք դիտարկել ենք պատրաստի կոնֆիգուրացիայի ընդհանուր օրինակ, որտեղ որոշ զգայուն ֆայլեր և ուղիներ թաքնված են ինդեքսավորումից, բայց հիմնական դիրեկտորիաները հասանելի են:

Ի տարբերություն շատ հայտնի CMS կամ հատուկ գրված կայքերի՝ WordPress-ն ունի մի քանի պլագիններ, որոնք հեշտացնում են robots.txt ֆայլի ստեղծումն ու կառավարումը։ Այս նպատակով հայտնի լուծումներից է Yoast SEO.

Այն տեղադրելու համար անհրաժեշտ է.

  1. Գնացեք WordPress-ի ադմինիստրատորի վահանակ:
  2. «Մոդուլներ» բաժնում ընտրեք «Ավելացնել նոր»:
  3. Գտեք «Yoast SEO» հավելվածը և տեղադրեք այն:
  4. Ակտիվացրեք plugin-ը:

Robots.txt ֆայլը խմբագրելու համար անհրաժեշտ է.

  1. Գնացեք «SEO» բաժին ադմինիստրատորի վահանակի կողային ընտրացանկում և ընտրեք «Ընդհանուր»:
  2. Գնացեք «Գործիքներ» ներդիր:
  3. Սեղմեք «Ֆայլեր»: Այստեղ դուք կտեսնեք տարբեր ֆայլեր, ներառյալ robots.txt-ը:
  4. Մուտքագրեք անհրաժեշտ ինդեքսավորման կանոնները՝ ըստ ձեր պահանջների:
  5. Ֆայլում փոփոխություններ կատարելուց հետո սեղմեք «Պահպանել փոփոխությունները robots.txt-ում» կոճակը։

Նկատի ունեցեք, որ WordPress-ի համար robots.txt ֆայլի յուրաքանչյուր կարգավորում եզակի է և կախված է կայքի հատուկ կարիքներից և առանձնահատկություններից: Չկա ունիվերսալ ձևանմուշ, որը կհամապատասխանի բոլոր ռեսուրսներին առանց բացառության: Այնուամենայնիվ, այս օրինակը և պլագինների օգտագործումը կարող են զգալիորեն պարզեցնել խնդիրը:

Robots.txt-ի ձեռքով կարգավորում

Նմանապես, դուք կարող եք կարգավորել ֆայլի ձեր կոնֆիգուրացիան նույնիսկ կայքի համար պատրաստ CMS-ի բացակայության դեպքում: Օգտագործողը պետք է նաև վերբեռնի robots.txt ֆայլը կայքի արմատական ​​գրացուցակում և նշի անհրաժեշտ կանոնները։ Ահա օրինակներից մեկը, որում նշված են բոլոր առկա հրահանգները.

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Ինչպես ստուգել Robots.txt ֆայլը

Որպես օժանդակ գործիք՝ robots.txt ֆայլը սխալների համար ստուգելիս, խորհուրդ է տրվում օգտվել առցանց ծառայություններից։

Դիտարկենք օրինակը Yandex Webmaster սպասարկում. Ստուգելու համար անհրաժեշտ է համապատասխան դաշտում տեղադրել ձեր կայքի հղումը, եթե ֆայլն արդեն վերբեռնված է սերվեր: Դրանից հետո գործիքն ինքնին կբեռնի ֆայլի կազմաձևը: Կա նաև կարգավորումը ձեռքով մուտքագրելու տարբերակ.

Robots.txt կոնֆիգուրացիա

Հաջորդը, դուք պետք է պահանջեք ստուգում և սպասեք արդյունքներին.

Robots.txt Կարգավորման արդյունքը

Տվյալ օրինակում սխալներ չկան։ Եթե ​​այդպիսիք կան, ապա ծառայությունը ցույց կտա խնդրահարույց ոլորտները և դրանք շտկելու ուղիները:

Եզրափակում

Ամփոփելով, մենք ընդգծեցինք, թե որքան կարևոր է robots.txt ֆայլը կայքում տրաֆիկի վերահսկման համար: Մենք խորհուրդ ենք տվել այն մասին, թե ինչպես ճիշտ կարգավորել այն՝ կառավարելու համար, թե ինչպես են որոնման համակարգերը ինդեքսավորում էջերը: Բացի դրանից, մենք նաև նայեցինք այս ֆայլը ճիշտ օգտագործելու օրինակներին և հրահանգներ տվեցինք, թե ինչպես ստուգել, ​​որ բոլոր կարգավորումները ճիշտ են աշխատում:

❮ Նախորդ հոդված Ինչպես միանալ Linux սերվերին SSH-ի միջոցով
Հաջորդ հոդվածը ❯ Ինչպես կարգավորել վեբ սերվերը (Apache-PHP-MySQL/MariaDB) Linux-ում

Հարցրեք մեզ VPS-ի մասին

Մենք միշտ պատրաստ ենք պատասխանել ձեր հարցերին օրվա կամ գիշերվա ցանկացած ժամի: