Այս հոդվածում մենք կուսումնասիրենք robots.txt ֆայլի առանցքային դերը կայքերում տրաֆիկի կառավարման գործում, կքննարկենք դրա առկայության անհրաժեշտությունը և առաջարկություններ կներկայացնենք այն կարգավորելու համար՝ էջի ինդեքսավորման արդյունավետ կառավարման համար: Բացի այդ, մենք կվերլուծենք robots.txt ֆայլում հրահանգների ճիշտ օգտագործման օրինակները և կներկայացնենք ուղեցույց, թե ինչպես ստուգել դրա կարգավորումների ճշգրտությունը:
Ինչու է Robots.txt-ը անհրաժեշտ
Robots.txt-ը ֆայլ է, որը գտնվում է կայքի սերվերի վրա՝ նրա արմատային գրացուցակում: Այն տեղեկացնում է որոնման ռոբոտներին, թե ինչպես պետք է սկանավորեն ռեսուրսի բովանդակությունը: Այս ֆայլի ճիշտ օգտագործումը օգնում է կանխել անցանկալի էջերի ինդեքսավորումը, պաշտպանում է գաղտնի տվյալները և կարող է բարելավել SEO-ի օպտիմալացման արդյունավետությունը և կայքի տեսանելիությունը որոնման արդյունքներում: robots.txt-ի կոնֆիգուրացիան կատարվում է դիրեկտիվների միջոցով, որոնց կանդրադառնանք հետագա:
Հրահանգների կարգավորում Robots.txt-ում
Օգտագործողի գործակալ
Առաջնային հրահանգը հայտնի է որպես User-Agent, որտեղ մենք սահմանում ենք հատուկ բանալի բառ ռոբոտների համար: Այս բառը հայտնաբերելուց հետո ռոբոտը հասկանում է, որ կանոնը նախատեսված է հատուկ իր համար։
Դիտարկենք User-Agent-ի օգտագործման օրինակը robots.txt ֆայլում.
User-Agent: *
Disallow: /private/
Այս օրինակը ցույց է տալիս, որ բոլոր որոնման ռոբոտները (ներկայացված են խորհրդանիշով «*«) պետք է անտեսի էջերը, որոնք գտնվում են /մասնավոր/ Հայաստան.
Ահա թե ինչպես է հրահանգը փնտրում հատուկ որոնման ռոբոտների համար.
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
Այս դեպքում, Google- որոնման ռոբոտը պետք է անտեսի էջերը /admin/ գրացուցակը, մինչդեռ Bingbot պետք է անտեսել էջերը /մասնավոր/ Հայաստան.
արգելել
արգելել ասում է որոնման ռոբոտներին, թե որ URL-ները պետք է բաց թողնեն կամ չցուցադրեն կայքում: Այս հրահանգը օգտակար է, երբ ցանկանում եք թաքցնել զգայուն տվյալներ կամ ցածրորակ բովանդակության էջերը որոնողական համակարգերի կողմից ինդեքսավորվելուց: Եթե robots.txt ֆայլը պարունակում է մուտքը Արգելել՝ /directories/, ապա ռոբոտներին կարգելվի մուտք գործել նշված գրացուցակի բովանդակություն: Օրինակ՝
User-agent: *
Disallow: /admin/
Այս արժեքը ցույց է տալիս, որ բոլոր ռոբոտները պետք է անտեսել URL-ները սկսած /admin/. Որպեսզի ամբողջ կայքը արգելափակվի որևէ ռոբոտի կողմից ինդեքսավորվելու համար, որպես կանոն սահմանեք արմատային գրացուցակը.
User-agent: *
Disallow: /
Թույլ տալ
«Թույլատրել» արժեքը հակառակ է «Disallow»-ին. այն թույլ է տալիս որոնման ռոբոտներին մուտք գործել որոշակի էջ կամ գրացուցակ, նույնիսկ եթե robots.txt ֆայլի այլ հրահանգներն արգելում են մուտքը դեպի այն:
Դիտարկենք մի օրինակ.
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
Այս օրինակում նշվում է, որ ռոբոտներին չի թույլատրվում մուտք գործել /admin/ գրացուցակը, բացառությամբ /admin/login.html էջ, որը հասանելի է ինդեքսավորման և սկանավորման համար:
Robots.txt և Կայքի քարտեզ
Կայքի քարտեզը XML ֆայլ է, որը պարունակում է կայքի բոլոր էջերի և ֆայլերի URL-ների ցանկը, որոնք կարող են ինդեքսավորվել որոնման համակարգերի կողմից: Երբ որոնող ռոբոտը մուտք է գործում robots.txt ֆայլ և տեսնում է հղում դեպի կայքի քարտեզ XML ֆայլի, այն կարող է օգտագործել այս ֆայլը՝ գտնելու բոլոր հասանելի URL-ները և ռեսուրսները կայքում: Հրահանգը նշված է ձևաչափով.
Sitemap: https://yoursite.com/filesitemap.xml
Այս կանոնը սովորաբար դրվում է փաստաթղթի վերջում՝ առանց որևէ կոնկրետ օգտատեր-գործակալի հետ կապվելու և մշակվում է բոլոր ռոբոտների կողմից՝ առանց բացառության: Եթե կայքի սեփականատերը չի օգտագործում sitemap.xml, անհրաժեշտ չէ ավելացնել կանոնը։
Կազմաձևված Robots.txt-ի օրինակներ
WordPress-ի համար Robots.txt-ի կարգավորում
Այս բաժնում մենք կքննարկենք WordPress-ի համար պատրաստի կոնֆիգուրացիան: Մենք կուսումնասիրենք գաղտնի տվյալների մուտքն արգելափակելը և հիմնական էջերը մուտքի թույլտվությունը:
Որպես պատրաստի լուծում, կարող եք օգտագործել հետևյալ կոդը.
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Թեև բոլոր հրահանգներն ուղեկցվում են մեկնաբանություններով, եկեք խորանանք եզրակացությունների մեջ։
- Ռոբոտները չեն ինդեքսավորի զգայուն ֆայլերը և գրացուցակները:
- Միաժամանակ ռոբոտներին թույլատրվում է մուտք գործել կայքի հիմնական էջեր և ռեսուրսներ։
- արգելք է դրված գրառումների հին տարբերակների և պարամետրացված հարցումների ինդեքսավորման վրա՝ բովանդակության կրկնօրինակումը կանխելու համար:
- Կայքի քարտեզի գտնվելու վայրը նշված է բարելավված ինդեքսավորման համար:
Այսպիսով, մենք դիտարկել ենք պատրաստի կոնֆիգուրացիայի ընդհանուր օրինակ, որտեղ որոշ զգայուն ֆայլեր և ուղիներ թաքնված են ինդեքսավորումից, բայց հիմնական դիրեկտորիաները հասանելի են:
Ի տարբերություն շատ հայտնի CMS կամ հատուկ գրված կայքերի՝ WordPress-ն ունի մի քանի պլագիններ, որոնք հեշտացնում են robots.txt ֆայլի ստեղծումն ու կառավարումը։ Այս նպատակով հայտնի լուծումներից է Yoast SEO.
Այն տեղադրելու համար անհրաժեշտ է.
- Գնացեք WordPress-ի ադմինիստրատորի վահանակ:
- «Մոդուլներ» բաժնում ընտրեք «Ավելացնել նոր»:
- Գտեք «Yoast SEO» հավելվածը և տեղադրեք այն:
- Ակտիվացրեք plugin-ը:
Robots.txt ֆայլը խմբագրելու համար անհրաժեշտ է.
- Գնացեք «SEO» բաժին ադմինիստրատորի վահանակի կողային ընտրացանկում և ընտրեք «Ընդհանուր»:
- Գնացեք «Գործիքներ» ներդիր:
- Սեղմեք «Ֆայլեր»: Այստեղ դուք կտեսնեք տարբեր ֆայլեր, ներառյալ robots.txt-ը:
- Մուտքագրեք անհրաժեշտ ինդեքսավորման կանոնները՝ ըստ ձեր պահանջների:
- Ֆայլում փոփոխություններ կատարելուց հետո սեղմեք «Պահպանել փոփոխությունները robots.txt-ում» կոճակը։
Նկատի ունեցեք, որ WordPress-ի համար robots.txt ֆայլի յուրաքանչյուր կարգավորում եզակի է և կախված է կայքի հատուկ կարիքներից և առանձնահատկություններից: Չկա ունիվերսալ ձևանմուշ, որը կհամապատասխանի բոլոր ռեսուրսներին առանց բացառության: Այնուամենայնիվ, այս օրինակը և պլագինների օգտագործումը կարող են զգալիորեն պարզեցնել խնդիրը:
Robots.txt-ի ձեռքով կարգավորում
Նմանապես, դուք կարող եք կարգավորել ֆայլի ձեր կոնֆիգուրացիան նույնիսկ կայքի համար պատրաստ CMS-ի բացակայության դեպքում: Օգտագործողը պետք է նաև վերբեռնի robots.txt ֆայլը կայքի արմատական գրացուցակում և նշի անհրաժեշտ կանոնները։ Ահա օրինակներից մեկը, որում նշված են բոլոր առկա հրահանգները.
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Ինչպես ստուգել Robots.txt ֆայլը
Որպես օժանդակ գործիք՝ robots.txt ֆայլը սխալների համար ստուգելիս, խորհուրդ է տրվում օգտվել առցանց ծառայություններից։
Դիտարկենք օրինակը Yandex Webmaster սպասարկում. Ստուգելու համար անհրաժեշտ է համապատասխան դաշտում տեղադրել ձեր կայքի հղումը, եթե ֆայլն արդեն վերբեռնված է սերվեր: Դրանից հետո գործիքն ինքնին կբեռնի ֆայլի կազմաձևը: Կա նաև կարգավորումը ձեռքով մուտքագրելու տարբերակ.
Հաջորդը, դուք պետք է պահանջեք ստուգում և սպասեք արդյունքներին.
Տվյալ օրինակում սխալներ չկան։ Եթե այդպիսիք կան, ապա ծառայությունը ցույց կտա խնդրահարույց ոլորտները և դրանք շտկելու ուղիները:
Եզրափակում
Ամփոփելով, մենք ընդգծեցինք, թե որքան կարևոր է robots.txt ֆայլը կայքում տրաֆիկի վերահսկման համար: Մենք խորհուրդ ենք տվել այն մասին, թե ինչպես ճիշտ կարգավորել այն՝ կառավարելու համար, թե ինչպես են որոնման համակարգերը ինդեքսավորում էջերը: Բացի դրանից, մենք նաև նայեցինք այս ֆայլը ճիշտ օգտագործելու օրինակներին և հրահանգներ տվեցինք, թե ինչպես ստուգել, որ բոլոր կարգավորումները ճիշտ են աշխատում: