በዚህ ጽሑፍ ውስጥ የ robots.txt ፋይልን በድረ-ገጾች ላይ ትራፊክን ለመቆጣጠር ያለውን ቁልፍ ሚና እንመረምራለን, ስለ መገኘቱ አስፈላጊነት እንወያይበታለን እና ውጤታማ የገጽ መረጃ ጠቋሚ አስተዳደርን ለማዘጋጀት ምክሮችን እንሰጣለን. በተጨማሪም፣ በ robots.txt ፋይል ውስጥ ትክክለኛ የመመሪያ አጠቃቀም ምሳሌዎችን እንመረምራለን እና ቅንብሮቹን ትክክለኛነት እንዴት ማረጋገጥ እንደሚቻል መመሪያ እንሰጣለን።
ለምን Robots.txt ያስፈልጋል
Robots.txt በስር ማውጫው ውስጥ በጣቢያው አገልጋይ ላይ የሚገኝ ፋይል ነው። የፍለጋ ሞተር ሮቦቶች የንብረቱን ይዘት እንዴት መፈተሽ እንዳለባቸው ያሳውቃል። ይህንን ፋይል በትክክል መጠቀም ያልተፈለጉ ገጾችን መረጃ ጠቋሚን ለመከላከል ይረዳል, ሚስጥራዊ መረጃዎችን ይከላከላል, እና በፍለጋ ውጤቶች ውስጥ የ SEO ማመቻቸት እና የጣቢያውን ታይነት ያሻሽላል. የ robots.txt ውቅር የሚከናወነው በመመሪያዎች ነው, ይህም የበለጠ እንመለከታለን.
በRobots.txt ውስጥ መመሪያዎችን ማቀናበር
የተጠቃሚ ወኪል
ዋናው መመሪያ ለሮቦቶች ልዩ ቁልፍ ቃል የምናዘጋጅበት የተጠቃሚ-ወኪል በመባል ይታወቃል። ይህን ቃል ሲያውቅ ሮቦቱ ደንቡ ለእሱ የታሰበ መሆኑን ተረድቷል።
በRobots.txt ፋይል ውስጥ የተጠቃሚ-ወኪል የመጠቀም ምሳሌን ተመልከት፡-
User-Agent: *
Disallow: /private/
ይህ ምሳሌ እንደሚያሳየው ሁሉም የፍለጋ ሮቦቶች (በ" * " ምልክት የተወከሉት ) በ /private/ ማውጫ ውስጥ የሚገኙትን ገጾች ችላ ማለት አለባቸው።
መመሪያው ለተወሰኑ የፍለጋ ሮቦቶች እንዴት እንደሚመስል እነሆ፡-
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
በዚህ ሁኔታ፣ የጉግልቦት የፍለጋ ሮቦት በ /admin/ ማውጫ ውስጥ ያሉትን ገጾች ችላ ማለት አለበት፣ Bingbot ደግሞ በ /private/ ማውጫ ውስጥ ያሉትን ገጾች ችላ ማለት አለበት።
አትፍቀድ
ዲሳሎው የፍለጋ ሮቦቶችን የትኞቹ ዩአርኤሎች በድር ጣቢያው ላይ ኢንዴክስ መዝለል እንዳለባቸው ወይም እንደማይዘሉ ይነግራቸዋል። ይህ መመሪያ ሚስጥራዊ መረጃዎችን ወይም ዝቅተኛ ጥራት ያላቸውን የይዘት ገጾች በፍለጋ ፕሮግራሞች እንዳይጠቆሙ ለመደበቅ ሲፈልጉ ጠቃሚ ነው። የrobots.txt ፋይል ዲሳሎው : /directory/ የሚለውን ግቤት ከያዘ ፣ ሮቦቶች የተገለጸውን ማውጫ ይዘቶች እንዳያገኙ ይከለከላሉ። ለምሳሌ፣
User-agent: *
Disallow: /admin/
ይህ እሴት ሁሉም ሮቦቶች በ /admin/ የሚጀምሩ ዩአርኤሎችን ችላ ማለት እንዳለባቸው ያሳያል ። መላው ጣቢያ በማንኛውም ሮቦቶች እንዳይገለበጥ ለማገድ፣ የስር ማውጫውን እንደ ደንብ ያዘጋጁ
User-agent: *
Disallow: /
ፍቀድ
የ"ፍቀድ" እሴቱ ከ"አትፈቀድ" ተቃራኒ ነው የሚሰራው፡ የፍለጋ ሮቦቶች ወደ አንድ የተወሰነ ገጽ ወይም ማውጫ እንዲደርሱ ይፈቅድላቸዋል፣ ምንም እንኳን በrobots.txt ፋይል ውስጥ ያሉ ሌሎች መመሪያዎች እሱን መድረስን የሚከለክሉ ቢሆኑም።
አንድ ምሳሌ እንመልከት፡-
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
በዚህ ምሳሌ ውስጥ፣ ለመረጃ ጠቋሚ እና ለመቃኘት ከሚገኘው የ/admin /login.html ገጽ በስተቀር ሮቦቶች ወደ /admin/ ማውጫው እንዲገቡ እንደማይፈቀድላቸው ተገልጿል ።
Robots.txt እና የጣቢያ ካርታ
የጣቢያ ካርታ በፍለጋ ሞተሮች ሊጠቆሙ የሚችሉ የሁሉም ገፆች እና የፋይሎች ዩአርኤሎች ዝርዝር የያዘ የኤክስኤምኤል ፋይል ነው። የፍለጋ ሮቦት የrobots.txt ፋይሉን ሲደርስ እና ወደ የጣቢያ ካርታ ኤክስኤምኤል ፋይል የሚወስድ አገናኝ ሲያይ፣ ይህን ፋይል በጣቢያው ላይ ያሉትን ሁሉንም URLs እና ግብዓቶች ለማግኘት ሊጠቀም ይችላል። መመሪያው በቅርጸት ተገልጿል፡-
Sitemap: https://yoursite.com/filesitemap.xml
ይህ ህግ ብዙውን ጊዜ ከአንድ የተወሰነ ተጠቃሚ-ወኪል ጋር ሳይያያዝ በሰነዱ መጨረሻ ላይ ይቀመጣል እና በሁሉም ሮቦቶች ያለምንም ልዩነት ይከናወናል። የጣቢያው ባለቤት sitemap.xml የማይጠቀም ከሆነ, ደንቡን ማከል አስፈላጊ አይደለም.
የተዋቀሩ Robots.txt ምሳሌዎች
Robots.txt ለዎርድፕረስ በማዘጋጀት ላይ
በዚህ ክፍል ውስጥ, ለ WordPress ዝግጁ የሆነ ውቅር እንመለከታለን. ሚስጥራዊ ውሂብ መዳረሻን መከልከል እና ወደ ዋና ገፆች መድረስን እንቃኛለን።
እንደ ዝግጁ መፍትሄ, የሚከተለውን ኮድ መጠቀም ይችላሉ:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
ምንም እንኳን ሁሉም መመሪያዎች በአስተያየቶች የታጀቡ ቢሆኑም ወደ መደምደሚያዎቹ በጥልቀት እንመርምር።
- ሮቦቶች ሚስጥራዊነት ያላቸው ፋይሎችን እና ማውጫዎችን አይጠቁሙም።
- በተመሳሳይ ጊዜ ሮቦቶች የጣቢያው ዋና ገፆች እና ሀብቶች እንዲደርሱ ተፈቅዶላቸዋል.
- የይዘት መባዛትን ለመከላከል የቆዩ የልጥፎችን ስሪቶች እና መጠይቆችን በመጠቆም ላይ እገዳ ተቀምጧል።
- የጣቢያ ካርታው ቦታ ለተሻሻለ መረጃ ጠቋሚ ተጠቁሟል።
ስለዚህ ፣ አንዳንድ ሚስጥራዊነት ያላቸው ፋይሎች እና ዱካዎች ከመረጃ ጠቋሚ የተደበቁበት የዝግጁ ውቅር አጠቃላይ ምሳሌን ተመልክተናል ፣ ግን ዋናዎቹ ማውጫዎች ተደራሽ ናቸው።
ከብዙ ታዋቂ የሲኤምኤስ ወይም ብጁ የተጻፉ ድረ-ገጾች በተለየ መልኩ፣ WordPress የrobots.txt ፋይልን መፍጠር እና ማስተዳደርን የሚያመቻቹ በርካታ ተሰኪዎች አሉት። ለዚህ ዓላማ ከሚቀርቡት ታዋቂ መፍትሄዎች አንዱ Yoast SEO ነው ።
እሱን ለመጫን የሚከተሉትን ማድረግ አለብዎት:
- ወደ የዎርድፕረስ አስተዳዳሪ ፓነል ይሂዱ።
- በ "ፕለጊኖች" ክፍል ውስጥ "አዲስ አክል" የሚለውን ይምረጡ.
- የ"Yoast SEO" ተሰኪን ይፈልጉ እና ይጫኑት።
- ተሰኪውን አግብር.
የrobots.txt ፋይልን ለማርትዕ የሚከተሉትን ማድረግ አለብዎት:
- በአስተዳዳሪ ፓነል የጎን ምናሌ ውስጥ ወደ "SEO" ክፍል ይሂዱ እና "አጠቃላይ" ን ይምረጡ.
- ወደ "መሳሪያዎች" ትር ይሂዱ.
- "ፋይሎች" ላይ ጠቅ ያድርጉ. እዚህ robots.txtን ጨምሮ የተለያዩ ፋይሎችን ያያሉ።
- በፍላጎቶችዎ መሰረት አስፈላጊ የሆኑትን የመረጃ ጠቋሚ ደንቦች ያስገቡ.
- በፋይሉ ላይ ለውጦችን ካደረጉ በኋላ "ለውጦችን ወደ robots.txt አስቀምጥ" ቁልፍን ጠቅ ያድርጉ።
እያንዳንዱ የRobots.txt ፋይል ቅንብር ለዎርድፕረስ ልዩ እና በጣቢያው ልዩ ፍላጎቶች እና ባህሪያት ላይ የተመሰረተ መሆኑን ልብ ይበሉ። ያለምንም ልዩነት ሁሉንም ሀብቶች የሚያሟላ ምንም ሁለንተናዊ አብነት የለም። ነገር ግን ይህ ምሳሌ እና ተሰኪዎችን መጠቀም ስራውን በእጅጉ ሊያቃልለው ይችላል።
የRobots.txt በእጅ ቅንብር
በተመሳሳይ, ለጣቢያው ዝግጁ የሆነ CMS በማይኖርበት ጊዜ እንኳን የፋይሉን ውቅር ማዘጋጀት ይችላሉ. እንዲሁም ተጠቃሚው የ robots.txt ፋይልን ወደ ጣቢያው ስርወ ማውጫ መስቀል እና አስፈላጊዎቹን ህጎች መግለጽ አለበት። ሁሉም የሚገኙ መመሪያዎች የሚጠቁሙበት ከምሳሌዎቹ አንዱ ይኸውና፡-
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
የRobots.txt ፋይልን እንዴት ማረጋገጥ እንደሚቻል
የ robots.txt ፋይልን ለስህተት ሲፈተሽ እንደ ረዳት መሳሪያ የመስመር ላይ አገልግሎቶችን ለመጠቀም ይመከራል።
የ Yandex Webmaster አገልግሎትን ምሳሌ ተመልከት ። ለማረጋገጥ፣ ፋይሉ አስቀድሞ ወደ አገልጋዩ ከተሰቀለ በተዛማጅ መስክ ወደ ጣቢያዎ የሚወስድ አገናኝ ማስገባት ያስፈልግዎታል። ከዚያ በኋላ መሣሪያው ራሱ የፋይል ውቅርን ይጭናል። ውቅርን በእጅ ለማስገባት አማራጭም አለ
በመቀጠል ቼክ መጠየቅ እና ውጤቱን መጠበቅ አለቦት፡-
በተሰጠው ምሳሌ, ምንም ስህተቶች የሉም. ካሉ, አገልግሎቱ ችግር ያለባቸውን ቦታዎች እና እነሱን ለማስተካከል መንገዶችን ያሳያል.
መደምደሚያ
በማጠቃለያው የ robots.txt ፋይል በጣቢያው ላይ ያለውን ትራፊክ ለመቆጣጠር ምን ያህል አስፈላጊ እንደሆነ አፅንዖት ሰጥተናል። የፍለጋ ሞተሮች ገጾችን እንዴት እንደሚጠቁሙ ለማስተዳደር እንዴት በትክክል ማዋቀር እንደሚቻል ምክር ሰጥተናል። ከዚህ በተጨማሪ ይህንን ፋይል እንዴት በትክክል መጠቀም እንደሚቻል ምሳሌዎችን ተመልክተናል እና ሁሉም መቼቶች በትክክል መስራታቸውን እንዴት ማረጋገጥ እንደሚቻል መመሪያዎችን ሰጥተናል።