Знания Прости инструкции за работа с услугата Profitserver

Robots.txt


В тази статия ще разгледаме ключовата роля на файла robots.txt при управлението на трафика на уебсайтове, ще обсъдим необходимостта от неговото присъствие и ще предоставим препоръки за настройването му за ефективно управление на индексирането на страници. Освен това ще анализираме примери за правилно използване на директиви във файла robots.txt и ще предоставим ръководство как да проверите коректността на настройките му.

Защо е необходим Robots.txt

Robots.txt е файл, който се намира на сървъра на сайта в основната му директория. Той информира роботите на търсачките как трябва да сканират съдържанието на ресурса. Правилното използване на този файл помага за предотвратяване на индексирането на нежелани страници, защитава поверителните данни и може да подобри ефективността на SEO оптимизацията и видимостта на сайта в резултатите от търсенето. Конфигурирането на robots.txt се извършва чрез директиви, които ще разгледаме по-нататък.

Задаване на директиви в Robots.txt

User-Agent

Основната директива е известна като User-Agent, където задаваме специална ключова дума за роботи. При откриването на тази дума роботът разбира, че правилото е предназначено специално за него.

Разгледайте пример за използване на User-Agent във файла robots.txt:

User-Agent: *
Disallow: /private/

Този пример показва, че всички роботи за търсене (представени със символа "*") трябва да игнорира страниците, разположени в /лично/ директория.

Ето как изглежда инструкцията за конкретни роботи за търсене:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

В този случай Googlebot роботът за търсене трябва да игнорира страници в /админ/ указател, докато Bingbot трябва да игнорира страници в /лично/ директория.

Забрани

Забрани казва на роботите за търсене кои URL адреси да пропуснат или да не индексират в уебсайта. Тази директива е полезна, когато искате да скриете чувствителни данни или страници с нискокачествено съдържание от индексиране от търсачките. Ако файлът robots.txt съдържа записа Disallow: /директории/, тогава на роботите ще бъде отказан достъп до съдържанието на посочената директория. например,

User-agent: *
Disallow: /admin/

Тази стойност показва, че всички роботи трябва да игнорира URL адреси, започващи с /админ/. За да блокирате целия сайт от индексиране от роботи, задайте основната директория като правило:

User-agent: *
Disallow: /

Позволете

Стойността "Allow" действа противоположно на "Disallow": тя позволява на роботите за търсене достъп до конкретна страница или директория, дори ако други директиви във файла robots.txt забраняват достъпа до тях.

Помислете за пример:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

В този пример е посочено, че на роботите не е разрешен достъп до /админ/ директория, с изключение на /admin/login.html страница, която е достъпна за индексиране и сканиране.

Robots.txt и Sitemap

Sitemap е XML файл, който съдържа списък с URL адреси на всички страници и файлове на сайта, които могат да бъдат индексирани от търсачките. Когато робот за търсене получи достъп до файла robots.txt и види връзка към XML файл с карта на сайта, той може да използва този файл, за да намери всички налични URL адреси и ресурси на сайта. Директивата е посочена във формат:

Sitemap: https://yoursite.com/filesitemap.xml

Това правило обикновено се поставя в края на документа, без да е обвързано с конкретен потребителски агент и се обработва от всички роботи без изключение. Ако собственикът на сайта не използва sitemap.xml, не е необходимо да добавяте правилото.

Примери за конфигуриран Robots.txt

Настройване на Robots.txt за WordPress

В този раздел ще разгледаме готова конфигурация за WordPress. Ще проучим блокирането на достъпа до поверителни данни и разрешаването на достъп до главните страници.

Като готово решение можете да използвате следния код:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

Въпреки че всички директиви са придружени от коментари, нека се задълбочим в заключенията.

  1. Роботите няма да индексират чувствителни файлове и директории.
  2. В същото време на роботите е разрешен достъп до основните страници и ресурси на сайта.
  3. зададена е забрана за индексиране на стари версии на публикации и параметризирани заявки, за да се предотврати дублирането на съдържание.
  4. Местоположението на картата на сайта е посочено за подобрено индексиране.

По този начин разгледахме общ пример за готова конфигурация, в която някои чувствителни файлове и пътища са скрити от индексиране, но основните директории са достъпни.

За разлика от много популярни CMS или персонализирани сайтове, WordPress има няколко добавки, които улесняват създаването и управлението на файла robots.txt. Едно от популярните решения за тази цел е Yoast SEO.

За да го инсталирате, трябва:

  1. Отидете в административния панел на WordPress.
  2. В секцията „Добавки“ изберете „Добавяне на нов“.
  3. Намерете плъгина "Yoast SEO" и го инсталирайте.
  4. Активирайте приставката.

За да редактирате файла robots.txt, трябва да:

  1. Отидете в секцията „SEO“ в страничното меню на административния панел и изберете „Общи“.
  2. Отидете в раздела "Инструменти".
  3. Кликнете върху „Файлове“. Тук ще видите различни файлове, включително robots.txt.
  4. Въведете необходимите правила за индексиране според вашите изисквания.
  5. След като направите промени във файла, щракнете върху бутона „Запазване на промените в robots.txt“.

Обърнете внимание, че всяка настройка на файла robots.txt за WordPress е уникална и зависи от специфичните нужди и характеристики на сайта. Няма универсален шаблон, който да отговаря на всички ресурси без изключение. Въпреки това, този пример и използването на плъгини могат значително да опростят задачата.

Ръчна настройка на Robots.txt

По същия начин можете да настроите вашата конфигурация на файла дори при липса на готов CMS за сайта. Потребителят също трябва да качи файла robots.txt в основната директория на сайта и да посочи необходимите правила. Ето един от примерите, в който са посочени всички налични директиви:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Как да проверите файла robots.txt

Като спомагателен инструмент при проверка на файла robots.txt за грешки се препоръчва използването на онлайн услуги.

Помислете за примера на Уеб администратор на Yandex обслужване. За да проверите, трябва да поставите връзка към вашия сайт в съответното поле, ако файлът вече е качен на сървъра. След това самият инструмент ще зареди конфигурацията на файла. Има и опция за ръчно въвеждане на конфигурацията:

Конфигурация на robots.txt

След това трябва да поискате проверка и да изчакате резултатите:

Резултат от настройката на Robots.txt

В дадения пример няма грешки. Ако има такива, сервизът ще покаже проблемните зони и начините за отстраняването им.

Заключение

В обобщение подчертахме колко важен е файлът robots.txt за контролиране на трафика на сайта. Предоставихме съвети как правилно да го настроите, за да управлявате как търсачките индексират страниците. В допълнение към това разгледахме и примери за това как правилно да използвате този файл и дадохме инструкции как да проверите дали всички настройки работят правилно.

❮ Предишна статия Как да се свържете с Linux сървър чрез SSH
Следваща статия ❯ Как да конфигурирате уеб сървър (Apache-PHP-MySQL/MariaDB) на Linux

Попитайте ни за VPS

Винаги сме готови да отговорим на вашите въпроси по всяко време на деня и нощта.