База знань Проста інструкція по роботі з сервісом Профітсервер

Robots.txt


У цій статті ми розглянемо ключову роль файлу robots.txt в управлінні трафіком на веб-сайтах, обговоримо необхідність його присутності та надамо рекомендації щодо його налаштування для ефективного керування індексацією сторінок. Крім того, ми розберемо приклади правильного використання директив у файлі robots.txt і надамо інструкцію, як перевірити правильність його налаштувань.

Навіщо потрібен файл Robots.txt

Robots.txt — це файл, розташований на сервері сайту в кореневому каталозі. Він повідомляє роботам пошукових систем, як вони повинні сканувати вміст ресурсу. Правильне використання цього файлу допомагає запобігти індексації небажаних сторінок, захищає конфіденційні дані та може підвищити ефективність SEO-оптимізації та видимість сайту в результатах пошуку. Конфігурація robots.txt виконується за допомогою директив, які ми розглянемо далі.

Налаштування директив у Robots.txt

User-Agent

Основна директива відома як User-Agent, де ми встановлюємо спеціальне ключове слово для роботів. Виявивши це слово, робот розуміє, що правило призначене саме для нього.

Розглянемо приклад використання User-Agent у файлі robots.txt:

User-Agent: *
Disallow: /private/

Цей приклад показує, що всі пошукові роботи (позначені символом " * ") повинні ігнорувати сторінки, розташовані в каталозі /private/.

Ось як виглядає інструкція для конкретних пошукових роботів:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

У цьому випадку пошуковий робот Googlebot повинен ігнорувати сторінки в каталозі /admin/ , тоді як Bingbot повинен ігнорувати сторінки в каталозі /private/.

забороняти

Директива Disallow повідомляє пошуковим роботам, які URL-адреси слід пропускати або не індексувати на веб-сайті. Ця директива корисна, коли ви хочете приховати конфіденційні дані або сторінки з низькоякісним контентом від індексації пошуковими системами. Якщо файл robots.txt містить запис Disallow: /directory/ , тоді роботам буде заборонено доступ до вмісту зазначеного каталогу. Наприклад.

User-agent: *
Disallow: /admin/

Це значення вказує на те, що всі роботи повинні ігнорувати URL-адреси, що починаються з /admin/ . Щоб заблокувати індексацію всього сайту будь-якими роботами, встановіть кореневий каталог як правило:

User-agent: *
Disallow: /

Дозволити

Значення «Дозволити» діє протилежно «Заборонити»: воно дозволяє пошуковим роботам доступ до певної сторінки чи каталогу, навіть якщо інші директиви у файлі robots.txt забороняють доступ до них.

Розглянемо приклад:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

У цьому прикладі зазначено, що роботам заборонено доступ до каталогу /admin/ , за винятком сторінки /admin/login.html , яка доступна для індексації та сканування.

Robots.txt і Sitemap

Карта сайту — це XML-файл, який містить список URL-адрес усіх сторінок і файлів на сайті, які можуть бути проіндексовані пошуковими системами. Коли пошуковий робот отримує доступ до файлу robots.txt і бачить посилання на XML-файл карти сайту, він може використовувати цей файл, щоб знайти всі доступні URL-адреси та ресурси на сайті. Директива вказується у форматі:

Sitemap: https://yoursite.com/filesitemap.xml

Це правило зазвичай розміщується в кінці документа без прив’язки до конкретного User-Agent і обробляється всіма роботами без винятку. Якщо власник сайту не використовує sitemap.xml, правило додавати не потрібно.

Приклади налаштованого Robots.txt

Налаштування Robots.txt для WordPress

У цьому розділі ми розглянемо готову конфігурацію для WordPress. Ми розглянемо можливість блокування доступу до конфіденційних даних і надання доступу до головних сторінок.

В якості готового рішення можна використовувати такий код:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

Хоча всі директиви супроводжуються коментарями, зупинимося на висновках глибше.

  1. Роботи не будуть індексувати конфіденційні файли та каталоги.
  2. При цьому роботам надається доступ до головних сторінок і ресурсів сайту.
  3. заборонено індексувати старі версії дописів і параметризовані запити, щоб запобігти дублюванню вмісту.
  4. Розташування карти сайту вказано для покращення індексації.

Таким чином, ми розглянули загальний приклад готової конфігурації, в якій деякі конфіденційні файли та шляхи приховані від індексації, але основні каталоги доступні.

На відміну від багатьох популярних CMS або сайтів, написаних на замовлення, WordPress має кілька плагінів, які спрощують створення та керування файлом robots.txt. Одним з популярних рішень для цієї мети є Yoast SEO.

Щоб його встановити, потрібно:

  1. Перейдіть до панелі адміністратора WordPress.
  2. У розділі «Плагіни» виберіть «Додати новий».
  3. Знайдіть плагін "Yoast SEO" та встановіть його.
  4. Активувати плагін.

Щоб відредагувати файл robots.txt, вам потрібно:

  1. Перейдіть до розділу «SEO» в бічному меню панелі адміністратора та виберіть «Загальні».
  2. Перейдіть на вкладку «Інструменти».
  3. Натисніть «Файли». Тут ви побачите різні файли, зокрема robots.txt.
  4. Введіть необхідні правила індексації відповідно до ваших вимог.
  5. Після внесення змін у файл натисніть кнопку «Зберегти зміни в robots.txt».

Зауважте, що кожне налаштування файлу robots.txt для WordPress є унікальним і залежить від конкретних потреб і особливостей сайту. Немає універсального шаблону, який підходив би для всіх без винятку ресурсів. Однак цей приклад і використання плагінів можуть істотно спростити завдання.

Ручне налаштування Robots.txt

Так само ви можете налаштувати свою конфігурацію файлу навіть за відсутності готової CMS для сайту. Також користувачеві необхідно завантажити файл robots.txt в кореневу директорію сайту і вказати необхідні правила. Ось один із прикладів, в якому вказані всі доступні директиви:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Як перевірити файл robots.txt

В якості допоміжного засобу при перевірці файлу robots.txt на помилки рекомендується використовувати онлайн-сервіси.

Розглянемо приклад сервісу Yandex Webmaster . Для перевірки потрібно вставити посилання на ваш сайт у відповідне поле, якщо файл вже завантажено на сервер. Після цього інструмент сам завантажить конфігурацію файлу. Також є можливість ввести конфігурацію вручну:

Robots.txt Configuration

Далі потрібно замовити перевірку та дочекатися результатів:

Результат налаштування Robots.txt

У наведеному прикладі помилок немає. Якщо такі є, сервіс покаже проблемні місця та способи їх усунення.

Висновок

У підсумку ми підкреслили, наскільки важливий файл robots.txt для контролю трафіку на сайті. Ми надали поради щодо того, як правильно налаштувати його, щоб керувати тим, як пошукові системи індексують сторінки. Окрім цього, ми також розглянули приклади правильного використання цього файлу та надали інструкції, як перевірити, чи всі налаштування працюють правильно.

❮ Попередня стаття Як підключитися до сервера Linux через SSH
Наступна стаття ❯ Як налаштувати веб-сервер (Apache-PHP-MySQL/MariaDB) у Linux

Запитайте нас про VPS

Ми завжди готові відповісти на ваші запитання в будь-який час дня і ночі.