V tomto článku prozkoumáme klíčovou roli souboru robots.txt při správě provozu na webových stránkách, prodiskutujeme nezbytnost jeho přítomnosti a poskytneme doporučení pro jeho nastavení pro efektivní správu indexování stránek. Dále analyzujeme příklady správného použití direktiv v souboru robots.txt a poskytneme návod, jak zkontrolovat správnost jeho nastavení.
Proč je potřeba Robots.txt
Robots.txt je soubor umístěný na serveru webu v jeho kořenovém adresáři. Informuje roboty vyhledávačů, jak by měli skenovat obsah zdroje. Správné použití tohoto souboru pomáhá předcházet indexování nežádoucích stránek, chrání důvěrná data a může zlepšit efektivitu SEO optimalizace a viditelnost webu ve výsledcích vyhledávání. Konfigurace robots.txt se provádí pomocí direktiv, na které se podíváme dále.
Nastavení direktiv v Robots.txt
User-Agent
Primární direktiva je známá jako User-Agent, kde nastavujeme speciální klíčové slovo pro roboty. Po detekci tohoto slova robot pochopí, že pravidlo je určeno speciálně pro něj.
Zvažte příklad použití User-Agent v souboru robots.txt:
User-Agent: *
Disallow: /private/
Tento příklad ukazuje, že všechny vyhledávací roboty (reprezentované symbolem "*") by měl ignorovat stránky umístěné v /soukromý/ adresáře.
Takto vypadá instrukce pro konkrétní vyhledávací roboty:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
V tomto případě Googlebot vyhledávací robot by měl ignorovat stránky v / admin / adresář, zatímco Bingbot by měl ignorovat stránky v /soukromý/ adresáře.
neuznat
neuznat sděluje vyhledávacím robotům, které adresy URL mají na webu přeskočit nebo neindexovat. Tato direktiva je užitečná, když chcete skrýt citlivá data nebo stránky s nekvalitním obsahem před indexováním vyhledávači. Pokud soubor robots.txt obsahuje záznam Disallow: /adresáře/, pak bude robotům odepřen přístup k obsahu zadaného adresáře. Například,
User-agent: *
Disallow: /admin/
Tato hodnota to naznačuje všichni roboti by měl ignorovat adresy URL začínající na / admin /. Chcete-li zablokovat indexování celého webu jakýmkoli robotem, nastavte kořenový adresář jako pravidlo:
User-agent: *
Disallow: /
povolit
Hodnota „Allow“ funguje opačně než hodnota „Disallow“: umožňuje vyhledávacím robotům přístup ke konkrétní stránce nebo adresáři, i když jiné příkazy v souboru robots.txt přístup k nim zakazují.
Zvažte příklad:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
V tomto příkladu je specifikováno, že roboti nemají povolen přístup k / admin / adresář, kromě /admin/login.html stránku, která je k dispozici pro indexování a skenování.
Robots.txt a soubor Sitemap
Sitemap je soubor XML, který obsahuje seznam adres URL všech stránek a souborů na webu, které mohou být indexovány vyhledávači. Když vyhledávací robot přistoupí k souboru robots.txt a uvidí odkaz na soubor XML mapy webu, může tento soubor použít k nalezení všech dostupných adres URL a zdrojů na webu. Směrnice je uvedena ve formátu:
Sitemap: https://yoursite.com/filesitemap.xml
Toto pravidlo je obvykle umístěno na konci dokumentu, aniž by bylo vázáno na konkrétního User-Agenta a je zpracováváno všemi roboty bez výjimky. Pokud vlastník webu nepoužívá sitemap.xml, není nutné pravidlo přidávat.
Příklady Configured Robots.txt
Nastavení Robots.txt pro WordPress
V této části budeme zvažovat hotovou konfiguraci pro WordPress. Prozkoumáme blokování přístupu k důvěrným údajům a povolení přístupu na hlavní stránky.
Jako hotové řešení můžete použít následující kód:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Přestože jsou všechny směrnice doprovázeny komentáři, pojďme se hlouběji ponořit do závěrů.
- Roboti nebudou indexovat citlivé soubory a adresáře.
- Zároveň je robotům povolen přístup k hlavním stránkám a zdrojům webu.
- ban je nastaven na indexování starých verzí příspěvků a parametrizovaných dotazů, aby se zabránilo duplicitě obsahu.
- Umístění souboru Sitemap je uvedeno pro lepší indexování.
Uvažovali jsme tedy o obecném příkladu hotové konfigurace, ve které jsou některé citlivé soubory a cesty skryté před indexováním, ale hlavní adresáře jsou přístupné.
Na rozdíl od mnoha populárních CMS nebo webů napsaných na zakázku má WordPress několik pluginů, které usnadňují vytváření a správu souboru robots.txt. Jedním z populárních řešení pro tento účel je Yoast SEO.
Chcete-li jej nainstalovat, musíte:
- Přejděte na panel správce WordPress.
- V části „Pluginy“ vyberte „Přidat nový“.
- Najděte plugin „Yoast SEO“ a nainstalujte jej.
- Aktivujte plugin.
Chcete-li upravit soubor robots.txt, musíte:
- Přejděte do sekce "SEO" v postranní nabídce panelu správce a vyberte "Obecné".
- Přejděte na kartu "Nástroje".
- Klikněte na "Soubory". Zde uvidíte různé soubory, včetně robots.txt.
- Zadejte nezbytná pravidla indexování podle vašich požadavků.
- Po provedení změn v souboru klikněte na tlačítko „Uložit změny do souboru robots.txt“.
Upozorňujeme, že každé nastavení souboru robots.txt pro WordPress je jedinečné a závisí na konkrétních potřebách a funkcích webu. Neexistuje žádná univerzální šablona, která by vyhovovala všem zdrojům bez výjimky. Tento příklad a použití pluginů však může úkol výrazně zjednodušit.
Ruční nastavení souboru Robots.txt
Podobně můžete nastavit konfiguraci souboru i v případě, že pro web nemáte připravený CMS. Uživatel také musí nahrát soubor robots.txt do kořenového adresáře webu a zadat potřebná pravidla. Zde je jeden z příkladů, ve kterém jsou uvedeny všechny dostupné směrnice:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Jak zkontrolovat soubor Robots.txt
Jako pomocný nástroj při kontrole chyb v souboru robots.txt se doporučuje používat online služby.
Zvažte příklad Webmaster Yandex servis. Chcete-li zkontrolovat, musíte do příslušného pole vložit odkaz na váš web, pokud je soubor již nahrán na server. Poté nástroj sám načte konfiguraci souboru. Existuje také možnost zadat konfiguraci ručně:
Dále musíte požádat o kontrolu a počkat na výsledky:
V uvedeném příkladu nejsou žádné chyby. Pokud nějaké existují, služba ukáže problematické oblasti a způsoby, jak je opravit.
Závěr
V souhrnu jsme zdůraznili, jak důležitý je soubor robots.txt pro řízení provozu na webu. Poskytli jsme rady, jak jej správně nastavit, aby bylo možné spravovat indexování stránek vyhledávači. Kromě toho jsme se také podívali na příklady správného použití tohoto souboru a dali jsme pokyny, jak zkontrolovat, zda všechna nastavení fungují správně.