Ebben a cikkben megvizsgáljuk a robots.txt fájl kulcsfontosságú szerepét a webhelyek forgalmának kezelésében, megvitatjuk jelenlétének szükségességét, és javaslatokat adunk a hatékony oldalindexelés kezeléséhez. Ezenkívül példákat elemezünk a helyes direktívák használatára a robots.txt fájlban, és útmutatót adunk a beállítások helyességének ellenőrzéséhez.
Miért van szükség a Robots.txt fájlra?
A Robots.txt egy fájl, amely a webhely kiszolgálóján, annak gyökérkönyvtárában található. Tájékoztatja a keresőrobotokat, hogyan kell átvizsgálniuk az erőforrás tartalmát. A fájl megfelelő használata segít megelőzni a nem kívánt oldalak indexelését, megvédi a bizalmas adatokat, és javítja a SEO optimalizálás hatékonyságát és a webhely láthatóságát a keresési eredmények között. A robots.txt konfigurálása direktívákon keresztül történik, amelyeket a továbbiakban megvizsgálunk.
Irányelvek beállítása a Robots.txt fájlban
User-Agent
Az elsődleges direktíva User-Agent néven ismert, ahol egy speciális kulcsszót állítunk be a robotok számára. A szó észlelésekor a robot megérti, hogy a szabály kifejezetten neki szól.
Vegyünk egy példát a User-Agent használatára a robots.txt fájlban:
User-Agent: *
Disallow: /private/
Ez a példa azt jelzi, hogy az összes keresőrobot (amelyet a " szimbólum jelöl*") figyelmen kívül kell hagynia a címben található oldalakat /magán/ könyvtárban.
A következőképpen néz ki az utasítás bizonyos keresőrobotok esetén:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
Ebben az esetben a Googlebot keresőrobotnak figyelmen kívül kell hagynia az oldalakat a /admin/ könyvtár, míg Bingbot figyelmen kívül kell hagynia az oldalakat a /magán/ könyvtárban.
helytelenít
helytelenít megmondja a keresőrobotoknak, hogy mely URL-eket hagyják ki vagy ne indexeljék a webhelyen. Ez az irányelv akkor hasznos, ha el akarja rejteni az érzékeny adatokat vagy az alacsony minőségű tartalmú oldalakat a keresőmotorok általi indexelés elől. Ha a robots.txt fájl tartalmazza a bejegyzést Disallow: /könyvtárak/, akkor a robotok megtagadják a hozzáférést a megadott könyvtár tartalmához. Például,
User-agent: *
Disallow: /admin/
Ez az érték azt jelzi minden robot figyelmen kívül kell hagynia a következővel kezdődő URL-eket /admin/. Ha meg szeretné akadályozni, hogy a teljes webhelyet robotok indexeljék, állítsa be a gyökérkönyvtárat szabályként:
User-agent: *
Disallow: /
Hagyjuk
Az "Allow" érték ellentétes a "Disallow" értékkel: lehetővé teszi a keresőrobotok számára, hogy hozzáférjenek egy adott oldalhoz vagy könyvtárhoz, még akkor is, ha a robots.txt fájl más direktívái tiltják a hozzáférést.
Vegyünk egy példát:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
Ebben a példában az van megadva, hogy a robotok nem férhetnek hozzá a /admin/ könyvtár, kivéve a /admin/login.html oldal, amely indexelhető és szkennelhető.
Robots.txt és webhelytérkép
A webhelytérkép egy XML-fájl, amely a webhely összes oldalának és fájljának URL-címét tartalmazza, amelyet a keresőmotorok indexelhetnek. Amikor egy keresőrobot hozzáfér a robots.txt fájlhoz, és egy webhelytérkép XML-fájlra mutató hivatkozást lát, a fájl segítségével megkeresheti a webhelyen elérhető összes URL-t és erőforrást. Az irányelv a következő formátumban van megadva:
Sitemap: https://yoursite.com/filesitemap.xml
Ez a szabály általában a dokumentum végére kerül, anélkül, hogy egy adott felhasználói ügynökhöz lenne kötve, és kivétel nélkül minden robot feldolgozza. Ha a webhely tulajdonosa nem használja a sitemap.xml fájlt, akkor nem szükséges hozzáadni a szabályt.
Példák a konfigurált Robots.txt fájlra
A Robots.txt beállítása a WordPresshez
Ebben a részben a WordPress kész konfigurációját vizsgáljuk meg. Megvizsgáljuk a bizalmas adatokhoz való hozzáférés blokkolását és a főoldalakhoz való hozzáférés engedélyezését.
Kész megoldásként használhatja a következő kódot:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Bár minden irányelvet megjegyzések kísérnek, ássuk be mélyebben a következtetéseket.
- A robotok nem indexelnek érzékeny fájlokat és könyvtárakat.
- Ugyanakkor a robotok hozzáférhetnek a webhely fő oldalaihoz és erőforrásaihoz.
- tilalom van beállítva a bejegyzések régi verzióinak és a paraméterezett lekérdezéseknek az indexelésére a tartalom megkettőzésének megakadályozása érdekében.
- A webhelytérkép helye a jobb indexelés érdekében van feltüntetve.
Így egy általános példát vettünk egy kész konfigurációra, amelyben néhány érzékeny fájl és elérési út rejtve van az indexelés elől, de a fő könyvtárak elérhetők.
Ellentétben sok népszerű CMS-szel vagy egyedileg írt webhelyekkel, a WordPress számos bővítményt tartalmaz, amelyek megkönnyítik a robots.txt fájl létrehozását és kezelését. Erre a célra az egyik népszerű megoldás az Yoast SEO.
A telepítéshez a következőket kell tennie:
- Lépjen a WordPress adminisztrációs panelre.
- A „Bővítmények” részben válassza az „Új hozzáadása” lehetőséget.
- Keresse meg a "Yoast SEO" bővítményt, és telepítse.
- Aktiválja a plugint.
A robots.txt fájl szerkesztéséhez a következőket kell tennie:
- Lépjen az adminisztrációs panel oldalsó menüjének "SEO" szakaszába, és válassza az "Általános" lehetőséget.
- Lépjen az "Eszközök" fülre.
- Kattintson a "Fájlok" elemre. Itt különféle fájlokat láthat, köztük a robots.txt fájlt.
- Adja meg a szükséges indexelési szabályokat igényei szerint.
- A fájl módosítása után kattintson a "Módosítások mentése a robots.txt fájlba" gombra.
Vegye figyelembe, hogy a WordPress minden robots.txt fájlbeállítása egyedi, és a webhely konkrét igényeitől és szolgáltatásaitól függ. Nincs olyan univerzális sablon, amely kivétel nélkül minden erőforráshoz megfelelne. Ez a példa és a beépülő modulok használata azonban jelentősen leegyszerűsítheti a feladatot.
A Robots.txt kézi beállítása
Hasonlóképpen beállíthatja a fájl konfigurációját akkor is, ha nincs kész CMS a webhelyhez. A felhasználónak fel kell töltenie a robots.txt fájlt a webhely gyökérkönyvtárába, és meg kell adnia a szükséges szabályokat. Íme az egyik példa, amelyben az összes elérhető direktíva fel van tüntetve:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
A Robots.txt fájl ellenőrzése
Segédeszközként a robots.txt fájl hibáinak ellenőrzéséhez ajánlott az online szolgáltatások használata.
Tekintsük a Yandex webmester szolgáltatás. Az ellenőrzéshez be kell szúrnia a webhelyére mutató hivatkozást a megfelelő mezőbe, ha a fájl már fel van töltve a szerverre. Ezt követően az eszköz maga tölti be a fájlkonfigurációt. Lehetőség van a konfiguráció manuális megadására is:
Ezután kérnie kell egy ellenőrzést, és meg kell várnia az eredményeket:
Az adott példában nincsenek hibák. Ha vannak ilyenek, a szolgáltatás megmutatja a problémás területeket és a megoldási módokat.
Összegzés
Összefoglalva, hangsúlyoztuk, mennyire fontos a robots.txt fájl a webhely forgalmának szabályozásában. Tanácsot adtunk arról, hogyan állítsa be megfelelően a keresőmotorok oldalak indexelésének kezeléséhez. Ezen kívül példákat is megvizsgáltunk a fájl helyes használatára, és utasításokat adtunk az összes beállítás megfelelő működésének ellenőrzésére.