Tudásbázis Egyszerű utasítások a Profitserver szolgáltatással való együttműködéshez
Tudásbázis Robots.txt

Robots.txt


Ebben a cikkben megvizsgáljuk a robots.txt fájl kulcsfontosságú szerepét a webhelyek forgalmának kezelésében, megvitatjuk jelenlétének szükségességét, és javaslatokat adunk a hatékony oldalindexelés kezeléséhez. Ezenkívül példákat elemezünk a helyes direktívák használatára a robots.txt fájlban, és útmutatót adunk a beállítások helyességének ellenőrzéséhez.

Miért van szükség a Robots.txt fájlra?

A Robots.txt egy fájl, amely a webhely kiszolgálóján, annak gyökérkönyvtárában található. Tájékoztatja a keresőrobotokat, hogyan kell átvizsgálniuk az erőforrás tartalmát. A fájl megfelelő használata segít megelőzni a nem kívánt oldalak indexelését, megvédi a bizalmas adatokat, és javítja a SEO optimalizálás hatékonyságát és a webhely láthatóságát a keresési eredmények között. A robots.txt konfigurálása direktívákon keresztül történik, amelyeket a továbbiakban megvizsgálunk.

Irányelvek beállítása a Robots.txt fájlban

User-Agent

Az elsődleges direktíva User-Agent néven ismert, ahol egy speciális kulcsszót állítunk be a robotok számára. A szó észlelésekor a robot megérti, hogy a szabály kifejezetten neki szól.

Vegyünk egy példát a User-Agent használatára a robots.txt fájlban:

User-Agent: *
Disallow: /private/

Ez a példa azt jelzi, hogy az összes keresőrobot (amelyet a " szimbólum jelöl*") figyelmen kívül kell hagynia a címben található oldalakat /magán/ könyvtárban.

A következőképpen néz ki az utasítás bizonyos keresőrobotok esetén:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

Ebben az esetben a Googlebot keresőrobotnak figyelmen kívül kell hagynia az oldalakat a /admin/ könyvtár, míg Bingbot figyelmen kívül kell hagynia az oldalakat a /magán/ könyvtárban.

helytelenít

helytelenít megmondja a keresőrobotoknak, hogy mely URL-eket hagyják ki vagy ne indexeljék a webhelyen. Ez az irányelv akkor hasznos, ha el akarja rejteni az érzékeny adatokat vagy az alacsony minőségű tartalmú oldalakat a keresőmotorok általi indexelés elől. Ha a robots.txt fájl tartalmazza a bejegyzést Disallow: /könyvtárak/, akkor a robotok megtagadják a hozzáférést a megadott könyvtár tartalmához. Például,

User-agent: *
Disallow: /admin/

Ez az érték azt jelzi minden robot figyelmen kívül kell hagynia a következővel kezdődő URL-eket /admin/. Ha meg szeretné akadályozni, hogy a teljes webhelyet robotok indexeljék, állítsa be a gyökérkönyvtárat szabályként:

User-agent: *
Disallow: /

Hagyjuk

Az "Allow" érték ellentétes a "Disallow" értékkel: lehetővé teszi a keresőrobotok számára, hogy hozzáférjenek egy adott oldalhoz vagy könyvtárhoz, még akkor is, ha a robots.txt fájl más direktívái tiltják a hozzáférést.

Vegyünk egy példát:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

Ebben a példában az van megadva, hogy a robotok nem férhetnek hozzá a /admin/ könyvtár, kivéve a /admin/login.html oldal, amely indexelhető és szkennelhető.

Robots.txt és webhelytérkép

A webhelytérkép egy XML-fájl, amely a webhely összes oldalának és fájljának URL-címét tartalmazza, amelyet a keresőmotorok indexelhetnek. Amikor egy keresőrobot hozzáfér a robots.txt fájlhoz, és egy webhelytérkép XML-fájlra mutató hivatkozást lát, a fájl segítségével megkeresheti a webhelyen elérhető összes URL-t és erőforrást. Az irányelv a következő formátumban van megadva:

Sitemap: https://yoursite.com/filesitemap.xml

Ez a szabály általában a dokumentum végére kerül, anélkül, hogy egy adott felhasználói ügynökhöz lenne kötve, és kivétel nélkül minden robot feldolgozza. Ha a webhely tulajdonosa nem használja a sitemap.xml fájlt, akkor nem szükséges hozzáadni a szabályt.

Példák a konfigurált Robots.txt fájlra

A Robots.txt beállítása a WordPresshez

Ebben a részben a WordPress kész konfigurációját vizsgáljuk meg. Megvizsgáljuk a bizalmas adatokhoz való hozzáférés blokkolását és a főoldalakhoz való hozzáférés engedélyezését.

Kész megoldásként használhatja a következő kódot:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

Bár minden irányelvet megjegyzések kísérnek, ássuk be mélyebben a következtetéseket.

  1. A robotok nem indexelnek érzékeny fájlokat és könyvtárakat.
  2. Ugyanakkor a robotok hozzáférhetnek a webhely fő oldalaihoz és erőforrásaihoz.
  3. tilalom van beállítva a bejegyzések régi verzióinak és a paraméterezett lekérdezéseknek az indexelésére a tartalom megkettőzésének megakadályozása érdekében.
  4. A webhelytérkép helye a jobb indexelés érdekében van feltüntetve.

Így egy általános példát vettünk egy kész konfigurációra, amelyben néhány érzékeny fájl és elérési út rejtve van az indexelés elől, de a fő könyvtárak elérhetők.

Ellentétben sok népszerű CMS-szel vagy egyedileg írt webhelyekkel, a WordPress számos bővítményt tartalmaz, amelyek megkönnyítik a robots.txt fájl létrehozását és kezelését. Erre a célra az egyik népszerű megoldás az Yoast SEO.

A telepítéshez a következőket kell tennie:

  1. Lépjen a WordPress adminisztrációs panelre.
  2. A „Bővítmények” részben válassza az „Új hozzáadása” lehetőséget.
  3. Keresse meg a "Yoast SEO" bővítményt, és telepítse.
  4. Aktiválja a plugint.

A robots.txt fájl szerkesztéséhez a következőket kell tennie:

  1. Lépjen az adminisztrációs panel oldalsó menüjének "SEO" szakaszába, és válassza az "Általános" lehetőséget.
  2. Lépjen az "Eszközök" fülre.
  3. Kattintson a "Fájlok" elemre. Itt különféle fájlokat láthat, köztük a robots.txt fájlt.
  4. Adja meg a szükséges indexelési szabályokat igényei szerint.
  5. A fájl módosítása után kattintson a "Módosítások mentése a robots.txt fájlba" gombra.

Vegye figyelembe, hogy a WordPress minden robots.txt fájlbeállítása egyedi, és a webhely konkrét igényeitől és szolgáltatásaitól függ. Nincs olyan univerzális sablon, amely kivétel nélkül minden erőforráshoz megfelelne. Ez a példa és a beépülő modulok használata azonban jelentősen leegyszerűsítheti a feladatot.

A Robots.txt kézi beállítása

Hasonlóképpen beállíthatja a fájl konfigurációját akkor is, ha nincs kész CMS a webhelyhez. A felhasználónak fel kell töltenie a robots.txt fájlt a webhely gyökérkönyvtárába, és meg kell adnia a szükséges szabályokat. Íme az egyik példa, amelyben az összes elérhető direktíva fel van tüntetve:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

A Robots.txt fájl ellenőrzése

Segédeszközként a robots.txt fájl hibáinak ellenőrzéséhez ajánlott az online szolgáltatások használata.

Tekintsük a Yandex webmester szolgáltatás. Az ellenőrzéshez be kell szúrnia a webhelyére mutató hivatkozást a megfelelő mezőbe, ha a fájl már fel van töltve a szerverre. Ezt követően az eszköz maga tölti be a fájlkonfigurációt. Lehetőség van a konfiguráció manuális megadására is:

Robots.txt konfigurációja

Ezután kérnie kell egy ellenőrzést, és meg kell várnia az eredményeket:

Robots.txt beállítás eredménye

Az adott példában nincsenek hibák. Ha vannak ilyenek, a szolgáltatás megmutatja a problémás területeket és a megoldási módokat.

Összegzés

Összefoglalva, hangsúlyoztuk, mennyire fontos a robots.txt fájl a webhely forgalmának szabályozásában. Tanácsot adtunk arról, hogyan állítsa be megfelelően a keresőmotorok oldalak indexelésének kezeléséhez. Ezen kívül példákat is megvizsgáltunk a fájl helyes használatára, és utasításokat adtunk az összes beállítás megfelelő működésének ellenőrzésére.

❮ Előző cikk Hogyan lehet csatlakozni egy Linux szerverhez SSH-n keresztül
Következő cikk ❯ Webszerver (Apache-PHP-MySQL/MariaDB) konfigurálása Linuxon

Kérdezzen meg minket a VPS-ről

Mindig készséggel válaszolunk kérdéseire a nap és az éjszaka bármely szakában.