지식 Profitserver 서비스를 사용하기 위한 간단한 지침
본관 지식 robots.txt에

robots.txt에


이 글에서는 웹사이트 트래픽 관리에서 robots.txt 파일의 핵심 역할을 살펴보고, 이 파일의 존재 필요성을 논의하며, 효과적인 페이지 인덱싱 관리를 위해 이를 설정하기 위한 권장 사항을 제공합니다. 또한 robots.txt 파일에서 올바른 지시문 사용의 예를 분석하고 설정의 정확성을 확인하는 방법에 대한 가이드를 제공합니다.

Robots.txt가 필요한 이유

Robots.txt는 사이트 서버의 루트 디렉토리에 있는 파일입니다. 검색 엔진 로봇에게 리소스의 콘텐츠를 스캔하는 방법을 알려줍니다. 이 파일을 적절히 사용하면 원치 않는 페이지의 인덱싱을 방지하고 기밀 데이터를 보호하며 검색 결과에서 사이트의 SEO 최적화 및 가시성을 개선하는 데 도움이 됩니다. robots.txt의 구성은 지침을 통해 수행되며, 이에 대해 자세히 살펴보겠습니다.

Robots.txt에 지침 설정

사용자 에이전트

주요 지시는 User-Agent로 알려져 있으며, 여기서 우리는 로봇에 대한 특수 키워드를 설정합니다. 이 단어를 감지하면 로봇은 규칙이 특별히 자신을 위해 의도된 것임을 이해합니다.

robots.txt 파일에서 User-Agent를 사용하는 예를 살펴보겠습니다.

User-Agent: *
Disallow: /private/

이 예는 모든 검색 로봇(기호 "로 표시됨)을 나타냅니다.*")는 다음 위치에 있는 페이지를 무시해야 합니다. /사적인/ 디렉토리.

특정 검색 로봇에 대한 지침은 다음과 같습니다.

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

이 경우 Googlebot이 검색 로봇은 다음 페이지를 무시해야 합니다. /관리자/ 디렉토리, 동안 Bingbot 페이지를 무시해야 합니다. /사적인/ 디렉토리.

금지

금지 검색 로봇에게 웹사이트에서 건너뛸 URL이나 인덱싱하지 않을 URL을 알려줍니다. 이 지시문은 민감한 데이터나 품질이 낮은 콘텐츠 페이지가 검색 엔진에서 인덱싱되는 것을 숨기고 싶을 때 유용합니다. robots.txt 파일에 다음 항목이 포함된 경우 금지: /directories/, 그러면 로봇은 지정된 디렉토리의 내용에 대한 액세스가 거부됩니다. 예를 들어,

User-agent: *
Disallow: /admin/

이 값은 다음을 나타냅니다. 모든 로봇 로 시작하는 URL은 무시해야 합니다. /관리자/. 로봇이 전체 사이트를 인덱싱하는 것을 차단하려면 루트 디렉토리를 규칙으로 설정하세요.

User-agent: *
Disallow: /

허용

"허용" 값은 "허용 안 함"과 반대로 작동합니다. 즉, robots.txt 파일의 다른 지침이 액세스를 금지하더라도 검색 로봇이 특정 페이지나 디렉토리에 액세스하는 것을 허용합니다.

예를 들어보자:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

이 예에서는 로봇이 다음에 액세스할 수 없도록 지정됩니다. /관리자/ 디렉토리는 제외 /admin/로그인.html 인덱싱 및 스캔이 가능한 페이지입니다.

Robots.txt 및 사이트맵

사이트맵은 검색 엔진에서 인덱싱할 수 있는 사이트의 모든 페이지와 파일의 URL 목록을 포함하는 XML 파일입니다. 검색 로봇이 robots.txt 파일에 액세스하여 사이트맵 XML 파일에 대한 링크를 보면 이 파일을 사용하여 사이트에서 사용 가능한 모든 URL과 리소스를 찾을 수 있습니다. 지시문은 다음 형식으로 지정됩니다.

Sitemap: https://yoursite.com/filesitemap.xml

이 규칙은 일반적으로 특정 User-Agent에 묶이지 않고 문서 끝에 배치되며 예외 없이 모든 로봇에 의해 처리됩니다. 사이트 소유자가 sitemap.xml을 사용하지 않는 경우 규칙을 추가할 필요가 없습니다.

구성된 Robots.txt의 예

WordPress용 Robots.txt 설정

이 섹션에서는 WordPress에 대한 기성 구성을 고려합니다. 기밀 데이터에 대한 액세스를 차단하고 메인 페이지에 대한 액세스를 허용하는 방법을 살펴보겠습니다.

즉시 사용할 수 있는 솔루션으로 다음 코드를 사용할 수 있습니다.

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

모든 지침에는 주석이 수반되지만, 결론에 대해 더 자세히 살펴보겠습니다.

  1. 로봇은 민감한 파일과 디렉토리를 인덱싱하지 않습니다.
  2. 동시에 로봇은 사이트의 메인 페이지와 리소스에 접근할 수 있습니다.
  3. 콘텐츠 중복을 방지하기 위해 이전 버전의 게시물과 매개변수화된 쿼리를 인덱싱하는 것이 금지되었습니다.
  4. 사이트맵의 위치는 인덱싱 개선을 위해 표시됩니다.

따라서 우리는 일부 민감한 파일과 경로가 인덱싱에서 숨겨지지만 주요 디렉터리에는 액세스할 수 있는 준비된 구성의 일반적인 예를 고려해 보았습니다.

많은 인기 있는 CMS나 사용자 정의 사이트와 달리 WordPress에는 robots.txt 파일의 생성과 관리를 용이하게 하는 여러 플러그인이 있습니다. 이 목적을 위한 인기 있는 솔루션 중 하나는 다음과 같습니다. Yoast SEO.

설치하려면 다음이 필요합니다.

  1. WordPress 관리자 패널로 이동합니다.
  2. "플러그인" 섹션에서 "새로 추가"를 선택합니다.
  3. "Yoast SEO" 플러그인을 찾아 설치하세요.
  4. 플러그인을 활성화하십시오.

robots.txt 파일을 편집하려면 다음이 필요합니다.

  1. 관리자 패널의 측면 메뉴에서 "SEO" 섹션으로 가서 "일반"을 선택하세요.
  2. "도구" 탭으로 이동합니다.
  3. "파일"을 클릭하세요. 여기서 robots.txt를 포함한 다양한 파일을 볼 수 있습니다.
  4. 요구 사항에 맞게 필요한 인덱싱 규칙을 입력하세요.
  5. 파일을 변경한 후 "robots.txt에 변경 사항 저장" 버튼을 클릭하세요.

WordPress의 각 robots.txt 파일 설정은 고유하며 사이트의 특정 요구 사항과 기능에 따라 달라집니다. 예외 없이 모든 리소스에 적합한 범용 템플릿은 없습니다. 그러나 이 예와 플러그인을 사용하면 작업을 상당히 단순화할 수 있습니다.

Robots.txt의 수동 설정

마찬가지로, 사이트에 대한 준비된 CMS가 없더라도 파일의 구성을 설정할 수 있습니다. 사용자는 또한 robots.txt 파일을 사이트의 루트 디렉토리에 업로드하고 필요한 규칙을 지정해야 합니다. 다음은 사용 가능한 모든 지시문이 표시된 예 중 하나입니다.

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Robots.txt 파일을 확인하는 방법

robots.txt 파일의 오류를 확인할 때 보조 도구로 온라인 서비스를 사용하는 것이 좋습니다.

의 예를 고려 Yandex 웹마스터 서비스. 확인하려면 파일이 이미 서버에 업로드된 경우 해당 필드에 사이트 링크를 삽입해야 합니다. 그런 다음 도구 자체가 파일 구성을 로드합니다. 구성을 수동으로 입력하는 옵션도 있습니다.

Robots.txt 구성

다음으로, 수표를 요청하고 결과를 기다려야 합니다.

Robots.txt 설정 결과

주어진 예에서는 오류가 없습니다. 오류가 있는 경우, 서비스는 문제가 있는 영역과 이를 수정하는 방법을 보여줍니다.

맺음말

요약하자면, 우리는 robots.txt 파일이 사이트의 트래픽을 제어하는 ​​데 얼마나 중요한지 강조했습니다. 우리는 검색 엔진이 페이지를 인덱싱하는 방법을 관리하기 위해 올바르게 설정하는 방법에 대한 조언을 제공했습니다. 이에 더하여, 우리는 또한 이 파일을 올바르게 사용하는 방법에 대한 예를 살펴보고 모든 설정이 올바르게 작동하는지 확인하는 방법에 대한 지침을 제공했습니다.

❮ 이전 기사 SSH를 통해 Linux 서버에 연결하는 방법
다음 기사 ❯ Linux에서 웹 서버(Apache-PHP-MySQL/MariaDB)를 구성하는 방법

VPS에 대해 문의하세요

저희는 언제든지 여러분의 질문에 답변할 준비가 되어 있습니다.