Base de Conhecimento Instruções simples para trabalhar com o serviço Profitserver

Robots.txt


Neste artigo, examinaremos o papel fundamental do arquivo robots.txt no gerenciamento de tráfego em sites, discutiremos a necessidade de sua presença e forneceremos recomendações para configurá-lo para um gerenciamento eficaz de indexação de páginas. Além disso, analisaremos exemplos de uso correto de diretivas no arquivo robots.txt e forneceremos um guia sobre como verificar a exatidão de suas configurações.

Por que Robots.txt é necessário

Robots.txt é um arquivo localizado no servidor do site em seu diretório raiz. Ele informa aos robôs do mecanismo de busca como eles devem escanear o conteúdo do recurso. O uso adequado deste arquivo ajuda a evitar a indexação de páginas indesejadas, protege dados confidenciais e pode melhorar a eficiência da otimização de SEO e a visibilidade do site nos resultados de busca. A configuração do robots.txt é feita por meio de diretivas, que veremos mais adiante.

Definindo diretivas em Robots.txt

User-Agent

A diretiva primária é conhecida como User-Agent, onde definimos uma palavra-chave especial para robôs. Ao detectar essa palavra, o robô entende que a regra é destinada especificamente a ele.

Considere um exemplo de uso do User-Agent no arquivo robots.txt:

User-Agent: *
Disallow: /private/

Este exemplo indica que todos os robôs de busca (representados pelo símbolo "*") deve ignorar páginas localizadas no /privado/ diretório.

Veja como a instrução aparece para robôs de busca específicos:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

Neste caso, o Googlebot o robô de busca deve ignorar páginas no /administrador/ diretório, enquanto Bingbot deve ignorar páginas no /privado/ diretório.

desaprovar

desaprovar informa aos robôs de busca quais URLs pular ou não indexar no site. Esta diretiva é útil quando você quer ocultar dados sensíveis ou páginas de conteúdo de baixa qualidade de serem indexadas por mecanismos de busca. Se o arquivo robots.txt contiver a entrada Não permitir: /diretórios/, então os robôs terão o acesso negado ao conteúdo do diretório especificado. Por exemplo,

User-agent: *
Disallow: /admin/

Este valor indica que todos os robôs deve ignorar URLs que começam com /administrador/. Para bloquear a indexação de todo o site por qualquer robô, defina o diretório raiz como uma regra:

User-agent: *
Disallow: /

Permitir

O valor "Permitir" age de forma oposta a "Não permitir": ele permite que robôs de busca acessem uma página ou diretório específico, mesmo que outras diretivas no arquivo robots.txt proíbam o acesso a ele.

Considere um exemplo:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

Neste exemplo, é especificado que robôs não têm permissão para acessar o /administrador/ diretório, exceto para o /admin/login.html página, que está disponível para indexação e digitalização.

Robots.txt e Mapa do Site

Sitemap é um arquivo XML que contém uma lista de URLs de todas as páginas e arquivos no site que podem ser indexados por mecanismos de busca. Quando um robô de busca acessa o arquivo robots.txt e vê um link para um arquivo XML de sitemap, ele pode usar esse arquivo para encontrar todos os URLs e recursos disponíveis no site. A diretiva é especificada no formato:

Sitemap: https://yoursite.com/filesitemap.xml

Essa regra geralmente é colocada no final do documento sem estar vinculada a um User-Agent específico e é processada por todos os robôs sem exceção. Se o proprietário do site não usar sitemap.xml, não é necessário adicionar a regra.

Exemplos de Robots.txt configurados

Configurando Robots.txt para WordPress

Nesta seção, consideraremos uma configuração pronta para WordPress. Exploraremos o bloqueio de acesso a dados confidenciais e a permissão de acesso às páginas principais.

Como solução pronta, você pode usar o seguinte código:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

Embora todas as diretivas sejam acompanhadas de comentários, vamos nos aprofundar nas conclusões.

  1. Os robôs não indexarão arquivos e diretórios confidenciais.
  2. Ao mesmo tempo, robôs têm permissão para acessar as páginas principais e os recursos do site.
  3. é proibida a indexação de versões antigas de postagens e consultas parametrizadas para evitar duplicação de conteúdo.
  4. A localização do mapa do site é indicada para melhor indexação.

Assim, consideramos um exemplo geral de uma configuração pronta, na qual alguns arquivos e caminhos confidenciais ficam ocultos da indexação, mas os diretórios principais ficam acessíveis.

Ao contrário de muitos CMS populares ou sites personalizados, o WordPress tem vários plugins que facilitam a criação e o gerenciamento do arquivo robots.txt. Uma das soluções populares para esse propósito é Yoast SEO.

Para instalá-lo, você precisa:

  1. Acesse o painel de administração do WordPress.
  2. Na seção "Plugins", selecione "Adicionar novo".
  3. Encontre o plugin "Yoast SEO" e instale-o.
  4. Ative o plugin.

Para editar o arquivo robots.txt, você precisa:

  1. Vá para a seção "SEO" no menu lateral do painel de administração e selecione "Geral".
  2. Vá para a aba "Ferramentas".
  3. Clique em "Arquivos". Aqui você verá vários arquivos, incluindo robots.txt.
  4. Insira as regras de indexação necessárias de acordo com suas necessidades.
  5. Depois de fazer alterações no arquivo, clique no botão "Salvar alterações em robots.txt".

Observe que cada configuração do arquivo robots.txt para WordPress é única e depende das necessidades e recursos específicos do site. Não há um modelo universal que sirva para todos os recursos sem exceção. No entanto, este exemplo e o uso de plugins podem simplificar significativamente a tarefa.

Configuração manual do Robots.txt

Da mesma forma, você pode configurar seu arquivo mesmo na ausência de um CMS pronto para o site. O usuário também precisa carregar o arquivo robots.txt para o diretório raiz do site e especificar as regras necessárias. Aqui está um dos exemplos, no qual todas as diretivas disponíveis são indicadas:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Como verificar o arquivo Robots.txt

Como ferramenta auxiliar na verificação de erros no arquivo robots.txt, é recomendável usar serviços online.

Considere o exemplo do Webmaster do Yandex serviço. Para verificar, você precisa inserir um link para seu site no campo correspondente se o arquivo já estiver carregado no servidor. Depois disso, a própria ferramenta carregará a configuração do arquivo. Também há uma opção para inserir a configuração manualmente:

Configuração do Robots.txt

Em seguida, você precisa solicitar um cheque e aguardar os resultados:

Resultado da configuração do Robots.txt

No exemplo dado, não há erros. Se houver, o serviço mostrará as áreas problemáticas e maneiras de corrigi-las.

Conclusão

Em resumo, enfatizamos o quão importante o arquivo robots.txt é para controlar o tráfego no site. Fornecemos conselhos sobre como configurá-lo corretamente para gerenciar como os mecanismos de busca indexam páginas. Além disso, também analisamos exemplos de como usar corretamente esse arquivo e demos instruções sobre como verificar se todas as configurações estão funcionando corretamente.

❮ Artigo anterior Como se conectar a um servidor Linux via SSH
Próximo artigo ❯ Como configurar um servidor web (Apache-PHP-MySQL/MariaDB) no Linux

Pergunte-nos sobre VPS

Estamos sempre prontos para responder suas perguntas a qualquer hora do dia ou da noite.