Base de Conhecimento Instruções simples para trabalhar com o serviço Profitserver

Robots.txt


Neste artigo, examinaremos o papel fundamental do arquivo robots.txt no gerenciamento de tráfego em sites, discutiremos a necessidade de sua presença e forneceremos recomendações para configurá-lo para um gerenciamento eficaz de indexação de páginas. Além disso, analisaremos exemplos de uso correto de diretivas no arquivo robots.txt e forneceremos um guia sobre como verificar a exatidão de suas configurações.

Por que Robots.txt é necessário

Robots.txt é um arquivo localizado no servidor do site em seu diretório raiz. Ele informa aos robôs do mecanismo de busca como eles devem escanear o conteúdo do recurso. O uso adequado deste arquivo ajuda a evitar a indexação de páginas indesejadas, protege dados confidenciais e pode melhorar a eficiência da otimização de SEO e a visibilidade do site nos resultados de busca. A configuração do robots.txt é feita por meio de diretivas, que veremos mais adiante.

Definindo diretivas em Robots.txt

User-Agent

A diretiva primária é conhecida como User-Agent, onde definimos uma palavra-chave especial para robôs. Ao detectar essa palavra, o robô entende que a regra é destinada especificamente a ele.

Considere um exemplo de uso do User-Agent no arquivo robots.txt:

User-Agent: *
Disallow: /private/

Este exemplo indica que todos os robôs de busca (representados pelo símbolo " * ") devem ignorar as páginas localizadas no diretório /private/ .

Veja como a instrução aparece para robôs de busca específicos:

User-Agent: Googlebot
Disallow: /admin/

User-Agent: Bingbot
Disallow: /private/

Nesse caso, o robô de busca Googlebot deve ignorar as páginas no diretório /admin/ , enquanto o Bingbot deve ignorar as páginas no diretório /private/ .

desaprovar

A diretiva `Disallow` informa aos robôs de busca quais URLs devem ser ignoradas ou não indexadas no site. Essa diretiva é útil quando você deseja ocultar dados sensíveis ou páginas com conteúdo de baixa qualidade da indexação pelos mecanismos de busca. Se o arquivo `robots.txt` contiver a entrada `Disallow: /diretório/ `, os robôs terão o acesso ao conteúdo do diretório especificado negado. Por exemplo,

User-agent: *
Disallow: /admin/

Esse valor indica que todos os robôs devem ignorar URLs que começam com /admin/ . Para bloquear completamente a indexação do site por qualquer robô, defina o diretório raiz como uma regra:

User-agent: *
Disallow: /

Permitir

O valor "Permitir" age de forma oposta a "Não permitir": ele permite que robôs de busca acessem uma página ou diretório específico, mesmo que outras diretivas no arquivo robots.txt proíbam o acesso a ele.

Considere um exemplo:

User-agent: *
Disallow: /admin/
Allow: /admin/login.html

Neste exemplo, especifica-se que os robôs não têm permissão para acessar o diretório /admin/ , exceto a página /admin/login.html , que está disponível para indexação e verificação.

Robots.txt e Mapa do Site

Sitemap é um arquivo XML que contém uma lista de URLs de todas as páginas e arquivos no site que podem ser indexados por mecanismos de busca. Quando um robô de busca acessa o arquivo robots.txt e vê um link para um arquivo XML de sitemap, ele pode usar esse arquivo para encontrar todos os URLs e recursos disponíveis no site. A diretiva é especificada no formato:

Sitemap: https://yoursite.com/filesitemap.xml

Essa regra geralmente é colocada no final do documento sem estar vinculada a um User-Agent específico e é processada por todos os robôs sem exceção. Se o proprietário do site não usar sitemap.xml, não é necessário adicionar a regra.

Exemplos de Robots.txt configurados

Configurando Robots.txt para WordPress

Nesta seção, consideraremos uma configuração pronta para WordPress. Exploraremos o bloqueio de acesso a dados confidenciais e a permissão de acesso às páginas principais.

Como solução pronta, você pode usar o seguinte código:

User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php

# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*

# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*

# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml

Embora todas as diretivas sejam acompanhadas de comentários, vamos nos aprofundar nas conclusões.

  1. Os robôs não indexarão arquivos e diretórios confidenciais.
  2. Ao mesmo tempo, robôs têm permissão para acessar as páginas principais e os recursos do site.
  3. é proibida a indexação de versões antigas de postagens e consultas parametrizadas para evitar duplicação de conteúdo.
  4. A localização do mapa do site é indicada para melhor indexação.

Assim, consideramos um exemplo geral de uma configuração pronta, na qual alguns arquivos e caminhos confidenciais ficam ocultos da indexação, mas os diretórios principais ficam acessíveis.

Ao contrário de muitos sistemas de gerenciamento de conteúdo (CMS) populares ou sites desenvolvidos internamente, o WordPress possui diversos plugins que facilitam a criação e o gerenciamento do arquivo robots.txt. Uma das soluções mais populares para essa finalidade é o Yoast SEO.

Para instalá-lo, você precisa:

  1. Acesse o painel de administração do WordPress.
  2. Na seção "Plugins", selecione "Adicionar novo".
  3. Encontre o plugin "Yoast SEO" e instale-o.
  4. Ative o plugin.

Para editar o arquivo robots.txt, você precisa:

  1. Vá para a seção "SEO" no menu lateral do painel de administração e selecione "Geral".
  2. Vá para a aba "Ferramentas".
  3. Clique em "Arquivos". Aqui você verá vários arquivos, incluindo robots.txt.
  4. Insira as regras de indexação necessárias de acordo com suas necessidades.
  5. Depois de fazer alterações no arquivo, clique no botão "Salvar alterações em robots.txt".

Observe que cada configuração do arquivo robots.txt para WordPress é única e depende das necessidades e recursos específicos do site. Não há um modelo universal que sirva para todos os recursos sem exceção. No entanto, este exemplo e o uso de plugins podem simplificar significativamente a tarefa.

Configuração manual do Robots.txt

Da mesma forma, você pode configurar seu arquivo mesmo na ausência de um CMS pronto para o site. O usuário também precisa carregar o arquivo robots.txt para o diretório raiz do site e especificar as regras necessárias. Aqui está um dos exemplos, no qual todas as diretivas disponíveis são indicadas:

User-agent: *
Disallow: /admin/             # Prohibit access to the administrative panel
Disallow: /secret.html	      # Prohibit access to a specific file
Disallow: /*.pdf$	      # Prohibit indexing of certain file types
Disallow: /*?sort=	      # Prohibit indexing of certain URL parameters
Allow: /public/		      # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap

Como verificar o arquivo Robots.txt

Como ferramenta auxiliar na verificação de erros no arquivo robots.txt, é recomendável usar serviços online.

Considere o exemplo do serviço Yandex Webmaster . Para verificar, você precisa inserir um link para o seu site no campo correspondente, caso o arquivo já tenha sido carregado no servidor. Depois disso, a própria ferramenta carregará o arquivo de configuração. Há também a opção de inserir a configuração manualmente.

Configuração do Robots.txt

Em seguida, você precisa solicitar um cheque e aguardar os resultados:

Resultado da configuração do Robots.txt

No exemplo dado, não há erros. Se houver, o serviço mostrará as áreas problemáticas e maneiras de corrigi-las.

Conclusão

Em resumo, enfatizamos o quão importante o arquivo robots.txt é para controlar o tráfego no site. Fornecemos conselhos sobre como configurá-lo corretamente para gerenciar como os mecanismos de busca indexam páginas. Além disso, também analisamos exemplos de como usar corretamente esse arquivo e demos instruções sobre como verificar se todas as configurações estão funcionando corretamente.

❮ Artigo anterior Como se conectar a um servidor Linux via SSH
Próximo artigo ❯ Como configurar um servidor web (Apache-PHP-MySQL/MariaDB) no Linux

Pergunte-nos sobre VPS

Estamos sempre prontos para responder suas perguntas a qualquer hora do dia ou da noite.