Neste artigo, examinaremos o papel fundamental do arquivo robots.txt no gerenciamento de tráfego em sites, discutiremos a necessidade de sua presença e forneceremos recomendações para configurá-lo para um gerenciamento eficaz de indexação de páginas. Além disso, analisaremos exemplos de uso correto de diretivas no arquivo robots.txt e forneceremos um guia sobre como verificar a exatidão de suas configurações.
Por que Robots.txt é necessário
Robots.txt é um arquivo localizado no servidor do site em seu diretório raiz. Ele informa aos robôs do mecanismo de busca como eles devem escanear o conteúdo do recurso. O uso adequado deste arquivo ajuda a evitar a indexação de páginas indesejadas, protege dados confidenciais e pode melhorar a eficiência da otimização de SEO e a visibilidade do site nos resultados de busca. A configuração do robots.txt é feita por meio de diretivas, que veremos mais adiante.
Definindo diretivas em Robots.txt
User-Agent
A diretiva primária é conhecida como User-Agent, onde definimos uma palavra-chave especial para robôs. Ao detectar essa palavra, o robô entende que a regra é destinada especificamente a ele.
Considere um exemplo de uso do User-Agent no arquivo robots.txt:
User-Agent: *
Disallow: /private/
Este exemplo indica que todos os robôs de busca (representados pelo símbolo "*") deve ignorar páginas localizadas no /privado/ diretório.
Veja como a instrução aparece para robôs de busca específicos:
User-Agent: Googlebot
Disallow: /admin/
User-Agent: Bingbot
Disallow: /private/
Neste caso, o Googlebot o robô de busca deve ignorar páginas no /administrador/ diretório, enquanto Bingbot deve ignorar páginas no /privado/ diretório.
desaprovar
desaprovar informa aos robôs de busca quais URLs pular ou não indexar no site. Esta diretiva é útil quando você quer ocultar dados sensíveis ou páginas de conteúdo de baixa qualidade de serem indexadas por mecanismos de busca. Se o arquivo robots.txt contiver a entrada Não permitir: /diretórios/, então os robôs terão o acesso negado ao conteúdo do diretório especificado. Por exemplo,
User-agent: *
Disallow: /admin/
Este valor indica que todos os robôs deve ignorar URLs que começam com /administrador/. Para bloquear a indexação de todo o site por qualquer robô, defina o diretório raiz como uma regra:
User-agent: *
Disallow: /
Permitir
O valor "Permitir" age de forma oposta a "Não permitir": ele permite que robôs de busca acessem uma página ou diretório específico, mesmo que outras diretivas no arquivo robots.txt proíbam o acesso a ele.
Considere um exemplo:
User-agent: *
Disallow: /admin/
Allow: /admin/login.html
Neste exemplo, é especificado que robôs não têm permissão para acessar o /administrador/ diretório, exceto para o /admin/login.html página, que está disponível para indexação e digitalização.
Robots.txt e Mapa do Site
Sitemap é um arquivo XML que contém uma lista de URLs de todas as páginas e arquivos no site que podem ser indexados por mecanismos de busca. Quando um robô de busca acessa o arquivo robots.txt e vê um link para um arquivo XML de sitemap, ele pode usar esse arquivo para encontrar todos os URLs e recursos disponíveis no site. A diretiva é especificada no formato:
Sitemap: https://yoursite.com/filesitemap.xml
Essa regra geralmente é colocada no final do documento sem estar vinculada a um User-Agent específico e é processada por todos os robôs sem exceção. Se o proprietário do site não usar sitemap.xml, não é necessário adicionar a regra.
Exemplos de Robots.txt configurados
Configurando Robots.txt para WordPress
Nesta seção, consideraremos uma configuração pronta para WordPress. Exploraremos o bloqueio de acesso a dados confidenciais e a permissão de acesso às páginas principais.
Como solução pronta, você pode usar o seguinte código:
User-agent: *
# Block access to files containing confidential data
Disallow: /cgi-bin
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/plugins/
Disallow: /wp-content/themes/
Disallow: /wp-login.php
Disallow: /wp-register.php
Disallow: /xmlrpc.php
# Allow access to the main site pages
Allow: /wp-content/uploads/
Allow: /sitemap.xml
Allow: /feed/
Allow: /trackback/
Allow: /comments/feed/
Allow: /category/*/*
Allow: /tag/*
# Prohibit the indexing of old versions of posts and parameterized queries to avoid content duplication or suboptimal indexing.
Disallow: /*?*
Disallow: /?s=*
Disallow: /?p=*
Disallow: /?page_id=*
Disallow: /?cat=*
Disallow: /?tag=*
# Include the sitemap (location needs to be replaced with your own)
Sitemap: http://yourdomain.com/sitemap.xml
Embora todas as diretivas sejam acompanhadas de comentários, vamos nos aprofundar nas conclusões.
- Os robôs não indexarão arquivos e diretórios confidenciais.
- Ao mesmo tempo, robôs têm permissão para acessar as páginas principais e os recursos do site.
- é proibida a indexação de versões antigas de postagens e consultas parametrizadas para evitar duplicação de conteúdo.
- A localização do mapa do site é indicada para melhor indexação.
Assim, consideramos um exemplo geral de uma configuração pronta, na qual alguns arquivos e caminhos confidenciais ficam ocultos da indexação, mas os diretórios principais ficam acessíveis.
Ao contrário de muitos CMS populares ou sites personalizados, o WordPress tem vários plugins que facilitam a criação e o gerenciamento do arquivo robots.txt. Uma das soluções populares para esse propósito é Yoast SEO.
Para instalá-lo, você precisa:
- Acesse o painel de administração do WordPress.
- Na seção "Plugins", selecione "Adicionar novo".
- Encontre o plugin "Yoast SEO" e instale-o.
- Ative o plugin.
Para editar o arquivo robots.txt, você precisa:
- Vá para a seção "SEO" no menu lateral do painel de administração e selecione "Geral".
- Vá para a aba "Ferramentas".
- Clique em "Arquivos". Aqui você verá vários arquivos, incluindo robots.txt.
- Insira as regras de indexação necessárias de acordo com suas necessidades.
- Depois de fazer alterações no arquivo, clique no botão "Salvar alterações em robots.txt".
Observe que cada configuração do arquivo robots.txt para WordPress é única e depende das necessidades e recursos específicos do site. Não há um modelo universal que sirva para todos os recursos sem exceção. No entanto, este exemplo e o uso de plugins podem simplificar significativamente a tarefa.
Configuração manual do Robots.txt
Da mesma forma, você pode configurar seu arquivo mesmo na ausência de um CMS pronto para o site. O usuário também precisa carregar o arquivo robots.txt para o diretório raiz do site e especificar as regras necessárias. Aqui está um dos exemplos, no qual todas as diretivas disponíveis são indicadas:
User-agent: *
Disallow: /admin/ # Prohibit access to the administrative panel
Disallow: /secret.html # Prohibit access to a specific file
Disallow: /*.pdf$ # Prohibit indexing of certain file types
Disallow: /*?sort= # Prohibit indexing of certain URL parameters
Allow: /public/ # Allow access to public pages
Sitemap: http://yourdomain.com/sitemap.xml # Include the sitemap
Como verificar o arquivo Robots.txt
Como ferramenta auxiliar na verificação de erros no arquivo robots.txt, é recomendável usar serviços online.
Considere o exemplo do Webmaster do Yandex serviço. Para verificar, você precisa inserir um link para seu site no campo correspondente se o arquivo já estiver carregado no servidor. Depois disso, a própria ferramenta carregará a configuração do arquivo. Também há uma opção para inserir a configuração manualmente:
Em seguida, você precisa solicitar um cheque e aguardar os resultados:
No exemplo dado, não há erros. Se houver, o serviço mostrará as áreas problemáticas e maneiras de corrigi-las.
Conclusão
Em resumo, enfatizamos o quão importante o arquivo robots.txt é para controlar o tráfego no site. Fornecemos conselhos sobre como configurá-lo corretamente para gerenciar como os mecanismos de busca indexam páginas. Além disso, também analisamos exemplos de como usar corretamente esse arquivo e demos instruções sobre como verificar se todas as configurações estão funcionando corretamente.