Citado pela IA   Citado pela IA
ED 003

Três linhas do robots.txt decidem se a IA cita você

GPTBot, OAI-SearchBot e PerplexityBot passam ou batem na porta fechada, e conferir o arquivo leva dez minutos de trabalho.

Arquivo de texto simples impresso sobre mesa escura, régua metálica e lupa ao lado, sem pessoas

O arquivo de quatro linhas que ninguém abre

▼
 

Uma clínica de estética em São Paulo pagou nove meses de produção de conteúdo para aparecer nas respostas de IA. Trinta e dois artigos, revisão técnica de médico, tabela de preço por procedimento, tudo publicado no prazo. O nome da clínica não apareceu em resposta nenhuma.

A explicação estava num arquivo de texto de quatro linhas, na raiz do domínio, que ninguém abria desde a migração do site. Duas dessas linhas mandavam os rastreadores da OpenAI e da Perplexity embora antes de eles lerem a primeira palavra do primeiro artigo.

O robots.txt é a primeira coisa que qualquer rastreador educado pede ao chegar no seu domínio. Ele não é senha nem cadeado, é um aviso na porta, e os rastreadores das grandes empresas de IA respeitam o aviso porque o custo de ignorar virou processo judicial.

Até 2023 o arquivo tratava de um assunto só: buscador. Regra para Googlebot, regra para Bingbot. Depois disso, cada empresa de IA batizou o próprio agente, e o mesmo arquivo antigo virou o porteiro de um tráfego que não existia quando ele foi escrito.

Bloqueio de robô de IA quase nunca é decisão consciente de empresa brasileira. Ele chega de carona: plugin de segurança do WordPress com preset agressivo, template de agência que copiou um tutorial de 2023, desenvolvedor que fechou o site inteiro durante a homologação e esqueceu de reabrir depois do lançamento.

Existe ainda o caso do bloqueio deliberado que envelheceu mal. Muita empresa fechou a porta para não alimentar treinamento de modelo, decisão legítima na época, sem perceber que o mesmo veto derrubou a busca e a citação, que são serviços diferentes com robôs diferentes.

O custo de conferir é ridículo perto do custo de errar. Uma URL no navegador, dez minutos de leitura, uma linha corrigida no arquivo. Feito antes de aprovar orçamento de conteúdo, o teste evita pagar por texto que nenhum motor vai ler.

Antes de tocar no arquivo, porém, vale saber quem está batendo na porta. São robôs com nomes parecidos e funções bem diferentes, e liberar o errado não resolve nada.

Continue lendo ↓

 
 

I  Sinal da Semana

Três robôs com três funções diferentes

Veja quem coleta para treinar, quem monta o índice que gera citação e quem só aparece quando o usuário pede.

Nome parecido, trabalho diferente: liberar o robô errado deixa o site fora da citação do mesmo jeito. A confusão mais cara do momento é tratar treinamento de modelo e busca ao vivo como se fossem a mesma porta.

O GPTBot é o rastreador que a OpenAI usa para coletar conteúdo público em larga escala, o material que alimenta o treinamento dos modelos. Ele passeia pelo site sem que ninguém tenha perguntado nada, no ritmo dele, e é o nome que aparece na maioria dos tutoriais de bloqueio escritos entre 2023 e 2024.

O OAI-SearchBot faz outra coisa. Ele monta e mantém o índice de busca que o ChatGPT consulta quando responde com fontes, o índice de onde saem os links citados no rodapé da resposta. Bloquear o OAI-SearchBot é abrir mão da citação, não do treinamento.

Fechar a porta para o treinamento é uma decisão. Fechar junto a porta da busca é um acidente, e o acidente custa toda a citação.

O ChatGPT-User é o terceiro, e ele só aparece quando um usuário pede. Alguém digita o seu endereço ou pede para o modelo abrir uma página específica, e o robô busca aquela página naquele instante. Site que bloqueia esse agente devolve erro justamente para quem já estava procurando por ele.

Do lado da Perplexity a divisão é a mesma, com dois nomes: o PerplexityBot indexa, e o Perplexity-User busca a página que a pessoa pediu na conversa. A documentação das duas empresas publica esses nomes abertamente, com faixas de endereço para conferência.

O que o Google-Extended faz

O Google-Extended não é um rastreador. É um controle de uso: ele diz se o conteúdo que o Googlebot já coletou pode ou não alimentar os produtos generativos do Google. O Googlebot continua rastreando o site do mesmo jeito, e a busca clássica não muda.

Quem bloqueia o Google-Extended costuma achar que fechou a porta para o Gemini. Fechou uma porta parcial, e continua exposto na busca tradicional, o que raramente é a intenção de quem escreveu a regra.

O Bingbot acumula dois papéis: serve o buscador da Microsoft e alimenta parte do que o Copilot devolve. Bloqueio herdado de briga antiga tira o site de duas superfícies de uma vez.

"O Protocolo de Exclusão de Robôs permite que os donos de um serviço controlem como o conteúdo servido por ele pode ser acessado, se é que pode, por clientes automáticos conhecidos como rastreadores."

Martijn Koster, RFC 9309: Robots Exclusion Protocol, 2022

O texto do padrão deixa a natureza do arquivo explícita. Ele controla acesso de cliente automático, não protege informação: qualquer robô mal-educado ignora o aviso e entra. Fechar a porta para os robôs que respeitam a regra é punir exatamente os que citam a fonte.

A leitura prática cabe em uma frase. Regra ampla demais no robots.txt não protege nada e custa presença, e regra específica demais escrita há três anos já não cobre os agentes que existem hoje.

 
 

II  Case Brasileiro

Duas linhas herdadas de um plugin antigo

Duas linhas, escritas por um plugin que ninguém consultou, apagaram a empresa de três motores.

Uma fabricante de embalagens plásticas em Joinville vende para indústria de alimentos e mantém um site com catálogo, fichas técnicas e um blog de manutenção de linha de produção. Trinta e oito páginas no ar, atualizadas com regularidade desde 2021.

O marketing rodou uma checagem simples em quarenta consultas típicas de comprador industrial. Espessura de filme para embalagem a vácuo, prazo de entrega para pedido fechado, exigência de laudo para contato com alimento. O domínio da fabricante não apareceu em nenhuma delas.

A primeira suspeita foi conteúdo fraco, e a segunda foi concorrente melhor posicionado. Nenhuma das duas se sustentou: as fichas técnicas eram mais completas que as dos dois portais que apareciam sempre, e um dos concorrentes citados nem produzia o item.

O desenvolvedor terceirizado abriu o robots.txt na frente da diretoria. O arquivo tinha onze linhas, e quatro delas tinham sido escritas por um plugin de segurança instalado em 2023, no pacote de proteção contra raspagem de conteúdo que a agência anterior contratou.

As linhas bloqueavam GPTBot e uma lista genérica de agentes que incluía o PerplexityBot. Havia ainda um veto ao diretório do blog, sobra de uma homologação de 2022, que nunca foi removido porque o Googlebot tinha outra regra mais permissiva logo abaixo e a busca continuou funcionando.

O ajuste tomou vinte minutos e uma reunião de meia hora. A diretoria decidiu liberar os agentes de busca e citação, manter o bloqueio do GPTBot de treinamento por decisão jurídica, e abrir o diretório do blog para todo mundo.

Uma linha extra entrou no arquivo, apontando o sitemap para os robôs recém-liberados. O deploy subiu numa quinta-feira, sem nenhuma outra alteração no site, para que a medição seguinte tivesse uma causa só.

A primeira leitura veio dez dias depois, e ainda era fraca: o domínio apareceu em três das quarenta consultas, todas no Perplexity, que reindexa mais rápido. O ChatGPT continuou sem citar a empresa, o que assustou a diretoria e não deveria.

Índice de motor generativo não é instantâneo. O rastreador precisa voltar, ler as páginas liberadas, processar e só então incluir o domínio no conjunto que a busca consulta, e o intervalo entre a liberação e a primeira citação costuma ser contado em semanas.

Na leitura de quarenta dias o número era doze em quarenta, com aparições nos três motores e a maioria vinda das fichas técnicas, não do blog. As fichas ganharam porque respondem uma pergunta objetiva com número e unidade, formato que o motor recorta bem.

O que a diretoria levou da reunião não foi o número. Foi a ordem das coisas: nove meses de conteúdo novo teriam produzido o mesmo zero enquanto as duas linhas continuassem no arquivo.

 
 

III  Checklist da Semana

Abra o seu robots.txt em dez minutos

1. Abra o arquivo no navegador. Digite o seu domínio seguido de barra robots.txt. Ele é público em qualquer site do mundo, não precisa de senha, e o do concorrente abre do mesmo jeito se você quiser comparar.

2. Procure a palavra Disallow logo abaixo de cada User-agent. Uma barra sozinha depois de Disallow significa site inteiro fechado para aquele agente. Anote cada bloco que tenha essa combinação, sem mexer em nada ainda.

3. Confira nome por nome os cinco que importam. GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot e Perplexity-User. Bloco com asterisco no User-agent e barra no Disallow vale para todos eles de uma vez, inclusive os que você nem sabia que existiam.

4. Separe treinamento de citação antes de decidir. Se a empresa quer ficar fora do treinamento, o bloqueio é do GPTBot e do Google-Extended. Os agentes de busca e de pedido do usuário ficam liberados, ou você paga o preço de sumir sem ganhar proteção nenhuma.

5. Cace o veto herdado de homologação. Diretório de blog, pasta de produtos, subdomínio de conteúdo fechado durante um lançamento antigo. Esses vetos sobrevivem anos porque a busca do Google segue funcionando por outra regra e ninguém percebe a falta.

6. Aponte o sitemap no fim do arquivo. Uma linha com Sitemap e a URL completa do seu mapa. Custa nada e entrega ao robô recém-liberado a lista pronta do que existe para ler, em vez de deixar ele descobrir sozinho.

7. Carimbe a data e espere. Anote no arquivo, em comentário, o dia da alteração e o que mudou. Marque quarenta dias no calendário para a próxima leitura, porque reindexação de motor generativo leva semanas e cobrar resultado em três dias gera decisão errada.

Existe uma armadilha na etapa dois que derruba gente experiente. Um bloco com asterisco no User-agent e barra no Disallow, colocado no topo do arquivo, parece inofensivo perto das regras específicas escritas abaixo dele, e fecha o site para qualquer agente que não tenha bloco próprio.

Bloqueio no robots.txt também não é o único jeito de sumir. Cabeçalho HTTP com X-Robots-Tag, regra de firewall que devolve erro para agente desconhecido e proteção de CDN em modo agressivo produzem o mesmo resultado, sem deixar rastro no arquivo de texto.

Se o robots.txt estiver limpo e o domínio continuar ausente das respostas, o próximo lugar a olhar é o registro do servidor. Procure pelo nome dos agentes nos últimos trinta dias: robô que aparece e recebe erro é problema de infraestrutura, robô que nunca apareceu é problema de descoberta.

Conteúdo novo em site fechado é dinheiro gasto em texto que robô nenhum vai ler.

"O que o seu robots.txt responde hoje para o OAI-SearchBot?"

 
 
 
Recomendação de Newsletter
MBA na Mira

MBA na Mira

O parecer do dia sobre qual programa entrega mais na sua carreira, o prazo de inscrição e a letra miúda do contrato. No seu email todo dia às 20:20.

Quero receber →

Quiz da edição

Qual agente da OpenAI monta o índice de busca de onde saem as fontes citadas pelo ChatGPT?

AGPTBot
BOAI-SearchBot
CChatGPT-User
DGoogle-Extended

Defenda seu título de Vigia (3 acertos seguidos garantem o primeiro).

Veja o ranking de quem mais acerta →

 
Sua avaliação

Como foi a edição de hoje?

✨✨✨✨✨  ótima ✨✨✨✨  boa ✨✨✨  ok ✨✨  ruim ✨  péssima
 
 
 

Até a próxima atualização.

Citado pela IA

CITADO PELA IA

Seu concorrente já aparece no ChatGPT. Agora é sua vez

💬 WhatsApp·📣 Anuncie·✍️ Newsletter