|
Duas linhas escritas na mesma tarde, uma sem efeito nenhum e outra derrubando 41% do tráfego orgânico da casa.
|
Uma editora de livros técnicos de São Paulo mantinha um acervo de quatrocentos artigos de apoio aos títulos do catálogo, com trechos de capítulos, glossários e estudos de caso. A diretoria decidiu, em janeiro de 2026, que o material não deveria alimentar modelo de linguagem nenhum sem contrato.
A ordem chegou ao time técnico numa frase curta: tirar a editora da inteligência artificial do Google. O desenvolvedor abriu o robots.txt, escreveu o bloqueio do Google-Extended e, por precaução, acrescentou uma segunda regra bloqueando o diretório dos artigos para todos os agentes.
O que a diretoria queria não aconteceu. O que ninguém queria aconteceu em onze dias.
Google-Extended bloqueado: sem efeito visível em nenhum indicador
Diretório dos artigos bloqueado para todos: 400 páginas fora do índice
Tráfego orgânico dos artigos: queda de 41% em onze dias
Presença nos resumos gerados do Google: caiu junto, por consequência do índice
Uso do acervo em treino: barrado, e apenas pela primeira linha
Vendas do catálogo técnico: queda de 12% no trimestre
O quarto item foi o que abriu o caso. A presença nas respostas não caiu por causa do Google-Extended, caiu porque as páginas saíram do índice da busca, e sair do índice é uma decisão muito maior do que a diretoria tinha tomado.
O diagnóstico começou pela leitura da documentação em voz alta numa reunião de trinta minutos. Coleta e uso viraram duas colunas num quadro, e cada linha do robots.txt foi colocada numa coluna só. A segunda regra estava na coluna da coleta, onde ninguém queria estar.
Depois veio a separação do que a casa realmente queria proteger. Trecho de capítulo e estudo de caso são o produto, o glossário e os artigos de apoio são a porta de entrada. A editora manteve o bloqueio de coleta apenas nos arquivos de trecho de capítulo e devolveu o resto ao índice.
O Google-Extended ficou como estava, bloqueado. A decisão passou a ser explícita: o acervo continua elegível para ser lido e citado na busca e fora do treino dos modelos generativos, que era a intenção original da diretoria desde o primeiro dia.
Faltava um passo que quase ficou de fora. O sitemap ainda listava as quatrocentas páginas bloqueadas, mandando um sinal contrário ao do robots.txt. Foi refeito no mesmo dia, com as páginas de trecho de capítulo removidas da lista.
Trinta e quatro dias depois da correção, o tráfego orgânico dos artigos voltou a 94% do patamar anterior, e a editora aparecia de novo nas respostas geradas sobre os temas técnicos do catálogo.
O ganho não apareceu só no tráfego. A editora passou a ter uma política escrita de uma página, aprovada pelo jurídico, dizendo qual conteúdo pode ser lido, qual pode ser citado e qual não pode ser usado em treino, com o nome de cada diretiva ao lado da regra.
|