|
|
A ficha técnica que só existe dentro do PDF de oitenta páginas
O catálogo em PDF guarda a especificação inteira e nenhum trecho citável, e a mesma tabela em HTML devolve o número ao alcance do motor.
|
O catálogo que ninguém consegue citar
|
| ▼ |
| |
|
Uma indústria de equipamentos de refrigeração comercial do Paraná mantém o catálogo técnico mais completo do setor dela. São oitenta e duas páginas com curva de desempenho, faixa de temperatura por modelo, consumo em regime contínuo, dimensão de instalação, tipo de gás, pressão de trabalho, tolerância de ruído. Cada número foi medido em bancada própria, não copiado de fornecedor.
O catálogo inteiro vive dentro de um único arquivo PDF, disponível para download num botão da página inicial. O arquivo pesa vinte e dois megabytes e tem a diagramação bonita que a agência entregou em 2021, com fundo colorido, tabela em imagem vetorial e coluna dupla.
Quem procura a especificação de um evaporador dessa marca não encontra número nenhum numa página de internet. Encontra um botão de download. Depois do download, encontra a página quarenta e sete de um arquivo que precisa ser aberto, rolado e lido inteiro para achar a linha que importa.
Um comprador com pressa faz esse percurso. Um sistema que precisa devolver uma resposta curta com fonte não faz. Ele visita a página, encontra um botão, não encontra frase alguma que responda a pergunta, e segue para o próximo resultado, que é o distribuidor que digitou as mesmas informações numa tabela simples de HTML.
O distribuidor não mediu nada. Ele copiou a informação do catálogo do fabricante e publicou em texto. Hoje é ele que aparece citado como fonte da especificação que a fábrica levantou em bancada, com margem de revenda embutida no orçamento que sai daquela visita.
O problema tem nome técnico e cara de detalhe de infraestrutura, mas ele decide quem é citado num setor inteiro. Informação que exige download antes de ser lida não circula em resposta gerada, porque a resposta gerada é montada com trechos que já estavam disponíveis em texto na hora da leitura.
O que segue é a mecânica exata do que acontece quando um dado técnico fica preso dentro de um arquivo, e por que republicar a mesma tabela em HTML na página do produto costuma ser o trabalho de maior retorno por hora que uma indústria pode fazer no site dela.
Continue lendo ↓
|
|
|
|
I Sinal da Semana
O número que precisa de download para existir
|
|
O dado está publicado. Ele só não está legível.
Um PDF não é invisível para os motores, ele é caro de ler: o arquivo é baixado, convertido, e o texto que sai da conversão perde a estrutura de tabela que dava sentido ao número. A diferença entre difícil e impossível parece pequena numa reunião de marketing, e ela é a diferença inteira entre aparecer e não aparecer.
Vale abrir a caixa. Uma página de internet chega ao sistema de leitura já em texto marcado, com título, parágrafo, célula de tabela e cabeçalho de coluna declarados. O trecho vem com fronteira e com contexto: quem lê sabe que o número 3,4 está na linha do modelo tal e na coluna de consumo em quilowatt.
Um PDF chega como um pacote de instruções de desenho. Ele descreve onde pintar cada caractere na folha, em que fonte e em que coordenada. A tabela que o olho humano enxerga não existe como tabela dentro do arquivo, ela é um conjunto de traços e de textos posicionados por acaso feliz de layout.
Converter isso de volta em dado exige inferência: agrupar caracteres próximos em palavras, palavras em células, células em linhas, linhas em uma tabela. A conversão erra em coluna dupla, erra em célula mesclada, erra em número com unidade colada, e erra sempre que a tabela virou imagem vetorial no fechamento do arquivo.
|
"O texto extraído de um PDF frequentemente perde a estrutura lógica do documento, porque o formato descreve a aparência da página e não o significado do conteúdo."
Leonard Rosenthol, Developing with PDF, O'Reilly Media, 2013
|
O custo de leitura decide a citação
Entre dois dados equivalentes, o sistema usa o que já estava em texto. Ninguém paga conversão para citar quem tornou a leitura difícil.
Onde a perda acontece na prática
O caso mais comum é a tabela salva como imagem. Nessa hipótese não existe texto nenhum para extrair, e o número simplesmente não está no arquivo do ponto de vista de qualquer leitor automático.
O segundo caso é a coluna dupla. O extrator lê a folha em faixas horizontais e costura a última palavra da coluna da esquerda com a primeira palavra da coluna da direita, produzindo frases que nunca foram escritas e números atribuídos ao modelo errado.
O terceiro é o catálogo grande demais. Oitenta páginas num arquivo só significam que a especificação do modelo A e a do modelo B moram no mesmo endereço de internet. Não existe página específica para apontar, não existe título de página que corresponda ao modelo, não existe trecho recortável com fronteira. Uma resposta que precisa citar fonte quer um endereço que abra exatamente no dado.
O caminho de saída não é abandonar o PDF, que segue útil para quem imprime e para quem compra. É deixar de tratá-lo como a única casa do dado.
|
|
|
|
|
II Case Brasileiro
A fábrica de válvulas que republicou a tabela em HTML
|
|
Cento e quarenta modelos presos em três catálogos PDF, dezoito dias de trabalho para publicar as tabelas em páginas próprias, e a primeira citação de assistente para uma especificação de vazão vinte e seis dias depois.
|
Uma fábrica de válvulas industriais de Caxias do Sul vende para saneamento, indústria química e construção pesada. O portfólio tem cento e quarenta modelos, e cada um carrega vazão nominal, faixa de pressão, material do corpo, tipo de conexão, torque de acionamento e norma atendida.
Toda essa informação existia, bem levantada, dentro de três catálogos em PDF organizados por linha de produto. O site tinha uma página por família de produto, com foto, texto de venda de dois parágrafos e um botão para baixar o catálogo da família.
O time comercial notou o sintoma antes do time de marketing. Compradores começaram a chegar em reunião citando especificação de concorrente com precisão de tabela, e a perguntar por que a fábrica não tinha aquele dado publicado. A informação estava publicada, só que dentro de um arquivo que ninguém abriu.
O levantamento interno ficou assim.
Modelos no portfólio: 140
Modelos com especificação em página de internet: 0
Especificações disponíveis apenas em PDF: 140
Perguntas técnicas testadas em assistentes: 15
Perguntas em que a fábrica aparecia como fonte: 1
A decisão foi publicar a tabela de cada modelo como conteúdo de página, mantendo o PDF onde estava. Nada de refazer o site, nada de trocar plataforma, nada de esperar orçamento de agência.
O trabalho real foi de extração e conferência. Um estagiário de engenharia transcreveu as tabelas do PDF para uma planilha, e um projetista conferiu linha a linha contra o desenho técnico de origem, porque transcrição de número sem conferência cria erro pior que ausência de dado. Onze divergências apareceram nessa conferência, todas herdadas de uma revisão de catálogo mal fechada em 2022.
A planilha virou página por um gerador simples: uma página por modelo, com o código do produto no título, a tabela em HTML de verdade, uma frase de resposta direta antes da tabela, e o botão de download do catálogo completo no rodapé da página.
A frase antes da tabela foi o detalhe que o time só entendeu depois. Tabela sozinha responde a quem já sabe o que procura. A frase escrita em linguagem de pergunta, dizendo que aquele modelo opera em determinada faixa de pressão com determinada vazão nominal, é o trecho que um sistema recorta e cita.
Dezoito dias de trabalho, cento e quarenta páginas publicadas. Vinte e seis dias depois da publicação, uma pergunta sobre vazão nominal para uma bitola específica passou a citar a fábrica com link para a página do modelo. Em mais quatro perguntas o texto da fábrica aparecia parafraseado sem crédito, o que o time registrou como sinal parcial.
|
|
|
|
|
III Checklist da Semana
Sete passos para tirar a especificação do PDF
|
|
1. Liste onde o dado técnico mora hoje. Abra o site e conte quantos produtos têm especificação em página de internet e quantos têm só botão de download. Número de produtos sem página própria é o tamanho real do problema.
2. Teste dez perguntas técnicas do seu setor em assistentes. Pergunte por faixa de pressão, potência, dimensão, norma atendida, como um comprador perguntaria. Anote quem é citado hoje. Distribuidor citado no lugar do fabricante é o padrão, não a exceção.
3. Comece pelos vinte produtos que mais vendem. Publicar cento e quarenta páginas de uma vez trava o projeto em revisão eterna. Vinte páginas publicadas valem mais que cento e quarenta em planilha esperando aprovação.
4. Transcreva a tabela e confira contra o desenho de origem. Transcrição sem conferência publica erro com autoridade de fabricante. Divergência entre catálogo e desenho técnico aparece nessa hora, e ela já estava lá antes de você começar.
5. Publique a tabela em HTML de verdade, nunca como imagem. Captura de tela da tabela do PDF reproduz exatamente o problema que você está resolvendo, agora com aparência de solução. Célula de tabela precisa ser célula de tabela no código.
6. Escreva uma frase de resposta direta acima da tabela. Uma frase que diga, em português de comprador, o que aquele modelo faz e em que faixa. É esse trecho que vira citação, a tabela sustenta a frase.
7. Mantenha o PDF e aponte para ele no rodapé da página. Quem imprime, quem leva para obra e quem anexa em processo de compra continua precisando do arquivo. O PDF deixa de ser a porta e vira o anexo.
A primeira armadilha é publicar a página e deixá-la orfã de atualização. Revisão de produto que altera a tabela precisa alterar a página junto com o catálogo, e sem esse combinado a página vira a fonte errada mais fácil de achar do seu site.
A segunda é publicar tabela sem texto nenhum ao redor. Página que é só grade de números não responde pergunta alguma em linguagem natural, e ela some do mesmo jeito que o PDF sumia.
A terceira é achar que o trabalho é de marketing. Quem confere número é engenharia, e projeto de ficha técnica sem engenheiro na revisão publica erro em escala, com o agravante de que o erro passa a ser citável.
Especificação trancada em PDF continua sendo o ativo técnico mais caro da empresa e o menos citado, e republicar a mesma tabela em texto costuma custar dezoito dias e devolver a autoria do número a quem mediu.
"Quantos números que a sua empresa mediu estão publicados hoje em algum lugar que não exija download?"
|
|
|
|
Guia Citado pela IA · Novo
As 10 Páginas que a IA Cita
O método resposta pronta que reescreve suas páginas no formato que os motores de IA citam.
|
|
| |
|
Quiz da edição
|
|
Quantos dias depois de republicar as tabelas em HTML a fábrica de válvulas de Caxias do Sul recebeu a primeira citação de um assistente para uma especificação de vazão?
Resultado da última edição: 0% acertaram.
| | |