01A Resposta Direta
A IA consegue ler o catálogo em PDF do meu site?
Resposta Direta
Ela consegue encontrar. Se consegue extrair uma resposta utilizável depende de como o PDF foi montado, não do fato de ser um PDF.
Segundo o Google Search Central, o Google indexa PDF (Adobe Portable Document Format) ao lado de Word, Excel, PowerPoint, HTML, XML e CSV. Isso resolve a pergunta sobre indexação. O que não resolve é a qualidade da extração: um PDF feito de imagem escaneada, com tabela de especificação colada como figura, não dá a um rastreador ou a um modelo de linguagem nada para interpretar, mesmo com o arquivo indexado.
02O Google Indexa PDF
Retire o argumento errado antes de fazer o certo
"O Google não lê PDF" é uma afirmação que circula no marketing industrial e não é verdadeira. Google Search Central lista PDF explicitamente entre os tipos de arquivo indexáveis. Fazer o argumento errado — de que o formato em si é invisível — leva à correção errada, geralmente uma reconstrução cara e completa do catálogo em páginas HTML, quando a correção real costuma ser mais barata: refazer o mesmo PDF com texto e tabela de verdade em vez de imagem escaneada.
Mantenha o argumento preciso: o formato não é a barreira. A barreira é o que impede uma máquina de extrair texto e estrutura do arquivo, e essa barreira pode existir dentro de um PDF, dentro de uma página HTML ou dentro de qualquer formato.
03O Problema Real
Estrutura e extração, não visibilidade
O Que Conferir no Seu Próprio Catálogo
1. Dá para selecionar o texto?
Abra o PDF e tente selecionar uma frase. Se nada fica destacado, a página é imagem, não texto.
→
2. A especificação é uma tabela de verdade?
Tente copiar uma linha de números para uma planilha. Se colar como um bloco só em vez de células separadas, é a figura de uma tabela.
→
3. O título se comporta como título?
Texto em negrito e maior que não carrega marcação semântica é lido por uma máquina como parágrafo, não como quebra de seção.
Essas três verificações levam menos de cinco minutos e costumam explicar mais do que trocar de formato jamais explicaria.
04Nem Todo PDF É Igual
PDF nativo e PDF escaneado são arquivos diferentes
PDF nativo
Exportado de um documento, texto e tabela de verdade
Texto selecionável, tabela estruturada, às vezes título marcado. A qualidade de extração pode chegar perto da de uma página HTML bem montada.
PDF escaneado
Uma fotografia ou digitalização de uma página impressa
Uma imagem salva com extensão .pdf. Indexável como arquivo, ilegível como texto, a menos que tenha passado por reconhecimento óptico de caracteres e o resultado tenha sido incorporado.
A maioria dos catálogos de indústria acumula os dois tipos ao longo dos anos, e a primeira tarefa útil é simplesmente separar qual ficha técnica é qual. Essa separação decide onde gastar esforço primeiro.
05O Que Fazer com o Catálogo
Corrija os piores casos, depois decida o formato
Comece reexportando as fichas técnicas escaneadas como PDF nativo, com texto e tabela de verdade — uma correção que mexe no arquivo, não na plataforma onde ele mora. Corrigidos os piores casos, a pergunta separada sobre publicar a especificação em HTML em vez de PDF merece resposta própria.
Veja essa comparação em ficha técnica em HTML ou em PDF, ou leia um passo a passo completo de como montar um catálogo que converte em como criar um catálogo técnico que vende, ou o guia de catálogo técnico.
06FAQ
FAQ
A IA consegue ler o catálogo em PDF do meu site? +
Ela consegue encontrar, segundo o Google Search Central, que lista PDF entre os tipos de arquivo indexáveis junto com Word, Excel, PowerPoint, HTML, XML e CSV. Se consegue extrair uma resposta utilizável depende de o PDF ter texto de verdade, selecionável, e tabela estruturada, não do formato em si.
É verdade que o Google não lê PDF? +
Não. Segundo o Google Search Central, PDF é listado explicitamente como um tipo de arquivo indexável. O que limita a extração não é o formato, mas se o arquivo específico tem imagem escaneada em vez de texto de verdade, ou tabela montada como figura em vez de linha e coluna.
Como sei se a minha ficha técnica é uma imagem escaneada? +
Abra o arquivo e tente selecionar uma linha de texto com o cursor. Se nada fica destacado e você não consegue copiar, a página é uma imagem salva como PDF, não texto de verdade que uma máquina consegue ler.
Devo rodar OCR nos catálogos escaneados antigos? +
É uma opção, e melhor do que deixar a página ilegível, mas reconhecimento óptico de caracteres numa digitalização de baixa qualidade costuma introduzir erro em número e unidade. Para uma tabela de especificação, redigitar os valores direto do documento de origem costuma ser mais seguro do que confiar no OCR num número técnico.
Uma tabela de especificação exportada como imagem é um problema? +
Sim. Uma tabela salva como figura não pode ser interpretada em linha e coluna por um rastreador ou um modelo de linguagem, mesmo dentro de um PDF bem montado de resto. A correção é refazer a tabela como conteúdo estruturado de verdade no arquivo de origem antes de exportar de novo.
Preciso reconstruir o catálogo inteiro em HTML? +
Nem sempre, e nem sempre primeiro. Corrigir imagem escaneada para PDF nativo com texto de verdade costuma ser mais barato e mais rápido do que reconstruir tudo em HTML, e já resolve a maior parte do problema de extração. Se vale a pena HTML para as fichas técnicas de maior tráfego é uma decisão separada.
O nome do arquivo ou a URL do PDF importam? +
Um nome de arquivo descritivo e uma URL estável e linkável ajudam um rastreador e uma pessoa a encontrar o arquivo, mas não corrigem um problema de extração dentro do documento. Vale a pena cuidar do nome, e isso não substitui ter texto de verdade dentro do PDF.
Por onde devo começar a corrigir o meu catálogo? +
Comece pelas três verificações: dá para selecionar o texto, a tabela copia em célula separada e o título carrega marcação de verdade. Corrija primeiro as fichas técnicas que falham nas três, porque essas são as que uma máquina hoje não consegue ler de jeito nenhum.
Descubra quais fichas técnicas uma máquina não consegue ler
O diagnóstico confere o catálogo arquivo por arquivo: texto selecionável, tabela de verdade e título estruturado.