Como extrair dados de centenas de PDFs?
Você define os campos exatos, guarda cada PDF com um nome estável, extrai o texto (com OCR só nas páginas escaneadas) e leva cada campo para uma tabela. Antes de carregar qualquer coisa, confere cada valor com o documento de onde ele saiu. É a conferência que torna a tabela confiável; extrair é a metade fácil.
A maioria dos projetos erra na entrada, não na leitura: um arquivo salvo com o nome errado, um documento do ano errado, uma digitalização ilegível ou um campo vazio que alguém preencheu com um palpite.
Como funciona
Escrever a lista de campos primeiro
Dê nome a cada campo, diga o formato e onde ele aparece no documento. Se ninguém consegue apontar o campo numa amostra real, ele fica fora da primeira versão.
Coletar e nomear os arquivos
Salve cada PDF com uma chave estável, como o CPF ou CNPJ, o número do contrato ou o código do imóvel, mais o ano ou o mês. É pelo nome que a próxima rodada sabe o que já tem e o que é novo.
Extrair o texto e os campos
PDFs gerados por sistema já trazem o texto; páginas escaneadas precisam de OCR. Depois, um leitor de formulários e tabelas, ou um modelo de linguagem com a lista de campos, leva o texto para as colunas certas.
Conferir cada valor com a fonte
Confirme que o documento é mesmo o que diz ser, guarde a página de origem e deixe vazio, e marcado, o valor que não existe. O que estiver incerto vai para uma pessoa revisar.
Carregar com uma simulação antes
Mostre o que mudaria antes de gravar: linhas novas, lacunas preenchidas e qualquer valor que substituiria outro. Depois grave e guarde os arquivos de antes e depois.
Quanto custa manter
OCR e leitores de documentos são cobrados por página. A lista traz preços de tabela do Google e da Amazon lidos hoje; o modelo de linguagem, o armazenamento e a ferramenta que roda as etapas são cobrados à parte por cada fornecedor.
| Item | Preço de tabela | Fonte |
|---|---|---|
| Google Document AI, Enterprise Document OCR | As primeiras 1.000 páginas aparecem como gratuitas; depois, US$ 1,50 por 1.000 páginas, até 5 milhões de páginas | Google Cloud, Document AI pricingConsultado em 28 de set. de 2026 |
| Google Document AI, Form Parser (campos e tabelas) | US$ 30 por 1.000 páginas, até 1 milhão de páginas (no exemplo do próprio Google, 100 páginas custam US$ 3) | Google Cloud, Document AI pricingConsultado em 28 de set. de 2026 |
| Amazon Textract, Detect Document Text (OCR) | US$ 0,0015 por página no primeiro milhão de páginas (região US West, Oregon) | Amazon Web Services, Amazon Textract pricingConsultado em 28 de set. de 2026 |
| Amazon Textract, Analyze Document com tabelas | US$ 0,015 por página no primeiro milhão de páginas (região US West, Oregon) | Amazon Web Services, Amazon Textract pricingConsultado em 28 de set. de 2026 |
| Nível gratuito do Amazon Textract (novos clientes da AWS, três primeiros meses) | 1.000 páginas por mês no Detect Document Text; 100 páginas por mês com Forms, Tables e Layout | Amazon Web Services, Amazon Textract pricingConsultado em 28 de set. de 2026 |
Preços de tabela de terceiros, consultados na data indicada. Não são preços da Betterlane.
O que aprendemos montando
Da base de faculdades do produto próprio da Betterlane, montada a partir dos PDFs públicos do Common Data Set que as faculdades americanas publicam. Não é um sistema de cliente.
- Salvar cada arquivo com um código e um ano
- Cada PDF foi guardado com o código da faculdade mais o ano. Depois, a base foi cruzada com os dados federais do IPEDS e do College Scorecard pelo código federal de cada faculdade.
- Conferir o nome dentro do arquivo antes de carregar
- Cada documento precisa citar a faculdade com que foi arquivado. A conferência pegou arquivos salvos para a faculdade errada (Bard arquivado como Barnard, WPI como Whitman). O que não deu para confirmar ficou de fora.
- Vazio continua vazio
- Um valor que não está no PDF fica em branco e marcado como não encontrado. Nada é chutado para a tabela parecer completa.
- Simular primeiro e preencher lacunas, sem sobrescrever
- Todo script de gravação roda em simulação por padrão e salva os arquivos de antes e depois. Dado novo preenche campo vazio; não substitui o que já existe.
- Dizer até onde vai a cobertura
- A base tem 1.959 faculdades, e os fatores de admissão estão no ar para 314 delas. Um campo que não se sustentou, o de médias (GPA), foi retirado do produto em vez de exibido.
Quando não vale a pena
- Se chegam poucos documentos por mês, digitar os campos à mão sai mais barato e é mais fácil de confiar.
- Se cada documento tem um formato diferente e os campos não aparecem em lugar nenhum de forma regular, comece combinando o que os documentos precisam trazer.
- Se os números alimentam um pagamento ou uma decisão jurídica, a extração pode prepará-los, mas uma pessoa ainda precisa aprovar cada um.
Perguntas
Preciso de OCR em todo PDF?
Não. Um PDF gerado por sistema já contém o texto. O OCR é para páginas escaneadas e fotos, e é de onde vem a maior parte dos erros de leitura.
Um modelo de linguagem pode fazer a extração?
Ele ajuda a levar texto bagunçado para os campos certos, mas não deve ser aceito sem conferência. Guarde a página de origem, confira cada valor e mande os incertos para uma pessoa.
E quando falta um valor?
Ele fica vazio e marcado como não encontrado. Preencher com um valor provável deixa a tabela inteira menos confiável.
Para onde vai o resultado?
Normalmente para uma planilha ou para o sistema que usa os dados, com uma coluna apontando para o arquivo e a página de origem.
Tem uma pilha de documentos que precisa virar uma tabela conferida?
Ver o serviço: Processamento de documentosFale com a genteTodos os guias
- O que um agente de voz deve atender, e o que precisa passar para uma pessoa?
- O que um chatbot faz no site de uma pequena empresa, e quando vale a pena?
- Como conectar o WhatsApp a um assistente pela Cloud API da Meta?
- Como automatizar a caixa de suporte sem enviar uma resposta errada?
- n8n, Zapier ou Make: qual escolher para uma pequena empresa?
- Como montar um relatório que se atualiza sozinho quando os dados mudam?
- Como um assistente interno responde com os documentos da empresa sem inventar?
- Como automatizar a produção de conteúdo sem perder o controle editorial?
- Como montar uma lista de prospects com fontes, sem comprar uma?
- O que um site de pequena empresa precisa para ser encontrado pelo Google e pelo ChatGPT?
- Quando uma empresa precisa de um portal do cliente em vez de e-mail?
- Quando vale tirar um processo da planilha e levar para uma ferramenta interna?
- Por que o meu fluxo do n8n roda duas vezes para a mesma coisa?
- Meu fluxo do n8n funcionava e agora falha com 401 ou 403. Por quê?
- Como saber quando um fluxo do n8n falha em silêncio?