Como extrair dados de centenas de PDFs?

Você define os campos exatos, guarda cada PDF com um nome estável, extrai o texto (com OCR só nas páginas escaneadas) e leva cada campo para uma tabela. Antes de carregar qualquer coisa, confere cada valor com o documento de onde ele saiu. É a conferência que torna a tabela confiável; extrair é a metade fácil.

A maioria dos projetos erra na entrada, não na leitura: um arquivo salvo com o nome errado, um documento do ano errado, uma digitalização ilegível ou um campo vazio que alguém preencheu com um palpite.

Atualizado em 28 de set. de 2026

Como funciona

  1. Escrever a lista de campos primeiro

    Dê nome a cada campo, diga o formato e onde ele aparece no documento. Se ninguém consegue apontar o campo numa amostra real, ele fica fora da primeira versão.

  2. Coletar e nomear os arquivos

    Salve cada PDF com uma chave estável, como o CPF ou CNPJ, o número do contrato ou o código do imóvel, mais o ano ou o mês. É pelo nome que a próxima rodada sabe o que já tem e o que é novo.

  3. Extrair o texto e os campos

    PDFs gerados por sistema já trazem o texto; páginas escaneadas precisam de OCR. Depois, um leitor de formulários e tabelas, ou um modelo de linguagem com a lista de campos, leva o texto para as colunas certas.

  4. Conferir cada valor com a fonte

    Confirme que o documento é mesmo o que diz ser, guarde a página de origem e deixe vazio, e marcado, o valor que não existe. O que estiver incerto vai para uma pessoa revisar.

  5. Carregar com uma simulação antes

    Mostre o que mudaria antes de gravar: linhas novas, lacunas preenchidas e qualquer valor que substituiria outro. Depois grave e guarde os arquivos de antes e depois.

Quanto custa manter

OCR e leitores de documentos são cobrados por página. A lista traz preços de tabela do Google e da Amazon lidos hoje; o modelo de linguagem, o armazenamento e a ferramenta que roda as etapas são cobrados à parte por cada fornecedor.

ItemPreço de tabelaFonte
Google Document AI, Enterprise Document OCRAs primeiras 1.000 páginas aparecem como gratuitas; depois, US$ 1,50 por 1.000 páginas, até 5 milhões de páginasGoogle Cloud, Document AI pricingConsultado em 28 de set. de 2026
Google Document AI, Form Parser (campos e tabelas)US$ 30 por 1.000 páginas, até 1 milhão de páginas (no exemplo do próprio Google, 100 páginas custam US$ 3)Google Cloud, Document AI pricingConsultado em 28 de set. de 2026
Amazon Textract, Detect Document Text (OCR)US$ 0,0015 por página no primeiro milhão de páginas (região US West, Oregon)Amazon Web Services, Amazon Textract pricingConsultado em 28 de set. de 2026
Amazon Textract, Analyze Document com tabelasUS$ 0,015 por página no primeiro milhão de páginas (região US West, Oregon)Amazon Web Services, Amazon Textract pricingConsultado em 28 de set. de 2026
Nível gratuito do Amazon Textract (novos clientes da AWS, três primeiros meses)1.000 páginas por mês no Detect Document Text; 100 páginas por mês com Forms, Tables e LayoutAmazon Web Services, Amazon Textract pricingConsultado em 28 de set. de 2026

Preços de tabela de terceiros, consultados na data indicada. Não são preços da Betterlane.

O que aprendemos montando

Da base de faculdades do produto próprio da Betterlane, montada a partir dos PDFs públicos do Common Data Set que as faculdades americanas publicam. Não é um sistema de cliente.

Salvar cada arquivo com um código e um ano
Cada PDF foi guardado com o código da faculdade mais o ano. Depois, a base foi cruzada com os dados federais do IPEDS e do College Scorecard pelo código federal de cada faculdade.
Conferir o nome dentro do arquivo antes de carregar
Cada documento precisa citar a faculdade com que foi arquivado. A conferência pegou arquivos salvos para a faculdade errada (Bard arquivado como Barnard, WPI como Whitman). O que não deu para confirmar ficou de fora.
Vazio continua vazio
Um valor que não está no PDF fica em branco e marcado como não encontrado. Nada é chutado para a tabela parecer completa.
Simular primeiro e preencher lacunas, sem sobrescrever
Todo script de gravação roda em simulação por padrão e salva os arquivos de antes e depois. Dado novo preenche campo vazio; não substitui o que já existe.
Dizer até onde vai a cobertura
A base tem 1.959 faculdades, e os fatores de admissão estão no ar para 314 delas. Um campo que não se sustentou, o de médias (GPA), foi retirado do produto em vez de exibido.

Quando não vale a pena

  • Se chegam poucos documentos por mês, digitar os campos à mão sai mais barato e é mais fácil de confiar.
  • Se cada documento tem um formato diferente e os campos não aparecem em lugar nenhum de forma regular, comece combinando o que os documentos precisam trazer.
  • Se os números alimentam um pagamento ou uma decisão jurídica, a extração pode prepará-los, mas uma pessoa ainda precisa aprovar cada um.

Perguntas

Preciso de OCR em todo PDF?

Não. Um PDF gerado por sistema já contém o texto. O OCR é para páginas escaneadas e fotos, e é de onde vem a maior parte dos erros de leitura.

Um modelo de linguagem pode fazer a extração?

Ele ajuda a levar texto bagunçado para os campos certos, mas não deve ser aceito sem conferência. Guarde a página de origem, confira cada valor e mande os incertos para uma pessoa.

E quando falta um valor?

Ele fica vazio e marcado como não encontrado. Preencher com um valor provável deixa a tabela inteira menos confiável.

Para onde vai o resultado?

Normalmente para uma planilha ou para o sistema que usa os dados, com uma coluna apontando para o arquivo e a página de origem.

Tem uma pilha de documentos que precisa virar uma tabela conferida?

Ver o serviço: Processamento de documentosFale com a gente

Todos os guias