PDFPDF Organizer
Grátis · Sem envio · Saída em .txt simples

Extrair o texto de um PDF

Tire o texto de um documento e coloque num arquivo .txt simples que você pode pesquisar, colar ou alimentar em outro programa. Uma limitação honesta logo de cara: isto lê o texto que já existe no arquivo e não faz OCR em digitalizações.

Sem conta. Sem limites de tamanho de arquivo impostos por servidor. Funciona offline depois de carregado.

Do PDF a um arquivo de texto simples

Área de arrastar e soltar para arquivos PDF
1

Solte o documento

As páginas são renderizadas para você confirmar que carregou o arquivo certo antes de tirar qualquer coisa dele.

Grade de páginas sendo reordenadas e giradas
2

Deixe só as páginas de onde quer o texto

Exclua o resto e o resultado sai focado, em vez de chegar como um paredão de texto da capa ao apêndice.

Janela de visualização de página em tamanho real
3

Exporte um arquivo .txt

O texto é gravado na ordem das páginas, em texto puro. Layout, tabelas e colunas não são reconstruídos — aqui são as palavras, não o design.

O que isto faz e o que não faz

Texto puro, pronto para colar

Um arquivo .txt sem marcação e sem formatação, que é o que você quer para pesquisar, citar ou jogar dentro de outro programa.

Claro sobre digitalizações, sem enrolação

Aqui não há OCR. Uma página só com imagem não rende nada — e você é avisado exatamente quais páginas voltaram vazias, em vez de receber um arquivo curto sem explicação.

Escolha as páginas primeiro

Exclua as páginas que não interessam antes de exportar, e o .txt traz o trecho que você queria em vez do documento inteiro.

Documentos confidenciais ficam onde estão

A extração de texto costuma ser aplicada a algo que está sendo analisado — um contrato, um relatório, um extrato. Nada disso é enviado.

Extrair texto de PDF — perguntas comuns

Por que o meu PDF digitalizado gerou um arquivo vazio?

Porque uma digitalização é uma foto da página, não texto. A extração lê a camada de texto que o PDF carrega, e uma página digitalizada ou fotografada não tem nenhuma. Reconhecer letras dentro de uma imagem é OCR, coisa que esta ferramenta deliberadamente não faz — ela informa essas páginas como vazias em vez de adivinhar.

Como sei se o meu PDF tem texto de verdade?

Abra-o em qualquer leitor e tente selecionar uma linha com o cursor. Se o texto ficar marcado, ele será extraído. Se você só conseguir um retângulo de seleção sobre uma imagem, não há nada a tirar dali.

O layout do documento é preservado?

Não. A saída é texto puro na ordem das páginas. Layouts em várias colunas, tabelas e cabeçalhos saem como linhas sequenciais, o que pode ficar fora de ordem numa página de layout complexo.

Posso extrair o texto de apenas parte do documento?

Pode — exclua as páginas que não quer antes de exportar. Não há seleção dentro da página, então a menor unidade é uma página inteira.

Ligaduras e caracteres acentuados saem corretos?

Normalmente sim. O texto sai como o arquivo o codificou, então PDFs bem feitos extraem limpo. Documentos gerados por ferramentas antigas, com codificação de fonte quebrada, podem render caracteres estranhos, e nenhum extrator consegue consertar isso depois.

Meu documento é enviado para o texto ser extraído?

Não. O pdf.js lê a camada de texto dentro do seu navegador e grava o .txt ali mesmo. Nada é enviado a lugar nenhum, o que importa bastante já que isso normalmente é feito com documentos que valem análise.

Tire o texto de lá

Um arquivo .txt simples, gerado sem enviar o PDF.

Extrair texto agora