Extrair o texto de um PDF
Tire o texto de um documento e coloque num arquivo .txt simples que você pode pesquisar, colar ou alimentar em outro programa. Uma limitação honesta logo de cara: isto lê o texto que já existe no arquivo e não faz OCR em digitalizações.
Sem conta. Sem limites de tamanho de arquivo impostos por servidor. Funciona offline depois de carregado.
Do PDF a um arquivo de texto simples

Solte o documento
As páginas são renderizadas para você confirmar que carregou o arquivo certo antes de tirar qualquer coisa dele.

Deixe só as páginas de onde quer o texto
Exclua o resto e o resultado sai focado, em vez de chegar como um paredão de texto da capa ao apêndice.

Exporte um arquivo .txt
O texto é gravado na ordem das páginas, em texto puro. Layout, tabelas e colunas não são reconstruídos — aqui são as palavras, não o design.
O que isto faz e o que não faz
Texto puro, pronto para colar
Um arquivo .txt sem marcação e sem formatação, que é o que você quer para pesquisar, citar ou jogar dentro de outro programa.
Claro sobre digitalizações, sem enrolação
Aqui não há OCR. Uma página só com imagem não rende nada — e você é avisado exatamente quais páginas voltaram vazias, em vez de receber um arquivo curto sem explicação.
Escolha as páginas primeiro
Exclua as páginas que não interessam antes de exportar, e o .txt traz o trecho que você queria em vez do documento inteiro.
Documentos confidenciais ficam onde estão
A extração de texto costuma ser aplicada a algo que está sendo analisado — um contrato, um relatório, um extrato. Nada disso é enviado.
Extrair texto de PDF — perguntas comuns
Por que o meu PDF digitalizado gerou um arquivo vazio?
Porque uma digitalização é uma foto da página, não texto. A extração lê a camada de texto que o PDF carrega, e uma página digitalizada ou fotografada não tem nenhuma. Reconhecer letras dentro de uma imagem é OCR, coisa que esta ferramenta deliberadamente não faz — ela informa essas páginas como vazias em vez de adivinhar.
Como sei se o meu PDF tem texto de verdade?
Abra-o em qualquer leitor e tente selecionar uma linha com o cursor. Se o texto ficar marcado, ele será extraído. Se você só conseguir um retângulo de seleção sobre uma imagem, não há nada a tirar dali.
O layout do documento é preservado?
Não. A saída é texto puro na ordem das páginas. Layouts em várias colunas, tabelas e cabeçalhos saem como linhas sequenciais, o que pode ficar fora de ordem numa página de layout complexo.
Posso extrair o texto de apenas parte do documento?
Pode — exclua as páginas que não quer antes de exportar. Não há seleção dentro da página, então a menor unidade é uma página inteira.
Ligaduras e caracteres acentuados saem corretos?
Normalmente sim. O texto sai como o arquivo o codificou, então PDFs bem feitos extraem limpo. Documentos gerados por ferramentas antigas, com codificação de fonte quebrada, podem render caracteres estranhos, e nenhum extrator consegue consertar isso depois.
Meu documento é enviado para o texto ser extraído?
Não. O pdf.js lê a camada de texto dentro do seu navegador e grava o .txt ali mesmo. Nada é enviado a lugar nenhum, o que importa bastante já que isso normalmente é feito com documentos que valem análise.