Extraer el texto de un PDF
Saca el texto de un documento a un archivo .txt que puedes buscar, pegar o pasarle a otro programa. Una limitación por delante y sin rodeos: esto lee el texto que ya está dentro del archivo y no aplica OCR a los escaneos.
Sin cuenta. Sin límites de tamaño impuestos por un servidor. Funciona sin conexión una vez cargada.
Del PDF a un archivo de texto plano

Suelta el documento
Las páginas se dibujan para que confirmes que has cargado el archivo correcto antes de sacarle nada.

Deja solo las páginas cuyo texto necesitas
Elimina el resto y el resultado se queda centrado, en lugar de llegar como un muro de texto de la portada al anexo.

Exporta un archivo .txt
El texto se escribe en orden de página como texto plano. La maquetación, las tablas y las columnas no se reconstruyen: esto son las palabras, no el diseño.
Lo que esta herramienta hace y lo que no
Texto plano, listo para pegar
Un archivo .txt sin marcado ni formato, que es justo lo que quieres para buscar, citar o pasárselo a otro programa.
Claro con los escaneos, sin ambigüedades
Aquí no hay OCR. Una página que solo es imagen no devuelve nada, y se te dice exactamente qué páginas han salido vacías en lugar de entregarte un archivo corto sin explicación.
Elige antes las páginas
Elimina las páginas que no necesitas antes de exportar y el .txt contendrá la sección que buscabas y no el documento entero.
Los documentos confidenciales se quedan donde están
La extracción de texto suele aplicarse a algo que se está analizando: un contrato, un informe, un extracto bancario. Nada de eso se sube.
Dudas frecuentes sobre la extracción de texto
¿Por qué mi PDF escaneado ha dado un archivo vacío?
Porque un escaneo es una foto de una página, no texto. La extracción lee la capa de texto que lleva el PDF, y una página escaneada o fotografiada no tiene ninguna. Reconocer letras dentro de una imagen es OCR, algo que esta herramienta no hace a propósito: informa de esas páginas como vacías en lugar de adivinar.
¿Cómo sé si mi PDF lleva texto de verdad?
Ábrelo en cualquier lector e intenta seleccionar una línea con el cursor. Si el texto se resalta, se extraerá. Si solo consigues un rectángulo de selección sobre una imagen, no hay nada que sacar.
¿Se conserva la maquetación del documento?
No. La salida es texto plano en orden de página. Las columnas, las tablas y los encabezados salen como líneas seguidas, lo que en una página con maquetación compleja puede leerse desordenado.
¿Puedo extraer el texto de solo una parte del documento?
Sí: elimina antes de exportar las páginas que no quieras. No hay selección dentro de la página, así que la unidad mínima es una página entera.
¿Se manejan bien las ligaduras y los caracteres acentuados?
Casi siempre. El texto sale tal y como lo codificó el archivo, así que un PDF bien hecho se extrae limpio. Los documentos generados por herramientas antiguas con codificaciones de fuente rotas pueden dar caracteres raros, y ningún extractor puede arreglar eso a posteriori.
¿Se sube mi documento para extraer el texto?
No. pdf.js lee la capa de texto dentro de tu navegador y escribe ahí mismo el .txt. No se envía nada a ninguna parte, algo que importa porque esto se usa normalmente con documentos que merece la pena analizar.