PDFPDF Organizer
Gratis · Sin subidas · Sale un .txt limpio

Extraer el texto de un PDF

Saca el texto de un documento a un archivo .txt que puedes buscar, pegar o pasarle a otro programa. Una limitación por delante y sin rodeos: esto lee el texto que ya está dentro del archivo y no aplica OCR a los escaneos.

Sin cuenta. Sin límites de tamaño impuestos por un servidor. Funciona sin conexión una vez cargada.

Del PDF a un archivo de texto plano

Área para arrastrar y soltar archivos PDF
1

Suelta el documento

Las páginas se dibujan para que confirmes que has cargado el archivo correcto antes de sacarle nada.

Cuadrícula de páginas que se reordenan y giran
2

Deja solo las páginas cuyo texto necesitas

Elimina el resto y el resultado se queda centrado, en lugar de llegar como un muro de texto de la portada al anexo.

Ventana de vista previa de página a tamaño completo
3

Exporta un archivo .txt

El texto se escribe en orden de página como texto plano. La maquetación, las tablas y las columnas no se reconstruyen: esto son las palabras, no el diseño.

Lo que esta herramienta hace y lo que no

Texto plano, listo para pegar

Un archivo .txt sin marcado ni formato, que es justo lo que quieres para buscar, citar o pasárselo a otro programa.

Claro con los escaneos, sin ambigüedades

Aquí no hay OCR. Una página que solo es imagen no devuelve nada, y se te dice exactamente qué páginas han salido vacías en lugar de entregarte un archivo corto sin explicación.

Elige antes las páginas

Elimina las páginas que no necesitas antes de exportar y el .txt contendrá la sección que buscabas y no el documento entero.

Los documentos confidenciales se quedan donde están

La extracción de texto suele aplicarse a algo que se está analizando: un contrato, un informe, un extracto bancario. Nada de eso se sube.

Dudas frecuentes sobre la extracción de texto

¿Por qué mi PDF escaneado ha dado un archivo vacío?

Porque un escaneo es una foto de una página, no texto. La extracción lee la capa de texto que lleva el PDF, y una página escaneada o fotografiada no tiene ninguna. Reconocer letras dentro de una imagen es OCR, algo que esta herramienta no hace a propósito: informa de esas páginas como vacías en lugar de adivinar.

¿Cómo sé si mi PDF lleva texto de verdad?

Ábrelo en cualquier lector e intenta seleccionar una línea con el cursor. Si el texto se resalta, se extraerá. Si solo consigues un rectángulo de selección sobre una imagen, no hay nada que sacar.

¿Se conserva la maquetación del documento?

No. La salida es texto plano en orden de página. Las columnas, las tablas y los encabezados salen como líneas seguidas, lo que en una página con maquetación compleja puede leerse desordenado.

¿Puedo extraer el texto de solo una parte del documento?

Sí: elimina antes de exportar las páginas que no quieras. No hay selección dentro de la página, así que la unidad mínima es una página entera.

¿Se manejan bien las ligaduras y los caracteres acentuados?

Casi siempre. El texto sale tal y como lo codificó el archivo, así que un PDF bien hecho se extrae limpio. Los documentos generados por herramientas antiguas con codificaciones de fuente rotas pueden dar caracteres raros, y ningún extractor puede arreglar eso a posteriori.

¿Se sube mi documento para extraer el texto?

No. pdf.js lee la capa de texto dentro de tu navegador y escribe ahí mismo el .txt. No se envía nada a ninguna parte, algo que importa porque esto se usa normalmente con documentos que merece la pena analizar.

Saca el texto de ahí

Un archivo .txt limpio, generado sin subir el PDF.

Extraer texto