PDF에서 일반 텍스트 파일까지

문서를 끌어다 놓으세요
페이지가 렌더링되므로 무언가를 뽑아내기 전에 올바른 파일을 불러왔는지 확인할 수 있습니다.

텍스트가 필요한 페이지만 남기세요
나머지를 지우면 결과물이 표지부터 부록까지 이어지는 글 덩어리 대신 필요한 부분에 집중됩니다.

.txt 파일로 내보내기
텍스트는 페이지 순서대로 일반 텍스트로 기록됩니다. 레이아웃, 표, 단은 복원되지 않습니다 — 이것은 디자인이 아니라 말 그대로 글자입니다.
이 도구가 하는 일과 하지 않는 일
붙여넣을 준비가 된 일반 텍스트
마크업도 서식도 없는 .txt 파일입니다. 검색하거나 인용하거나 다른 프로그램에 넣을 때 바로 이런 형태가 필요합니다.
스캔본에 대해 얼버무리지 않습니다
여기에 OCR은 없습니다. 이미지로만 된 페이지에서는 아무것도 나오지 않으며, 설명 없는 짧은 파일을 받는 대신 어느 페이지가 비어 있었는지 정확히 알려드립니다.
페이지를 먼저 고르세요
내보내기 전에 필요 없는 페이지를 지우면 .txt에 문서 전체가 아니라 원하던 그 부분만 담깁니다.
기밀 문서는 제자리에
텍스트 추출은 보통 분석하려는 대상에 씁니다 — 계약서, 보고서, 명세서. 그중 어느 것도 업로드되지 않습니다.
PDF 텍스트 추출, 자주 나오는 질문
스캔한 PDF에서 왜 빈 파일이 나왔나요?
스캔본은 텍스트가 아니라 페이지를 찍은 그림이기 때문입니다. 추출은 PDF가 품고 있는 텍스트 레이어를 읽는데, 스캔하거나 사진으로 찍은 페이지에는 그 레이어가 없습니다. 이미지 속 글자를 알아보는 일은 OCR이고, 이 도구는 의도적으로 그것을 하지 않습니다 — 추측하는 대신 해당 페이지를 비어 있다고 보고합니다.
제 PDF에 진짜 텍스트가 있는지 어떻게 확인하나요?
아무 뷰어에서나 열어 커서로 한 줄을 선택해 보세요. 글자가 하이라이트되면 추출됩니다. 이미지 위에 사각형 선택 영역만 생긴다면 뽑아낼 것이 없습니다.
문서의 레이아웃이 유지되나요?
아닙니다. 결과물은 페이지 순서대로 나열된 일반 텍스트입니다. 다단 레이아웃, 표, 머리글은 연속된 줄로 나오므로 복잡한 레이아웃의 페이지에서는 순서가 어긋나 보일 수 있습니다.
문서의 일부에서만 텍스트를 뽑을 수 있나요?
네 — 내보내기 전에 원하지 않는 페이지를 지우면 됩니다. 페이지 안에서 영역을 선택하는 기능은 없으므로 가장 작은 단위는 페이지 한 장입니다.
합자나 악센트가 붙은 문자도 제대로 처리되나요?
대체로 그렇습니다. 텍스트는 파일이 인코딩한 그대로 나오므로 잘 만들어진 PDF는 깔끔하게 추출됩니다. 글꼴 인코딩이 깨진 오래된 도구로 만든 문서에서는 이상한 문자가 나올 수 있고, 그것은 어떤 추출기도 사후에 고칠 수 없습니다.
텍스트를 뽑으려고 제 문서가 업로드되나요?
아닙니다. pdf.js가 브라우저 안에서 텍스트 레이어를 읽고 .txt도 거기서 씁니다. 아무것도 어디로도 전송되지 않으며, 보통 분석할 가치가 있는 문서에 쓰이는 기능이라는 점에서 중요한 부분입니다.