從 PDF 到一個純文字檔

1
放入文件
頁面會先算成縮圖,讓你在抽取任何東西之前,先確認自己載入的是正確的檔案。

2
只留下你要取文字的頁面
其餘的先刪掉,輸出才會聚焦,而不是從封面到附錄湧出一整面文字牆。

3
匯出 TXT 檔
文字會依頁面順序以純文字寫出。版面、表格與分欄不會被重建 — 這裡給你的是文字,不是排版。
它做得到什麼,做不到什麼
純文字,貼上就能用
一個沒有標記、沒有格式的 TXT 檔,正好適合拿來搜尋、引用,或送進另一個程式處理。
對掃描檔說實話,不打模糊仗
這裡沒有 OCR。純圖片的頁面不會有任何結果 — 而且我們會明確告訴你哪些頁面是空的,而不是丟給你一個沒頭沒尾的短檔案。
先挑好頁面
匯出前刪掉不需要的頁面,TXT 裡就會是你要的那一段,而不是整份文件。
機密文件留在原地
會拿來擷取文字的,通常是正要拿去分析的東西 — 合約、報告、對帳單。這些都不會被上傳。
從 PDF 擷取文字的常見問題
為什麼我的掃描 PDF 匯出的是空檔案?
因為掃描檔是一張頁面的照片,不是文字。擷取讀的是 PDF 自帶的文字圖層,而掃描或拍照而成的頁面根本沒有這一層。要從圖片裡辨識出字母屬於 OCR,本工具刻意不做這件事 — 它會直接把那些頁面回報為空白,而不是用猜的。
我怎麼知道我的 PDF 裡有沒有真正的文字?
用任何閱讀器打開它,試著用游標選取一行。如果文字被反白,那就抽得出來。如果你只框到圖片上的一塊選取範圍,那就沒有東西可以抽。
文件的版面會被保留嗎?
不會。輸出是依頁面順序排列的純文字。多欄版面、表格與頁首會變成一行接一行,因此版面複雜的頁面,讀起來順序可能會怪怪的。
可以只擷取文件的一部分嗎?
可以 — 匯出前先刪掉不要的頁面。這裡沒有頁面內的局部選取,所以最小單位就是一整頁。
連字與帶重音的字元會正確處理嗎?
通常會。文字會照著檔案當初編碼的樣子出來,所以製作良好的 PDF 都能乾淨地擷取。由老舊工具產生、字型編碼有問題的文件可能會出現亂碼,而這種問題事後沒有任何擷取工具修得好。
為了擷取文字,我的文件會被上傳嗎?
不會。pdf.js 在你的瀏覽器裡讀取文字圖層,TXT 也在那裡寫出。沒有任何內容被送到任何地方 — 考慮到這通常用在值得分析的文件上,這一點格外重要。