PDFPDF Organizer
免費 · 免上傳 · 輸出純文字 TXT

PDF 轉文字:把文字從 PDF 裡擷取出來

把文件裡的文字抽成一個純文字 TXT 檔,方便搜尋、貼上,或餵給別的程式。有一個限制先講清楚:它讀的是檔案裡既有的文字,不會對掃描檔進行 OCR。

無需帳號。不受伺服器檔案大小限制。載入後即可離線使用。

從 PDF 到一個純文字檔

PDF 檔案的拖放區域
1

放入文件

頁面會先算成縮圖,讓你在抽取任何東西之前,先確認自己載入的是正確的檔案。

正在重新排序與旋轉的頁面格狀排列
2

只留下你要取文字的頁面

其餘的先刪掉,輸出才會聚焦,而不是從封面到附錄湧出一整面文字牆。

全尺寸頁面預覽視窗
3

匯出 TXT 檔

文字會依頁面順序以純文字寫出。版面、表格與分欄不會被重建 — 這裡給你的是文字,不是排版。

它做得到什麼,做不到什麼

純文字,貼上就能用

一個沒有標記、沒有格式的 TXT 檔,正好適合拿來搜尋、引用,或送進另一個程式處理。

對掃描檔說實話,不打模糊仗

這裡沒有 OCR。純圖片的頁面不會有任何結果 — 而且我們會明確告訴你哪些頁面是空的,而不是丟給你一個沒頭沒尾的短檔案。

先挑好頁面

匯出前刪掉不需要的頁面,TXT 裡就會是你要的那一段,而不是整份文件。

機密文件留在原地

會拿來擷取文字的,通常是正要拿去分析的東西 — 合約、報告、對帳單。這些都不會被上傳。

從 PDF 擷取文字的常見問題

為什麼我的掃描 PDF 匯出的是空檔案?

因為掃描檔是一張頁面的照片,不是文字。擷取讀的是 PDF 自帶的文字圖層,而掃描或拍照而成的頁面根本沒有這一層。要從圖片裡辨識出字母屬於 OCR,本工具刻意不做這件事 — 它會直接把那些頁面回報為空白,而不是用猜的。

我怎麼知道我的 PDF 裡有沒有真正的文字?

用任何閱讀器打開它,試著用游標選取一行。如果文字被反白,那就抽得出來。如果你只框到圖片上的一塊選取範圍,那就沒有東西可以抽。

文件的版面會被保留嗎?

不會。輸出是依頁面順序排列的純文字。多欄版面、表格與頁首會變成一行接一行,因此版面複雜的頁面,讀起來順序可能會怪怪的。

可以只擷取文件的一部分嗎?

可以 — 匯出前先刪掉不要的頁面。這裡沒有頁面內的局部選取,所以最小單位就是一整頁。

連字與帶重音的字元會正確處理嗎?

通常會。文字會照著檔案當初編碼的樣子出來,所以製作良好的 PDF 都能乾淨地擷取。由老舊工具產生、字型編碼有問題的文件可能會出現亂碼,而這種問題事後沒有任何擷取工具修得好。

為了擷取文字,我的文件會被上傳嗎?

不會。pdf.js 在你的瀏覽器裡讀取文字圖層,TXT 也在那裡寫出。沒有任何內容被送到任何地方 — 考慮到這通常用在值得分析的文件上,這一點格外重要。

把文字抽出來

一個純文字 TXT 檔,過程完全不上傳 PDF。

立即擷取文字