从 PDF 到一个纯文本文件

1
拖入文档
页面会先渲染出来,让你在提取之前确认加载的确实是那个文件。

2
只留下你需要文字的那些页面
把其余页面删掉,输出就会聚焦在你要的部分,而不是从封面到附录的一堵文字墙。

3
导出 .txt 文件
文字会按页序写成纯文本。版式、表格和分栏不会被还原——这里给你的是文字,不是设计。
它能做什么,不能做什么
纯文本,拿来就能粘贴
一个没有标记、没有格式的 .txt 文件,正适合用来搜索、引用,或者喂给另一个程序。
对扫描件如实相告,不含糊其辞
这里没有 OCR。纯图片的页面提取不出任何东西——而且你会被明确告知哪些页面返回为空,而不是拿到一个短得莫名其妙的文件。
先挑页面,再提取
导出前删掉不需要的页面,.txt 里装的就是你要的那一段,而不是整份文档。
机密文档留在原地
需要提取文本的,通常是正在被分析的东西——一份合同、一份报告、一份对账单。这些都不会被上传。
从 PDF 提取文本——大家常问的问题
为什么我的扫描版 PDF 提取出来是空文件?
因为扫描件是一张页面的图片,而不是文字。提取读取的是 PDF 自带的文本层,而扫描或拍照得到的页面根本没有这一层。要从图片里认出字来,那叫 OCR,本工具刻意不做——它会如实把这些页面报告为空,而不是靠猜。
怎么判断我的 PDF 里有没有真正的文字?
用任意阅读器打开它,试着用光标选中一行。如果文字被高亮,就能提取出来。如果你只得到一个盖在图片上的选择框,那里就没有可提取的内容。
文档的版式会被保留吗?
不会。输出是按页序排列的纯文本。多栏排版、表格和页眉都会变成一行行连续的文字,版式复杂的页面读起来可能顺序错乱。
可以只提取文档的一部分吗?
可以——导出前删掉不需要的页面。这里不支持在页面内选取,所以最小单位是一整页。
连字和带重音的字符能正确处理吗?
通常可以。文字是按文件的编码原样输出的,所以制作规范的 PDF 提取得很干净。用老旧工具生成、字体编码有问题的文档可能出现乱码,这一点任何提取器事后都无法修复。
提取文本时我的文档会被上传吗?
不会。pdf.js 在你的浏览器里读取文本层并写出 .txt。没有任何内容被发送出去——考虑到这通常是对值得仔细分析的文档做的操作,这一点很重要。