LeanImg

PDF 转文本 — 免费在线文本提取器

直接在您的浏览器中从数字或扫描的 PDF 中提取文本。免费,无需注册,PDF 从未离开您的设备。

正在加载文本提取器...

想要感谢我们?告诉您的朋友关于 LeanImg 的事!

如何将 PDF 转换为文本

1

选择您的 PDF

将文件拖入框中或从您的设备中选择。数字 PDF、扫描 PDF 和混合两者的文件均可使用。

2

选择语言并提取

选择文档的语言,然后开始提取。具有文本层的页面会立即读取。需要 OCR 的页面会一个接一个地被识别,进度在每个页面到达时显示。

3

复制或下载文本

阅读结果,将其复制到剪贴板或保存为带有页面标签的 .txt 文件。

PDF 转文本提取的工作原理

PDF 是一个容器,里面的内容决定了文本的输出方式。从文字处理器、浏览器或会计应用导出的文件包含一个文本层。字符作为字符存储,并带有它们在页面上的位置。读取该层可以准确获取文件存储的文本。没有识别步骤,因此没有错误的可能。

扫描的 PDF 是一种不同的东西,使用相同的文件扩展名。扫描仪或手机相机生成了每一页的图片,这些图片被封装在 PDF 中。文件中没有字符,只有看起来像字符的像素。提取文字需要 OCR,它会渲染页面并根据您选择的语言模型匹配形状。

提取器在决定之前检查每一页。如果页面有可用的文本层,则读取该层,结果是准确的。如果没有,则将页面渲染为图像,并通过与图像提取器相同的 OCR 引擎进行处理。混合两者的文件会逐页进行两种处理,结果摘要说明每页使用了哪种方法。每个文件最多读取 25 页 PDF。

银行对账单、身份证和合同保留在您的设备上

人们最想提取文本的文档是他们最不愿意上传的文档。银行对账单、工资单、税表、签署的合同、医疗信件以及护照或身份证的扫描件。每一个都是您不会发给陌生人的文件,而将其交给您在搜索结果中找到的网站则是相同的行为,只是步骤更少。

此提取器没有上传端点。您的 PDF 从磁盘读取到页面,由在您的浏览器中运行的 PDF 阅读器打开,并在内存中转换为文本。页面发出的请求是为了其自身的机器:阅读器本身,以及当页面需要 OCR 时,识别引擎和语言模型。所有这些都来自此网站,并且它们只向您传输。

您不必对此深信不疑。在您开始运行之前打开浏览器的网络选项卡,然后在文本出现时观察它。您将看到机器到达,而没有任何东西带走您的文档。这是您可以在不到一分钟内检查的声明,远比隐私政策给您的要多。

此工具不做的事情

此页面仅朝一个方向工作。它读取 PDF 并给您纯文本。它不写 PDF。它不会返回带有添加文本层的可搜索 PDF。它不会将您的文档重建为保持原始布局的文字处理器文件。您得到的只是文字。

它也不合并、拆分、旋转、压缩或密码保护任何内容。所有这些都有网站可以处理,而大多数需要您的文件在他们的服务器上才能完成工作。这是此页面旨在避免的交易。

如果您想反过来将照片或扫描件转换为单个 PDF,此网站上的 JPG 转 PDF 转换器可以做到这一点。它在浏览器中运行,正如此页面所做的那样。如果您的源是截图或照片而不是 PDF,则图像提取器是您想要的页面。

为什么选择LeanImg?

PDF在你的设备上逐页读取,文本与其一起保留。探索我们所有的免费图像工具,以便将你的工作流程的其余部分也保持在浏览器中。

无上传

银行对账单、身份证和合同正是你不应该发送到陌生人服务器的文件。此工具没有服务器可以发送它们。

尽可能准确

数字PDF是逐字从其文本层读取的。只有扫描的页面经过OCR处理,每个结果说明使用了哪种方法。

免费且无限制

无需注册,无需积分,无需水印,也没有付费层。每个PDF最多25页,所需的PDF数量不限。

数字的样子

四个PDF经过了这个提取器,文本提前已知。分数是输出与该文本逐字符比较的结果。三个文件是数字出生的,直接从浏览器导出,因此字符已经在其中。扫描的文件是通过该网站自己的JPG到PDF转换器推送截图生成的,留下了一页的图片而没有任何字符。最后一行是一个28页的文件。它是为了触发页面上限而构建的,因此没有任何部分被评分以确保准确性。

2026-08-12在桌面硬件上的实际运行测量。故意省略了持续时间,因为手机比这些运行的机器慢。扫描行是干净的合成捕获;有关降级成本,请参见图像到文本页面上的92.4%行。
文件类型页面方法相似度
数字PDF1 / 1文本层100.0%
扫描PDF1 / 1OCR100.0%
三页数字PDF3 / 3文本层100.0%
超大PDF25 / 28文本层未评分

这两种方法产生了这些行,文件决定哪种方法运行。每个页面首先检查文本层,当字符存在时,它们逐字读取,没有任何识别步骤。这就是“确切”一词的归属,而不是在此页面的其他地方。没有可用文本层的页面被渲染为图像,并交给同一OCR引擎读取截图,因此它携带该引擎的准确性和失败模式。混合这两者的文件逐页获得两种处理。

结果告诉你发生了什么。完全从其文本层读取的PDF被标记为确切,并且该卡片没有信心分数。任何包含OCR页面的文档都会显示分数。多于一页的文档还会携带一行,计算从文本层读取的页面与经过OCR处理的页面。该分数是整个文档的字符加权平均值,文本层页面以100进入。在混合文件中,阅读它作为文本的可信度,而不是OCR的表现。每页摘要行告诉你有多少页面被识别。

首次使用时下载的内容

这两个引擎在你的机器上运行,因此它们必须先到达。打开PDF会获取pdf.js工作线程,约1.3 MB。OCR引擎和一个语言模型与它一起下载,总共约6 MB,即使每个页面都是数字且没有进行识别,它们也会下载。这是对数字文件的浪费下载。这是当前的限制,修复它在计划之中。

所有内容都从此网站提供,没有任何内容来自第三方CDN。你的浏览器缓存了所有内容,因此下一个该语言的PDF开始时无需获取任何内容。使用不寻常字体构建的文档会拉取一个更小的文件以获取字符映射,只有这些文档会这样做。没有任何内容会反向传输。你的PDF是从磁盘读取到页面中并在内存中打开的,没有请求将其传出。

限制在哪里

一个PDF最多25页。超大文件包含28页,运行取了前25页,并在结果卡上说明了这一点。较长的文档仍然会给你一些东西,解决方法是在PDF阅读器中拆分文件,并将剩余页面作为第二次运行发送。

受密码保护的PDF会被拒绝。没有密码无法打开,而此页面不会询问你密码。提取器正是这样说的并停止。请在你已经使用的阅读器中打开文件,保存一个去掉密码的副本,并运行该副本。

阅读顺序是较安静的限制。文本层记录每个字符串在页面上的位置,而没有任何关于其含义的信息,因此列、侧边栏和脚注可能会以你的眼睛永远不会采取的顺序返回。表格失去网格,按顺序到达其单元格内容。直白的散文几乎总是没问题。填写的表单或两列页面在你依赖之前值得阅读。

扫描中的手写超出了此引擎的能力。它是针对印刷字符训练的,手写行返回的内容是形状像文本的噪音。混合印刷和手写的扫描给你印刷部分和手写的无意义内容。

还有一个值得了解的边界:已经被其他软件OCR处理的扫描携带该软件的不可见文本层,而此工具逐字读取它。结果是对文件的准确,而不一定是对扫描纸的准确。

常见问题

数字PDF和扫描PDF之间有什么区别?

数字PDF是由软件生成的,因此它携带的是字符本身。扫描PDF是一堆由扫描仪或相机生成的页面图像,因此它根本不携带任何字符。这个区别决定了结果的一切。数字文件给你确切的文本。扫描文件必须被识别,识别在干净的扫描上非常好,而在歪斜、模糊或光线不足的扫描上则不太好。你通常可以通过在PDF阅读器中打开文件并尝试用鼠标选择一行文本来判断你拥有哪种类型的文件。如果选择高亮显示了单词,则表示存在文本层。

提取的文本对于数字PDF是准确的吗?

对于具有真实文本层的页面,是的。字符是从文件中读取的,而不是从图片中识别的,因此不会对它们进行OCR处理,也没有任何错误读取的可能。阅读顺序是唯一可能让你感到惊讶的事情,因为文本层存储的是每个字符串的位置,而不是它的意思,因此具有列或侧边栏的页面可能以与你的眼睛移动方式不匹配的顺序出现。单词本身就是文件中的单词。没有文本层的页面则会经过OCR处理,而这些页面的识别准确率是常规的。

我一次可以提取多少页?

每个PDF最多25页。较长的文件仍然被接受:提取前25页,结果通知你遗漏了多少页。这个限制是因为工作在你自己的硬件上运行,而较长的扫描文档意味着在你的浏览器标签中每页进行一次OCR处理。如果你需要其余部分,请在PDF阅读器中拆分文件,并将剩余页面作为第二个文件运行。

我可以从受密码保护的PDF中提取文本吗?

不可以。加密的PDF在没有密码的情况下无法打开,而此页面不会询问你密码或试图绕过保护。你会得到一个明确的错误,而不是空白结果。请在你通常使用的阅读器中打开文件,按照你通常的方式进行身份验证,保存一个去掉密码的副本,并通过这里运行该副本。

我的PDF会被上传到服务器吗?

不会。文件是从你的磁盘读取到页面中,并由在你的浏览器中运行的PDF阅读器打开。此网站没有上传端点来接收它。这正是人们实际带到这样的工具中的文档的全部意义:银行对账单、工资单、税表、签署的合同和身份证的扫描。在运行期间观察网络标签,你会看到阅读器和OCR模型到达,而没有任何东西随你的文档离开。

它可以读取哪些语言?

OCR部分可以读取英语、西班牙语、罗马尼亚语、阿拉伯语、希腊语、土耳其语、印尼语、俄语和日语。在提取之前选择语言,因为引擎将形状与您选择的模型进行匹配,错误的模型读取效果差。已经具有文本层的页面完全忽略该设置,因为这些字符是按原样从文件中读取的,无论它们是用什么脚本写的。

我可以一次从多个PDF中提取文本吗?

可以。选择一个批次,文件将按顺序处理,而不是并行处理。每个结果在其文件完成后立即出现,因此你可以在其余文件仍在运行时开始阅读。拖放区域显示单次运行的限制。顺序处理使内存使用可预测,这在手机上尤其重要。

它能保持表格和布局吗?

不能。输出是纯文本,因此表格以其单元格内容返回,而不是网格,标题、脚注和说明没有被标记为任何东西。阅读顺序也可能与视觉布局不同,因为位置是文件存储的内容,而意义则不是。直白的散文几乎总是按正确的顺序传递。具有侧边栏、多个列或填写表单的页面是你在依赖输出之前应该阅读的地方。

它能读取扫描PDF中的手写吗?

不能,我们宁愿在这里说清楚,而不是让你在重要文件上发现这一点。OCR引擎是针对印刷字符训练的。手写、签名和手写表单字段超出了它的能力范围,从它们返回的内容是形状像文本的噪音。混合印刷和手写的扫描页面给你印刷部分和无意义的内容。

提取的文本是什么格式的?

纯文本。通过一个按钮将其复制到剪贴板,或将其下载为.txt文件,页面分开并标记,以便你可以在长文档中找到自己的位置。没有文字处理器文件,没有可搜索的PDF,也没有格式被保留。如果你需要将单词放在其他地方,请将它们粘贴到文档、电子表格或翻译器中。

我该如何将图像转换为PDF?

那是另一个方向,它在此网站上有自己的页面。JPG到PDF转换器将照片或扫描写入一个单一的PDF,在你的浏览器中,没有任何上传。当你有图片并需要文档时使用它。当你有文档并需要从中提取单词时使用此页面。

PDF到文本转换器真的免费吗?

是的,免费,无需账户和使用计数器。没有注册,没有文本水印,没有积分,也没有付费层限制更好的版本。提取在你自己的硬件上运行,因此我们没有每个文件的服务器成本传递给你。

想处理图片吗?从图像中提取文本 读取截图、扫描件和文档照片。反过来呢?将图像转换为 PDF 使用 JPG 转 PDF 转换器。