如何在不上传截图的情况下提取文本?
浏览器 OCR 实际读取的内容:在六个样本上测量的相似性,从一张没有文本的照片中生成的 515 个字符,以及您一次性支付的模型下载。
大多数 OCR 网站会将您的截图上传到服务器并在那读取。这对于餐厅菜单的照片来说没问题。但对于工资单、护照页面或私人聊天的截图来说,这就是另一个决定。我们的 图像转文本工具 在您的浏览器标签页内运行识别,因此文件保留在您的磁盘上,文本显示在旁边。
该引擎是 Tesseract,编译为 WebAssembly 并随页面一起提供。第一次运行时会下载一个工作脚本、WebAssembly 核心和一个语言模型。您的浏览器会缓存这三者。之后就没有其他内容需要获取。
我的截图会被上传吗?
不会。该代码库中没有可以接收上传的端点。该工具产生的唯一网络流量是同源的:3 个请求总计约 6 MB,所有请求均来自此域。您的文件在页面内解码,作为像素传递给引擎并在那里转换为文本。在运行期间打开网络标签,您将看到模型块到达,而没有任何内容将您的图像带走。我们的隐私页面 列出了我们收集的唯一内容,即页面浏览量和匿名工具计数。
现有的工具则相反。Smallpdf 和 iLovePDF 都在他们自己的机器上进行识别,因此您的文件必须先到达他们那里才能发生任何事情。他们对隐私问题的回答是保留承诺:副本在一段时间后被删除。我们在 JPG 转 PDF 指南 中引用了他们的保留措辞。保留承诺告诉您护照扫描在别人磁盘上存放的时间,但并未说明它是否会到达。这里不涉及这个问题。
在真实截图上的准确性如何?
我们进行了测量。六个已知文本的样本在 2026-08-11 通过引擎处理,下面的分数是输出与我们已知在图片中的文本逐字符比较的结果。这些样本是合成的:在浏览器中渲染的 HTML 页面并作为真实截图捕获,其中降质的一个在 CSS 中模糊并旋转,以模拟糟糕的手机捕获。
| 样本 | 语言 | 相似性 | 置信度 |
|---|---|---|---|
| 干净截图 | 英语 | 100.0% | 95 |
| 密集段落 | 英语 | 100.0% | 95 |
| 模拟降质捕获 | 英语 | 92.4% | 65 |
| 俄语样本 | 俄语 | 100.0% | 96 |
| 日语样本 | 日语 | 100.0% | 93 |
| 没有文本的照片 | 英语 | 515 个虚构字符 | 32 |

两个英语样本的返回结果均为 100.0%,逐字符一致,置信度均为 95。模糊和旋转的同一段落的结果为 92.4% 和置信度 65。相似性减少了 7.6 分,以上数字显示了减少的原因:开头的单词被扭曲,而段落的中间部分得以保留。置信度 65 也触发了卡片上的低置信度警告,因此在复制之前会告知您。
如果图片中没有文本,会发生什么?
这是其他 OCR 页面跳过的部分。我们给引擎提供了一张黑暗的蝴蝶照片,背景是苔藓覆盖的原木,照片中没有任何文字。它返回了 515 个从未存在的字符。这就是 OCR 引擎的工作原理。它们被构建为查找字符形状,因此颗粒和纹理被报告为字符,而管道中的任何阶段都不会判断图片是空白的。
我们不声称能够检测到空图像,因为我们做不到。每个结果都有其置信度分数,当平均值低于 60 时会触发警告。那张照片的分数为 32。干净截图的分数为 95。这两个数字之间的距离是信号,并在您接触文本之前打印在卡片上。
它能读取俄语和日语吗?
九种语言:英语、西班牙语、罗马尼亚语、阿拉伯语、希腊语、土耳其语、印尼语、俄语和日语。在提取之前选择一种语言,因为引擎会根据您选择的模型匹配形状,错误的模型会导致读取不佳。目前还没有自动检测。两个非拉丁样本的结果均为干净,俄语为 100.0% 和置信度 96,日语为 100.0% 和置信度 93,一旦间距标准化,因为引擎在日语字符之间插入空格。

每种语言都是一个单独的模型文件,tessdata_fast 来自 Tesseract 项目,与其他内容一样从此域提供。第一次选择时添加一个的成本在 0.6 到 2 MB 之间,所有九个一起约为 11 MB。您的浏览器会保留它们,因此每种语言的成本是一次性的,任何语言的第二次运行会立即开始。
什么时候不应该使用这个?
手写。Tesseract 项目 明确指出:您可以将其指向手写文本,但效果不佳,因为该引擎是为打印文本设计的。在场景中拍摄的文本是另一个弱点案例,例如商店标牌和货架标签。您手机内置的文本选择处理这些情况更好,而专门训练手写的服务会在您祖母的信件上胜过我们。我们宁愿这样说,而不是运行并交给您一段模糊的文本。
对于其他所有内容,Tesseract 质量说明 与我们在样本中看到的匹配:更大、更清晰的字符读取效果更好,深色文本在浅色背景上是简单的情况。尽量截取源文本的截图。在无法做到的情况下,确保光线均匀并将文本填满整个画面。
提取后我该如何处理图像?
输出是纯文本。使用按钮复制它,该按钮使用浏览器的 剪贴板 API。每张图像下载一个 .txt,或者将整个批量作为一个文件下载。您的图片没有受到任何影响。如果在发送之前需要缩小,压缩工具 可以在同一标签页中完成此操作,调整大小工具 则更改像素尺寸。在提取后执行任一操作。首先缩小截图会丢失字符所需的像素。
有两个链条值得了解。来自 iPhone 的 HEIC 照片直接进入,在引擎看到之前由浏览器解码,因此没有需要先进行的 格式转换 步骤。如果您只想从长截图中提取一块文本,请先通过 裁剪工具 处理,这样输出就是您请求的部分,而不是其他内容。该网站上本地运行的另一个模型是 决定哪些像素是主题的模型。
尝试在您拥有的最糟糕的截图上进行操作。将其拖放到 图像转文本工具,选择语言,然后在文本之前查看置信度数字。
PDF 呢?
PDF 在应用任何这些之前会分为两部分。从文字处理器或浏览器导出的文件携带文本层,因此字符已经存在,提取它们根本不需要识别。来自扫描仪或手机的文件是包裹在 PDF 中的图片,需要与图像相同的 OCR 处理。我们的 PDF 转文本页面 检查每一页并进行选择,它如何决定哪些页面被准确读取,哪些页面被识别 是更长的说明。在样本中,原生数字文件和三页数字文件均直接从文本层返回 100.0%,而使用本网站自己的 JPG 转 PDF 转换器生成的扫描页面通过 OCR 返回 100.0%。

每个文件的页面上限为 25 页。超大样本为 28 页,运行读取前 25 页并打印通知。请在 PDF 阅读器中拆分任何更长的文件,并将其余部分作为第二次运行发送。在开始之前还有一件事值得了解:PDF 在 OCR 引擎和模型之上大约需要 1.3 MB 的读取器,并且当每一页都是数字且无需识别时,仍会发生该 OCR 下载。
在隐私方面,这里比截图更强。银行对账单、工资单和身份证扫描是人们最希望提取文本的文件,而这些文件是您最不希望交给陌生人服务器的文件。PDF 页面 的工作方式与 图像转文本工具 相同,文件从您的磁盘读取到标签页中,且没有任何内容被发送到其他地方。如果您的源是 PDF,请从那里开始,而不是逐页截图。