PDF в текст — Бесплатный онлайн экстрактор текста
Извлеките текст из цифрового или отсканированного PDF прямо в вашем браузере. Бесплатно, без регистрации, и PDF никогда не покидает ваше устройство.
Хотите нас поблагодарить? Расскажите своим друзьям о LeanImg!
Как конвертировать PDF в текст
Выберите ваш PDF
Перетащите файл в коробку или выберите его на вашем устройстве. Цифровые PDF, отсканированные PDF и файлы, которые смешивают оба, работают.
Выберите язык и извлеките
Выберите язык документа, затем начните извлечение. Страницы с текстовым слоем считываются сразу. Страницы, которым нужен OCR, распознаются одна за другой, с отображением прогресса по мере того, как каждая из них появляется.
Скопируйте или загрузите текст
Прочитайте результат, скопируйте его в буфер обмена или сохраните как файл .txt с пометками страниц.
Как работает извлечение текста из PDF
PDF — это контейнер, и то, что находится внутри него, определяет, как текст выходит. Файл, экспортированный из текстового процессора, браузера или бухгалтерского приложения, содержит текстовый слой. Символы хранятся как символы, вместе с их положением на странице. Чтение этого слоя дает вам текст точно так, как он хранится в файле. Этап распознавания не выполняется, так что ошибиться невозможно.
Отсканированный PDF — это другое, имеющее то же расширение файла. Сканер или камера телефона создали изображение каждой страницы, и изображение было обернуто в PDF. В файле нет символов, только пиксели, которые выглядят как символы для человеческого глаза. Извлечение слов из него требует OCR, который отображает страницу и сопоставляет формы с обученной моделью для выбранного вами языка.
Экстрактор проверяет каждую страницу, прежде чем принять решение. Если страница имеет пригодный текстовый слой, этот слой считывается, и результат точен. Если нет, страница отображается как изображение и проходит через тот же OCR-движок, который управляет экстрактором изображений. Файлы, которые смешивают оба метода, получают оба лечения, по одной странице за раз, и сводка результата указывает, какой метод использовался для каждой страницы. Каждый файл читается до 25 страниц на PDF.
Банковские выписки, удостоверения личности и контракты остаются на вашем устройстве
Документы, из которых люди чаще всего хотят извлечь текст, — это те, которые они должны меньше всего загружать. Банковские выписки, расчетные листы, налоговые формы, подписанные контракты, медицинские письма и сканы паспорта или удостоверения личности. Каждый из этих файлов вы не отправили бы по электронной почте незнакомцу, и передача его веб-сайту, который вы нашли в результатах поиска, — это то же самое действие с меньшим количеством шагов.
Этот экстрактор не имеет конечной точки загрузки. Ваш PDF считывается с диска на страницу, открываемую PDF-ридером, работающим в вашем браузере, и преобразуется в текст в памяти. Запросы, которые страница делает, предназначены для ее собственного механизма: самого ридера и, когда страница требует OCR, движка распознавания и языковой модели. Все они обслуживаются с этого сайта, и они только движутся к вам.
Вам не нужно принимать это на веру. Откройте вкладку сети вашего браузера перед тем, как начать запуск, а затем наблюдайте за ней, пока текст появляется. Вы увидите, как механизмы приходят, и ничего, что уносит ваш документ. Это утверждение вы можете проверить за минуту, что больше, чем дает вам политика конфиденциальности.
Что этот инструмент не делает
Эта страница работает только в одном направлении. Она считывает PDF и дает вам простой текст. Она не создает PDF. Она не возвращает искомый PDF с добавленным текстовым слоем. Она не восстанавливает ваш документ как файл текстового процессора с оригинальным макетом. То, что вы получаете, — это слова.
Она также не объединяет, не разделяет, не поворачивает, не сжимает и не защищает паролем ничего. Для всего этого есть сайты, и большинство из них нуждаются в вашем файле на своем сервере, чтобы выполнить работу. Это сделка, которую эта страница создана избегать.
Если вы хотите пойти в другую сторону и превратить фотографии или сканы в один PDF, конвертер JPG в PDF на этом сайте это делает. Он работает в браузере точно так же, как эта страница. Если ваш источник — это скриншот или фотография, а не PDF, экстрактор изображений — это страница, которую вы хотите.
Почему LeanImg?
PDF читается на вашем устройстве, страница за страницей, и текст остается там с ним. Изучите все наши бесплатные инструменты для изображений, чтобы сохранить остальную часть вашего рабочего процесса в браузере тоже.
Ничего не загружается
Банковские выписки, удостоверения личности и контракты — это именно те файлы, которые вы не должны отправлять на сервер незнакомца. Этот инструмент не имеет сервера, на который можно их отправить.
Точно там, где это возможно
Цифровые PDF считываются из своего текстового слоя дословно. Только сканированные страницы проходят через OCR, и каждый результат говорит, какой метод был использован.
Бесплатно и без ограничений
Нет регистрации, нет кредитов, нет водяных знаков и нет платного уровня. До 25 страниц на PDF, сколько угодно PDF по мере необходимости.
Как выглядят числа
Четыре PDF прошли через этот экстрактор с известным заранее текстом. Оценка — это сравнение символ за символом вывода с этим текстом. Три файла были созданы цифровыми, экспортированными прямо из браузера, поэтому символы уже находились внутри них. Сканированный файл был создан путем пропуска скриншота через собственный конвертер JPG в PDF этого сайта, который оставляет изображение страницы и не содержит символов вообще. Последняя строка — это файл на 28 страниц. Он был создан, чтобы преодолеть лимит страниц, поэтому ни одна из них не была оценена на точность.
| Образец | Страницы | Метод | Сходство |
|---|---|---|---|
| Цифровой PDF | 1 из 1 | Текстовый слой | 100.0% |
| Сканированный PDF | 1 из 1 | OCR | 100.0% |
| Трехстраничный цифровой PDF | 3 из 3 | Текстовый слой | 100.0% |
| Большой PDF | 25 из 28 | Текстовый слой | Не оценено |
Два метода произвели эти строки, и файл решает, какой из них использовать. Каждая страница сначала проверяется на наличие текстового слоя, и когда символы там, они считываются дословно без этапа распознавания. Вот где слово 'точный' имеет смысл, и нигде больше на этой странице. Страница без пригодного текстового слоя отображается как изображение и передается тому же движку OCR, который читает скриншоты, поэтому она имеет точность этого движка и его режимы отказа. Файлы, которые смешивают оба, получают оба метода обработки, по одной странице за раз.
Результат сообщает вам, что произошло. PDF, прочитанный полностью из своего текстового слоя, помечается как точный, и карточка не имеет оценочного балла для него. Любой документ с OCR-страницей показывает оценку. Документ более чем из одной страницы также содержит строку, подсчитывающую страницы, прочитанные из текстового слоя, по сравнению со страницами, которые прошли через OCR. Эта оценка — это средневзвешенное значение символов по всему документу, и страницы текстового слоя входят в него на уровне 100. В смешанном файле читайте это как то, насколько текст надежен, а не как хорошо сработал OCR. Строка сводки по страницам сообщает вам, сколько страниц было распознано вообще.
Что загружается при первом использовании
Оба движка работают на вашем компьютере, поэтому они должны сначала загрузиться. Открытие PDF загружает рабочий процесс pdf.js, который составляет около 1.3 МБ. Движок OCR и одна языковая модель загружаются вместе с ним, около 6 МБ в сумме, и они загружаются даже когда каждая страница оказывается цифровой и распознавание никогда не выполняется. Это ненужная загрузка для файла, созданного цифровым способом. Это текущее ограничение, и его исправление в списке.
Все обслуживается с этого сайта, и ничего из стороннего CDN. Ваш браузер кэширует все это, поэтому следующий PDF на этом языке начинается без необходимости что-либо загружать. Документы, созданные с необычными шрифтами, загружают еще один небольшой файл для карт символов, и только эти документы это делают. Ничто не перемещается в другую сторону. Ваш PDF считывается с диска на страницу и открывается в памяти, и ни один запрос не отправляет его наружу.
Где находятся ограничения
Один PDF получает 25 страниц. Большой образец содержит 28 из них, и запуск взял первые 25 и сообщил об этом на карточке результата. Более длинный документ все еще дает вам что-то, и путь через это — разделить файл в PDF-ридере и отправить оставшиеся страницы как второй запуск.
PDF с защитой паролем отклоняется. Его нельзя открыть без пароля, и эта страница не будет запрашивать его. Экстрактор говорит именно это и останавливается. Откройте файл в ридере, который вы уже используете, сохраните копию с удаленным паролем и запустите эту копию.
Порядок чтения — это более тихий лимит. Текстовый слой фиксирует, где находится каждый набор символов на странице, и ничего о том, что это означает, поэтому колонки, боковые панели и сноски могут возвращаться в порядке, который ваш глаз никогда бы не воспринял. Таблицы теряют сетку и приходят как содержимое ячеек в последовательности. Простой текст почти всегда в порядке. Заполненная форма или страница с двумя колонками стоит прочитать, прежде чем на нее полагаться.
Рукописный текст в скане находится за пределами этого движка. Он обучен на печатных символах, и рукописная строка возвращается как шум, похожий на текст. Скан, который смешивает печать с рукописным текстом, дает вам печатную часть и бессмыслицу вместо написанного.
Еще одна граница, которую стоит знать: скан, который уже был обработан другим программным обеспечением, содержит невидимый текстовый слой этого программного обеспечения, и этот инструмент читает его дословно. Результат точен для файла, но не обязательно для бумаги, с которой он был отсканирован.
Часто задаваемые вопросы
В чем разница между цифровым PDF и сканированным PDF?
Цифровой PDF был создан программным обеспечением, поэтому он содержит сами символы. Сканированный PDF — это набор изображений страниц, полученных с помощью сканера или камеры, поэтому он не содержит символов вообще. Эта разница определяет все, что касается результата. Цифровой файл дает вам точный текст. Сканированный файл должен быть распознан, и распознавание очень хорошее на чистых сканах и менее хорошее на кривых, размытых или плохо освещенных. Обычно вы можете определить, какой у вас файл, открыв его в PDF-ридере и попытавшись выделить строку текста мышью. Если выделение подсвечивает слова, значит, есть текстовый слой.
Является ли извлеченный текст точным для цифровых PDF?
Для страниц с реальным текстовым слоем — да. Символы считываются из файла, а не распознаются по изображению, поэтому на них не выполняется OCR, и нечего неправильно прочитать. Порядок чтения — это то, что все еще может вас удивить, потому что текстовый слой хранит, где находится каждый набор символов, а не что он означает, поэтому страница с колонками или боковыми панелями может выйти в порядке, который не соответствует тому, как движется ваш глаз. Сами слова — это слова в файле. Страницы без текстового слоя проходят через OCR, и они имеют обычную точность распознавания.
Сколько страниц я могу извлечь за раз?
До 25 страниц на PDF. Более длинный файл также принимается: первые 25 страниц извлекаются, и уведомление о результате сообщает, сколько страниц было пропущено. Ограничение существует, потому что работа выполняется на вашем оборудовании, и длинный сканированный документ означает один проход OCR на страницу в вашей вкладке браузера. Если вам нужно остальное, разделите файл в PDF-ридере и выполните оставшиеся страницы как второй файл.
Могу ли я извлечь текст из PDF с защитой паролем?
Нет. Зашифрованный PDF не может быть открыт без пароля, и эта страница не запрашивает его и не пытается обойти защиту. Вместо этого вы получаете четкую ошибку вместо пустого результата. Откройте файл в ридере, который вы обычно используете, аутентифицируйтесь так, как вы обычно это делаете, сохраните копию с удаленным паролем и запустите эту копию здесь.
Мой PDF загружается на сервер?
Нет. Файл считывается с вашего диска на страницу и открывается PDF-ридером, который работает в вашем браузере. На этом сайте нет конечной точки загрузки для его получения. Это и есть вся суть документов, которые люди действительно приносят в такой инструмент: банковские выписки, платежные ведомости, налоговые формы, подписанные контракты и сканы удостоверений личности. Наблюдайте за вкладкой сети во время работы, и вы увидите, как ридер и модель OCR приходят, и ничего не уходит с вашим документом.
Какие языки он может читать?
Сторона OCR читает английский, испанский, румынский, арабский, греческий, турецкий, индонезийский, русский и японский. Выберите язык перед извлечением, потому что движок сопоставляет формы с моделью, которую вы выбираете, и неправильная модель читает плохо. Страницы, которые уже имеют текстовый слой, полностью игнорируют настройку, поскольку эти символы считываются из файла такими, какие они есть, независимо от того, на каком языке они написаны.
Могу ли я извлечь текст из нескольких PDF за раз?
Да. Выберите пакет, и файлы обрабатываются последовательно, а не параллельно. Каждый результат появляется, как только его файл завершен, так что вы можете начать читать, пока остальные еще выполняются. Зона перетаскивания показывает лимит для одного запуска. Последовательная обработка сохраняет использование памяти предсказуемым, что особенно важно на телефоне.
Сохраняет ли он таблицы и макет?
Нет. Выходные данные — это простой текст, поэтому таблица возвращается как содержимое ячеек, а не как сетка, и заголовки, сноски и подписи не помечаются как что-либо. Порядок чтения также может отличаться от визуального макета, потому что позиция — это то, что хранит файл, а значение — нет. Простой текст почти всегда передается в правильном порядке. Страницу с боковыми панелями, несколькими колонками или заполненной формой стоит прочитать, прежде чем на него полагаться.
Может ли он читать рукописный текст в сканированном PDF?
Нет, и мы предпочли бы сказать это здесь, чем позволить вам выяснить это с файлом, который имеет значение. Движок OCR обучен на печатных символах. Рукописный текст, подписи и рукописные поля форм находятся за пределами того, что он может сделать, и то, что возвращается от них, — это шум, похожий на текст. Сканированная страница, которая смешивает печать с рукописным текстом, дает вам печатную часть и бессмыслицу, где написано.
В каком формате извлеченный текст?
Обычный текст. Скопируйте его в буфер обмена одной кнопкой или загрузите в виде файла .txt, с разделением страниц и пометками, чтобы вы могли найти свое место в длинном документе. Нет файла текстового процессора, нет поискового PDF и никакого форматирования, перенесенного. Если вам нужны слова где-то еще, вставьте их в документ, таблицу или переводчик.
Как мне превратить изображения в PDF?
Это в другом направлении, и у него есть своя страница на этом сайте. Конвертер JPG в PDF принимает фотографии или сканы и записывает их в один PDF, в вашем браузере, без загрузки. Используйте его, когда у вас есть изображения и вам нужен документ. Используйте эту страницу, когда у вас есть документ и вам нужны слова из него.
Конвертер PDF в текст действительно бесплатен?
Да, бесплатно, без аккаунта и без счетчика использования. Нет регистрации, нет водяных знаков на тексте, нет кредитов и нет платного уровня, который удерживает лучшую версию. Извлечение выполняется на вашем собственном оборудовании, поэтому у нас нет затрат на сервер за файл, которые мы могли бы передать вам.
Работаете с изображениями вместо этого? Извлеките текст из изображений считывает скриншоты, сканы и фотографии документов. Идете в другую сторону? Преобразуйте изображения в PDF с помощью конвертера JPG в PDF.