PDF'den metni nasıl çıkarırım, yüklemeden?
Dijital bir PDF metnini tam olarak verirken, bir taramanın tanınması gerekir. Elinizde hangisi var, altı ölçülen aparat ne yaptı, 25 sayfa sınırı ve her durumda ödediğiniz indirme.
· Updated
İki dosya .pdf ile bitebilir ve kelimeleri çıkarmak için tamamen farklı işlemler gerektirir. Biri bir kelime işlemci ile PDF'ye yazdırılmıştır ve zaten karakterleri içerir. Diğeri ise bir PDF sarmalayıcısında kağıdın fotoğrafıdır. PDF'den metne sayfamız dosyayı tarayıcı sekmenizde açar, her sayfayı kontrol eder ve o sayfanın ihtiyaç duyduğu metni alır. Belgeniz diskinizden asla çıkmaz.
İki motor sekmeyi paylaşır. pdf.js, Mozilla'nın PDF okuyucusu, belgeyi ayrıştırır ve ya saklanan metni ya da sayfanın işlenmiş resmini teslim eder. WebAssembly'ye derlenmiş Tesseract, bir sayfanın resim olduğunu anladığında onu tanır. Her ikisi de bu alan adından sunulur ve ilk çalıştırmanızdan sonra önbelleğe alınır.
Neden bir PDF tam ve diğeri tanınmış?
PDF bir konteynerdir ve ISO 32000-1 spesifikasyonu metin operatörlerini sayfadaki konumlarıyla birlikte saklayacak bir yer sağlar. PDF oluşturan yazılım oraya gerçek karakterler yazar, bu nedenle onları geri almak bir okumadır. Hiçbir şey tahmin edilmez. Kesin kelimesinin ait olduğu tek yer burasıdır.
Bir tarama hiç karakter içermez. Her sayfanın fotoğrafı çekildi ve resim bir PDF'ye sarıldı, bu nedenle o sayfalar işlenir ve birer birer OCR'den geçirilir. O motorun doğruluğunu ve hata modlarını miras alırlar, bunları ekrandan metin çıkarma yazısında ekran görüntülerinde ölçtük. Aynı motor, aynı modeller.
Bir sayfanın tarama olduğunu nasıl karar veriyor?
Her sayfayı sayarak. Önce metin katmanını okur ve içindeki boşluk olmayan karakterleri sayar. 20'den fazla ise sayfa kelimesi kelimesine alınır ve kesin olarak etiketlenir. Yirmi veya daha az ise sayfa işlenir ve OCR'ye gönderilir. Doğal dijital bir sayfa bu çizgiyi geniş bir marjla temizler: test ettiğimiz yoğun aparat 426 karakter taşır.
Bu çizgi, hala bir kayıp metin nesnesi, bir sayfa numarası veya bir başlık damgası içeren taramayı yakalamak içindir; aksi takdirde bu, tüm sayfa olarak geri verilecektir. Bu bir eşik ve bir test değil, bu nedenle bir kenarı vardır. 20'den fazla kayıp metin karakteri taşıyan bir tarama çizgiyi temizler ve siz kesin olarak etiketlenmiş antetli kağıdı alırsınız, oysa gövde resimde kilitli kalır. Sayfa özeti, bunun nerede göründüğüdür: tarandığını bildiğiniz bir belgenin metin katmanından okunan sayfaları rapor etmesi, bakılması gereken durumdur.
Taranmış bir sayfa hangi çözünürlükte okunur?
200 DPI. Bir PDF sayfalarını 72'de bir inç biriminde ölçer, bu nedenle 1 ölçekle birini işlemek, gövde metnini yaklaşık 10 piksel yüksekliğinde yapar, tanıma doğruluğunun düştüğü yaklaşık 20 pikselin altında. 200 DPI'da işlemek, o metni yaklaşık 28 piksel yüksekliğinde yapar ve bir ABD Letter sayfasını 1700 x 2200 boyutuna getirir; bu, bu aracın takip ettiği tarama konvansiyonudur.
Arkasında ikinci bir tavan var: en uzun kenarda 4096 piksel, DPI ölçeğinden sonra uygulanır. Sıradan bir sayfa buna yakın değildir. Yaklaşık 20 inçten daha uzun bir sayfa, sığacak şekilde ölçeklendirilir ve 200 DPI'dan daha az bir çözünürlükte okunur, ne kadar fazla geçtiğine bağlı olarak. Bir plan seti veya bir poster bunu etkiler ve kartta sizi uyaran hiçbir şey yoktur.
Ölçülen çalışmalarda ne gösterdi?
Altı aparat 2026-08-12'de masaüstü donanımında motordan geçti. Benzerlik, çıktıyı bildiğimiz metinle karşılaştırır, karakter karakter.
| Aparat | Okunan sayfalar | Yöntem | Benzerlik |
|---|---|---|---|
| Doğal dijital PDF | 1 of 1 | Metin katmanı | 100.0% |
| Taranmış sayfa | 1 of 1 | OCR | 100.0% |
| Üç sayfalık dijital PDF | 3 of 3 | Metin katmanı | 100.0% |
| 28 sayfalık belge | 25 of 28 | Metin katmanı | puanlanmadı |
| Bozuk dosya | hiçbiri | Reddedildi | puanlanmadı |
| Şifre korumalı dosya | hiçbiri | Reddedildi | puanlanmadı |

Taranmış aparat da %100.0 geri geldi ve o satırın bir yıldız işaretine ihtiyacı var. Bunu, bu sitenin kendi JPG'den PDF'ye dönüştürücüsü aracılığıyla bir görüntüyü iterek oluşturduk, bu nedenle lens veya eğrilik olmadan keskin işlenmiş bir yazı tipidir. Bankanızın tarayıcısı daha zor bir durumdur. 25 sayfalık belgeyi içeren dört dosyalık bir grup, masaüstünde 3.0 saniye duvar saati aldı.
Güven puanı aslında neyi ölçer?
OCR geçişini ölçer ve yalnızca OCR'nin çalıştığı sayfalarda. Metin katmanı sayfaları tanım gereği ortalamaya 100 ile girer, bu nedenle dijital sayfalar yığınında gömülü bir kötü tarama içeren bir dosya yine de rahat bir sayı rapor eder. Karışık bir belgede o ortalama, metnin ne kadarının güvenilir olduğunu size söyler. Sayfa özeti, OCR sorusunu yanıtlayan şeydir. "3 sayfa: metin katmanından 3 kesin olarak okundu, 0 OCR üzerinden" hiçbir şeyin tanınmadığı anlamına gelir. Tamamen metin katmanından okunan bir PDF, bir puan taşımaz.
26. sayfada ne olur?
Bir PDF 25 sayfa alır. Aşırı boyutlu aparat 28 sayfa tutar ve çalışma ilk 25 sayfayı okur ve kartta bunu belirten bir bildirim basar. Hiçbir şey sessizce başarısız olmaz. Daha uzun bir şey için, sahip olduğunuz herhangi bir PDF okuyucusunda bölmek isteyeceksiniz, ardından kalanı ikinci bir çalışma olarak gönderin.
İki tür dosya tamamen reddedilir. Bozuk bir PDF, pdf.js'nin kendi ifadeleriyle, "Geçersiz PDF yapısı." ile reddedilir; bu, okuyucudan geldiği için her yerel dilde İngilizce olarak gelir. Şifre korumalı bir PDF de reddedilir ve bu sayfa sizden şifre istemez. Zaten kullandığınız okuyucuda korumayı kaldırın, ardından kopyayı çalıştırın.
Bir banka ekstresini bunun üzerinden çalıştırmak güvenli mi?
Bu, aracın oluşturulma amacıdır. Maaş bordroları, sözleşmeler ve kimlik taramaları, insanların en çok metin çıkarmak istediği belgelerdir ve bunlar bir yabancının makinesinde durmasını istemeyeceğiniz son belgelerdir. Bu kod tabanında bir yükleme noktası yoktur. Bir çalışma sırasında ağ sekmesini açın: motor parçaları bu alan adından gelir ve belgenizi hiç kimseye taşımaz.
Büyük PDF hizmetleri tam tersine çalışır. Dosyanız önce onların makinelerine ulaşır ve gizlilik sorusuna verdikleri yanıt bir saklama vaadidir: kopya, belirli bir saat sayısından sonra silinir. Bu ifadeyi bu serideki ilk makalede alıntıladık. Bu, maaş bordronuzun başka birinin diskinde ne kadar süre kaldığını size söyler. Oraya ulaşması ayrı bir sorudur. Gizlilik sayfamız, topladıklarımızı listeler.
Bu yanlış araç ne zaman?
El yazısı. Tesseract projesi bunu açıkça söylüyor: el yazısına yönlendirebilirsiniz ve çok iyi çalışmayacaktır, çünkü motor basılı karakterler için oluşturulmuştur. Yazılı etiketlere ve el yazısı cevaplara sahip bir taranmış form, size etiketleri ve cevapların olduğu yerde gürültüyü verir. Çalışmaya değmez.
Düzen diğer bir konudur. Bir metin katmanı, her karakter dizisinin nerede bulunduğunu kaydeder ve bunun ne anlama geldiği hakkında hiçbir şey içermez, bu nedenle iki sütunlu bir sayfa veya bir dipnot bloğu, gözünüzün asla almayacağı bir sırayla geri gelebilir. Tablo, ızgarayı kaybeder ve hücre içerikleri sırasıyla gelir. Düz yazı neredeyse her zaman iyidir. Orijinal düzenle yeniden inşa edilmiş bir belge, bu sayfanın ürettiği bir şey değildir.
Taranmış kısım için, Tesseract kalite notları aparatlarımızın gösterdiği ile eşleşir: daha büyük ve keskin karakterler daha iyi okunur. Kağıdı taramak yerine fotoğraflıyorsanız, görüntü çıkarıcı ve metin bloğuna kadar kesim, önce o fotoğrafı PDF'ye sarmaktan daha iyidir.
Dijital bir PDF neden hala bir OCR motoru indiriyor?
Çünkü o yol henüz ayrılmamıştır. Bir PDF çalışması, 6.2.108 sürümünde 1.262.398 bayt olan pdf.js işçisini çeker, artı OCR motoru ve yaklaşık 6 MB'lık bir dil modeli. O OCR yarısı, her sayfanın doğal dijital çıktığı ve hiçbir şeyin tanınması gerekmediği durumda bile yüklenir, bu nedenle böyle bir dosyada indirme boşa gider. Bu bilinen bir sınırlamadır. Okuyucunun geri kalanı daha tembeldir: karakter haritaları ve görüntü kodekleri yalnızca bir belgeye ihtiyaç duyulduğunda gelir.
Metinle ne yapmalıyım?
Düz metin alırsınız. Bunu butonla kopyalayın veya sayfaları ayrılmış ve etiketlenmiş bir .txt dosyası indirin. Kaynağınız bir ekran görüntüsü ise, görüntüden metne aracı bunun sayfasıdır ve puanladığımız altı ekran görüntüsü aparatı, içinde yazı olmayan bir fotoğraftan OCR'nin icat ettiği 515 karakteri kapsar. Diğer yönde, JPG'den PDF'ye dönüştürücü, görüntülerden bir belge oluşturur ve sıkıştırıcı, ağır olduklarında önce onları küçültür.
Elinizdeki en kötü PDF'de deneyin. PDF'den metne sayfasına bırakın, ardından metni okumadan önce sayfa özeti satırını okuyun.