Cum pot extrage text dintr-un PDF fără a-l încărca?
Un PDF digital își oferă textul exact, iar un scan trebuie să fie recunoscut. Ce tip ai, ce șase dispozitive măsurate au făcut, limita de 25 de pagini și descărcarea pentru care plătești în ambele cazuri.
· Updated
Două fișiere pot avea ambele extensia .pdf și necesită lucrări complet diferite pentru a obține cuvintele. Unul a fost imprimat în PDF de un procesor de text și deja conține caracterele. Celălalt este o fotografie a unei pagini de hârtie într-un ambalaj PDF. Pagina noastră PDF la text deschide fișierul în tab-ul tău de browser, verifică fiecare pagină și selectează ce are nevoie acea pagină. Documentul tău nu părăsește niciodată discul.
Două motoare împărtășesc tab-ul. pdf.js, cititorul PDF de la Mozilla, analizează documentul și predă fie textul stocat, fie o imagine redată a paginii. Tesseract compilat în WebAssembly recunoaște o pagină atunci când se dovedește a fi o imagine. Ambele sunt servite din acest domeniu și sunt cache-uite după prima ta rulare.
De ce un PDF este exact și altul este recunoscut?
Un PDF este un container, iar specificația ISO 32000-1 îi oferă un loc pentru a stoca operatorii de text împreună cu poziția lor pe pagină. Software-ul care generează un PDF scrie caractere reale acolo, astfel că recuperarea lor este o citire. Nimic nu este ghicit. Asta este singura loc unde cuvântul exact își are locul.
Un scan nu conține deloc caractere. Ceva a fotografiat fiecare pagină și imaginea a fost înfășurată într-un PDF, astfel că acele pagini sunt redimensionate și procesate prin OCR una câte una. Ele moștenesc acuratețea acelui motor și modurile sale de eșec, pe care le-am măsurat pe capturi de ecran în articolul despre imagine la text. Același motor, aceleași modele.
Cum decide că o pagină este un scan?
Prin numărare, pagină cu pagină. Citește mai întâi stratul de text și numără caracterele din el care nu sunt spații. Mai mult de 20 și pagina este preluată literal și etichetată exact. Douăzeci sau mai puțin și pagina este redată și trimisă la OCR. O pagină digitală nativă depășește acea limită cu o marjă largă: dispozitivul dens pe care îl testăm are 426 de caractere.
Linia este acolo pentru a prinde scanul care încă deține un obiect de text rătăcit, un număr de pagină sau un ștampilă de antet, care altfel ar fi fost returnat ca întreaga pagină. Este un prag și nu un test, astfel că are un avantaj. Un scan care conține mai mult de 20 de caractere de text rătăcit depășește linia, iar tu primești antetul etichetat exact în timp ce corpul rămâne blocat în imagine. Rezumatul paginii este locul unde apare acest lucru: un document pe care știi că este scanat raportând paginile citite din stratul de text este cazul de analizat.
La ce rezoluție este citită o pagină scanată?
200 DPI. Un PDF măsoară paginile sale în unități de a 72-a parte dintr-un inch, astfel că redarea uneia la scară 1 pune textul de bază la aproximativ 10 pixeli înălțime, sub cei aproximativ 20 de pixeli unde acuratețea recunoașterii scade. Redarea la 200 DPI pune acel text aproape de 28 de pixeli și face o pagină de tip US Letter de 1700 pe 2200, care este convenția de scanare pe care acest instrument o urmează.
Există un al doilea plafon în spatele său: 4096 de pixeli pe cel mai lung side, aplicat după scala DPI. O pagină obișnuită nu se apropie de acesta. O pagină mai lungă de aproximativ 20 de inci este redimensionată pentru a se potrivi și citită la mai puțin de 200 DPI, în proporție cu cât a depășit. Un set de plan sau un poster este ceea ce atinge acest lucru, și nimic de pe card nu te avertizează.
Ce au arătat rulările măsurate?
Șase dispozitive au trecut prin motor pe 2026-08-12, pe hardware desktop. Similaritatea compară ieșirea cu textul pe care știm că era în document, caracter cu caracter.
| Dispozitiv | Pagini citite | Metodă | Similaritate |
|---|---|---|---|
| PDF digital nativ | 1 din 1 | Strat de text | 100,0% |
| Pagină scanată | 1 din 1 | OCR | 100,0% |
| PDF digital de trei pagini | 3 din 3 | Strat de text | 100,0% |
| Document de 28 de pagini | 25 din 28 | Strat de text | neevaluat |
| Fișier corupt | niciunul | Respins | neevaluat |
| Fișier protejat prin parolă | niciunul | Respins | neevaluat |

Dispozitivul scanat a revenit la 100,0% de asemenea, iar acea linie necesită un asterisc. L-am construit împingând o imagine prin convertorul JPG în PDF al acestui site, astfel că este tipar redat clar fără lentilă și fără distorsiune. Scannerul băncii tale este cazul mai greu. Un lot de patru fișiere cu documentul de 25 de pagini a durat 3,0 secunde de ceas pe desktop.
Ce măsoară de fapt scorul de încredere?
Măsoară trecerea OCR, și doar pe paginile unde a rulat OCR. Pagini din stratul de text intră în medie la 100 prin definiție, astfel că un fișier cu un scan prost îngropat într-un stivă de pagini digitale raportează totuși un număr confortabil. Pe un document mixt, acea medie îți spune cât de mult din text este de încredere. Linia de rezumat a paginii este ceea ce răspunde întrebării OCR. "3 pagini: 3 citite exact din stratul de text, 0 prin OCR" înseamnă că nimic nu a fost recunoscut. Un PDF citit complet din stratul său de text nu poartă un scor.
Ce se întâmplă la pagina 26?
Un PDF are 25 de pagini. Dispozitivul supradimensionat conține 28, iar rularea a citit primele 25 și a imprimat o notificare pe card spunând asta. Nimic nu eșuează în tăcere. Pentru orice mai lung, vei dori să-l împarți în orice cititor PDF ai, apoi să trimiți restul ca o a doua rulare.
Două tipuri de fișiere sunt refuzate complet. Un PDF corupt este respins cu formularea proprie a pdf.js, "Structură PDF invalidă.", care ajunge în engleză pe fiecare localizare deoarece provine de la cititor mai degrabă decât de la traducerile noastre. Un PDF protejat prin parolă este de asemenea refuzat, iar această pagină nu te va întreba pentru parolă. Elimină protecția în cititorul pe care îl folosești deja, apoi rulează copia.
Este sigur să rulezi un extras de cont bancar prin asta?
Acesta este cazul pentru care instrumentul a fost construit. Fluturașii de salariu, contractele și scanurile unui ID sunt documentele din care oamenii doresc cel mai mult să extragă text, și sunt ultimele pe care ai vrea să le ai pe mașina unui străin. Nu există un punct de încărcare în acest cod care ar putea primi unul. Deschide tab-ul de rețea în timpul unei rulări: bucățile motorului sosesc din acest domeniu și nimic nu îți ia documentul.
Serviciile mari PDF funcționează invers. Fișierul tău ajunge mai întâi pe mașinile lor, iar răspunsul lor la întrebarea despre confidențialitate este o promisiune de păstrare: copia este ștearsă după un anumit număr de ore. Am citat acea formulare în primul articol din această serie. Îți spune cât timp fluturașul tău stă pe discul altcuiva. Dacă ajunge acolo este o întrebare separată. Pagina noastră de confidențialitate listează ce colectăm.
Când este acest lucru instrumentul greșit?
Scrierea de mână. Proiectul Tesseract spune asta clar: poți să-l îndrepți spre scrierea de mână și nu va funcționa foarte bine, deoarece motorul a fost construit pentru caractere tipărite. Un formular scanat cu etichete tipărite și răspunsuri scrise de mână îți oferă etichetele și zgomotul acolo unde au fost răspunsurile. Rareori merită rularea.
Aspectul este celălalt. Un strat de text înregistrează unde se află fiecare secvență de caractere și nimic despre ce înseamnă vreunul dintre acestea, astfel că o pagină cu două coloane sau un bloc de note de subsol poate reveni într-o ordine pe care ochiul tău nu ar lua-o niciodată. Tabelele pierd grila și sosesc ca conținuturi de celule în secvență. Proza dreaptă este aproape întotdeauna în regulă. Un document reconstruit cu aspectul original nu este ceva ce această pagină produce.
Pentru jumătatea scanată, notițele de calitate Tesseract se potrivesc cu ceea ce au arătat dispozitivele noastre: caractere mai mari și mai clare sunt citite mai bine. Dacă fotografiezi hârtie în loc să o scanezi, extractorul de imagini cu o decupare până la blocul de text depășește înfășurarea acelei fotografii într-un PDF mai întâi.
De ce un PDF digital încă descarcă un motor OCR?
Pentru că acel drum nu a fost încă împărțit. O rulare PDF trage lucrătorul pdf.js, 1.262.398 de bytes în build-ul 6.2.108 pe care îl livrăm, plus motorul OCR și un model de limbă de aproximativ 6 MB. Acea parte OCR se încarcă chiar și atunci când fiecare pagină se dovedește a fi digital nativă și nimic nu trebuie recunoscut, astfel că pentru un fișier de acest tip descărcarea este irosită. Este o limitare cunoscută. Restul cititorului este mai leneș: hărțile de caractere și codecurile de imagine sosesc doar atunci când un document are nevoie de ele.
Ce fac cu textul după aceea?
Primești text simplu. Copiază-l cu butonul, sau descarcă un .txt cu paginile separate și etichetate. Dacă sursa ta este o captură de ecran, instrumentul de la imagine la text este pagina pentru asta, iar cele șase dispozitive de captură de ecran pe care le-am evaluat acoperă cele 515 caractere pe care OCR le-a inventat dintr-o fotografie fără scriere. În direcția opusă, convertorul JPG în PDF construiește un document din imagini, iar compresorul le reduce mai întâi când sunt grele.
Încearcă-l pe cel mai prost PDF pe care îl ai. Aruncă-l pe pagina PDF la text, apoi citește linia de rezumat a paginii înainte de a citi textul.