LeanImg

PDF în Text — Extractor de Text Online Gratuit

Extrage textul dintr-un PDF digital sau scanat, direct în browserul tău. Gratuit, fără înregistrare și PDF-ul nu părăsește niciodată dispozitivul tău.

Se încarcă extractorul de text...

Vreți să ne mulțumiți? Spuneți-le prietenilor despre LeanImg!

Cum să convertești un PDF în text

1

Alege PDF-ul tău

Aruncă fișierul în casetă sau alege-l de pe dispozitivul tău. PDF-uri digitale, PDF-uri scanate și fișiere care combină cele două funcționează toate.

2

Alege o limbă și extrage

Alege limba documentului, apoi începe extragerea. Paginile cu un strat de text sunt citite imediat. Paginile care necesită OCR sunt recunoscute una după alta, cu progresul arătat pe măsură ce fiecare aterizează.

3

Copiază sau descarcă textul

Citește rezultatul, copiază-l în clipboard-ul tău sau salvează-l ca fișier .txt cu paginile etichetate.

Cum funcționează extragerea textului din PDF

Un PDF este un container, iar ceea ce se află în interiorul său decide cum iese textul. Un fișier exportat dintr-un procesor de texte, un browser sau o aplicație de contabilitate conține un strat de text. Caracterelor le sunt stocate pozițiile pe pagină. Citirea acelui strat îți oferă textul exact așa cum este stocat în fișier. Nu se rulează niciun pas de recunoaștere, așa că nu există nimic de greșit.

Un PDF scanat este o altă chestiune purtând aceeași extensie de fișier. Un scanner sau o cameră de telefon a produs o imagine a fiecărei pagini, iar imaginea a fost înfășurată într-un PDF. Nu există caractere în fișier, doar pixeli care arată ca caractere pentru ochiul uman. Extracția cuvintele din el necesită OCR, care redă pagina și potrivește formele cu un model antrenat pentru limba aleasă.

Extractorul verifică fiecare pagină înainte de a decide. Dacă pagina are un strat de text utilizabil, acel strat este citit și rezultatul este exact. Dacă nu, pagina este redată ca o imagine și trimisă prin același motor OCR care alimentează extractorul de imagini. Fișierele care combină cele două primesc ambele tratamente, o pagină pe rând, iar rezumatul rezultatului indică ce metodă a fost folosită pentru fiecare pagină. Fiecare fișier este citit până la 25 de pagini pe PDF.

Extrasele de cont, ID-urile și contractele rămân pe dispozitivul tău

Documentele din care oamenii doresc cel mai mult să extragă text sunt cele pe care ar trebui să fie cel mai puțin dispuși să le încarce. Extrasele de cont, fluturașele de salariu, formularele fiscale, contractele semnate, scrisorile medicale și scanările unui pașaport sau ale unui card de identitate. Fiecare dintre acestea este un fișier pe care nu l-ai trimite prin email unei persoane străine, iar predarea acestuia unui site pe care l-ai găsit într-un rezultat de căutare este aceeași acțiune cu mai puțini pași.

Acest extractor nu are un punct de încărcare. PDF-ul tău este citit de pe disc în pagină, deschis de un cititor PDF care rulează în browserul tău și transformat în text în memorie. Cererile pe care le face pagina sunt pentru propriile sale mașinării: cititorul în sine și, atunci când o pagină necesită OCR, motorul de recunoaștere și modelul de limbă. Toate acestea sunt servite de acest site și călătoresc doar către tine.

Nu trebuie să iei asta pe credință. Deschide fila de rețea a browserului tău înainte de a începe o rulare, apoi urmărește-o în timp ce textul apare. Vei vedea mașinăriile sosind și nimic transportând documentul tău. Aceasta este o afirmație pe care o poți verifica în mai puțin de un minut, ceea ce este mai mult decât îți oferă o politică de confidențialitate.

Ce nu face acest instrument

Această pagină merge într-o singură direcție. Citește un PDF și îți oferă text simplu. Nu scrie un PDF. Nu returnează un PDF căutabil cu un strat de text adăugat. Nu reconstruiește documentul tău ca un fișier de procesor de texte cu layout-ul original intact. Ceea ce obții sunt cuvintele.

De asemenea, nu combină, nu împarte, nu rotește, nu comprimă și nu protejează nimic cu parolă. Există site-uri pentru toate acestea, iar majoritatea au nevoie de fișierul tău pe serverul lor pentru a face munca. Aceasta este tranzacția pe care această pagină este construită să o evite.

Dacă dorești să mergi în cealaltă direcție și să transformi fotografii sau scanări într-un singur PDF, convertorul JPG în PDF de pe acest site face asta. Funcționează în browser exact așa cum face această pagină. Dacă sursa ta este o captură de ecran sau o fotografie în loc de un PDF, extractorul de imagini este pagina pe care o dorești.

De ce LeanImg?

PDF-ul este citit pe dispozitivul tău, pagină cu pagină, iar textul rămâne acolo cu el. Explorează toate instrumentele noastre de imagine gratuite pentru a menține restul fluxului tău de lucru în browser și.

Nimic nu se încarcă

Extrasele de bancă, ID-urile și contractele sunt exact fișierele pe care nu ar trebui să le trimiți pe serverul unui străin. Acest instrument nu are server la care să le trimită.

Exact acolo unde poate fi

PDF-urile digitale sunt citite din stratul lor de text literal. Numai paginile scanate trec prin OCR, iar fiecare rezultat spune ce metodă a fost folosită.

Gratuit și nelimitat

Fără înscriere, fără credite, fără filigrane și fără nivel plătit. Până la 25 de pagini pe PDF, câte PDF-uri ai nevoie.

Cum arată numerele

Patru PDF-uri au trecut prin acest extractor cu textul lor cunoscut dinainte. Scorul este o comparație caracter cu caracter a ieșirii față de acel text. Trei dintre fișiere au fost născute digitale, exportate direct dintr-un browser, așa că caracterele erau deja în interiorul lor. Cel scanat a fost realizat prin trecerea unui screenshot prin converterul JPG în PDF al acestui site, care lasă o imagine a unei pagini și fără caractere deloc. Ultima linie este un fișier de 28 de pagini. A fost construit pentru a depăși limita de pagini, așa că nimic din el nu a fost evaluat pentru acuratețe.

Măsurători din rulări reale pe 2026-08-12, pe hardware desktop. Duratele sunt lăsate intenționat deoparte, deoarece un telefon este mai lent decât mașina pe care acestea au rulat. Linia scanată este o captură sintetică curată; pentru ce costuri de degradare, vezi linia de 92.4% pe pagina de la imagine la text.
FixturePaginiMetodăSimilaritate
PDF născut-digital1 din 1Strat de text100.0%
PDF scanat1 din 1OCR100.0%
PDF digital de trei pagini3 din 3Strat de text100.0%
PDF supradimensionat25 din 28Strat de textNeevaluat

Două metode au produs acele rânduri, iar fișierul decide care dintre ele rulează. Fiecare pagină este verificată mai întâi pentru un strat de text, iar când caracterele sunt acolo, acestea sunt citite literal fără niciun pas de recunoaștere. Acolo este locul unde aparține cuvântul exact, și nicăieri altundeva pe această pagină. O pagină fără un strat de text utilizabil este redată ca o imagine și predată aceluiași motor OCR care citește screenshot-uri, așa că poartă acuratețea acelui motor și modurile sale de eșec. Fișierele care amestecă cele două primesc ambele tratamente, o pagină la un moment dat.

Rezultatul îți spune ce s-a întâmplat. Un PDF citit complet din stratul său de text este etichetat exact, iar cardul nu poartă un scor de încredere pentru acesta. Orice document cu o pagină OCR în el arată un scor. Un document de mai mult de o pagină poartă de asemenea o linie care numără paginile citite din stratul de text față de paginile care au trecut prin OCR. Acest scor este o medie ponderată pe caractere pe întregul document, iar paginile din stratul de text intră în el la 100. Pe un fișier mixt, citește-l ca cât de mult din text este de încredere, nu ca cât de bine a funcționat OCR. Linia de rezumat pe pagină este ceea ce îți spune câte pagini au fost recunoscute de fapt.

Ce se descarcă la prima utilizare

Ambele motoare rulează pe mașina ta, așa că trebuie să ajungă acolo mai întâi. Deschiderea unui PDF aduce lucrătorul pdf.js, care are aproximativ 1.3 MB. Motorul OCR și un model de limbă vin împreună cu el, aproximativ 6 MB în total, și acestea vin chiar și atunci când fiecare pagină se dovedește a fi digitală și nu se rulează niciun fel de recunoaștere. Aceasta este o descărcare irosită pe un fișier născut-digital. Este o limitare curentă și repararea acesteia este pe listă.

Totul este servit de pe acest site și nimic dintr-un CDN de terță parte. Browserul tău stochează totul, așa că următorul PDF în acea limbă începe fără nimic de descărcat. Documentele construite cu fonturi neobișnuite trag un fișier mic în plus pentru hărțile caracterelor, și doar acele documente fac asta. Nimic nu călătorește în cealaltă direcție. PDF-ul tău este citit de pe disc în pagină și deschis în memorie, iar nicio cerere nu îl scoate afară.

Unde sunt limitele

Un PDF primește 25 de pagini. Fixture-ul supradimensionat conține 28 dintre ele, iar rularea a luat primele 25 și a spus asta pe cardul rezultat. Un document mai lung îți oferă totuși ceva, iar calea de urmat este să împarți fișierul într-un cititor PDF și să trimiți paginile rămase ca o a doua rulare.

Un PDF protejat prin parolă este refuzat. Nu poate fi deschis fără parola sa, iar această pagină nu îți va cere una. Extractorul spune exact asta și se oprește. Deschide fișierul în cititorul pe care îl folosești deja, salvează o copie cu parola eliminată și rulează acea copie.

Ordinea de citire este limita mai tăcută. Un strat de text înregistrează unde se află fiecare grup de caractere pe pagină și nimic despre ce înseamnă vreunul dintre acestea, așa că coloanele, barele laterale și notele de subsol pot reveni într-o ordine pe care ochiul tău nu ar lua-o niciodată. Tabelele își pierd grila și sosesc ca conținutul celulelor lor în secvență. Proza directă este aproape întotdeauna bine. Un formular completat sau o pagină cu două coloane merită citită înainte de a te baza pe ea.

Scrisul de mână într-un scan este în afara acestui motor. Este antrenat pe caractere tipărite, iar o linie scrisă de mână revine ca zgomot modelat ca text. Un scan care amestecă tiparul cu scrisul de mână îți oferă partea tipărită și nonsens în locul scrisului.

Încă o limită demnă de știut: un scan care a fost deja OCR-ed de un alt software poartă stratul de text invizibil al acelui software, iar acest instrument îl citește literal. Rezultatul este exact față de fișier, nu neapărat față de hârtia de pe care a fost scanat.

Întrebări frecvente

Care este diferența dintre un PDF digital și un PDF scanat?

Un PDF digital a fost produs de software, așa că conține caracterele în sine. Un PDF scanat este un stivă de imagini ale paginilor produse de un scanner sau o cameră, așa că nu conține deloc caractere. Această diferență decide totul despre rezultat. Fișierul digital îți oferă text exact. Fișierul scanat trebuie să fie recunoscut, iar recunoașterea este foarte bună pe scanuri curate și mai puțin bună pe cele înclinate, neclare sau prost iluminate. De obicei, poți spune ce tip ai deschizând fișierul într-un cititor PDF și încercând să selectezi o linie de text cu mouse-ul tău. Dacă selecția evidențiază cuvinte, există un strat de text.

Textul extras este exact pentru PDF-urile digitale?

Pentru paginile cu un strat de text real, da. Caracterele sunt citite din fișier mai degrabă decât recunoscute dintr-o imagine, așa că nu se rulează OCR pe ele și nu există nimic de citit greșit. Ordinea de citire este singurul lucru care te poate surprinde, deoarece stratul de text stochează unde se află fiecare grup de caractere, mai degrabă decât ce înseamnă, așa că o pagină cu coloane sau bare laterale poate apărea într-o ordine care nu se potrivește cu modul în care îți miști ochii. Cuvintele în sine sunt cuvintele din fișier. Pagini fără strat de text trec prin OCR în schimb, iar acestea au acuratețea obișnuită a recunoașterii.

Câte pagini pot extrage deodată?

Până la 25 de pagini pe PDF. Un fișier mai lung este încă acceptat: primele 25 de pagini sunt extrase și o notificare pe rezultat îți spune câte pagini au fost omise. Limitarea există deoarece munca se desfășoară pe hardware-ul tău, iar un document scanat lung înseamnă un pas OCR pe pagină în interiorul tab-ului tău de browser. Dacă ai nevoie de restul, împarte fișierul într-un cititor PDF și rulează paginile rămase ca un al doilea fișier.

Pot extrage text dintr-un PDF protejat prin parolă?

Nu. Un PDF criptat nu poate fi deschis fără parola sa, iar această pagină nu îți cere una sau nu încearcă să o ocolească. Primești o eroare clară în loc de un rezultat gol. Deschide fișierul în cititorul pe care îl folosești de obicei, autentifică-te așa cum faci de obicei, salvează o copie cu parola eliminată și rulează acea copie pe aici.

PDF-ul meu este încărcat pe un server?

Nu. Fișierul este citit de pe discul tău în pagină și deschis de un cititor PDF care rulează în browserul tău. Nu există un punct de încărcare pe acest site pentru a-l primi. Acesta este întregul scop pentru documentele pe care oamenii le aduc efectiv la un instrument ca acesta: extrase de bancă, fluturași de plată, formulare fiscale, contracte semnate și scanuri ale unui ID. Urmărește tab-ul de rețea în timpul unei runde și vei vedea cititorul și modelul OCR sosind, și nimic părăsind cu documentul tău.

Ce limbi poate citi?

Partea OCR citește engleză, spaniolă, română, arabă, greacă, turcă, indoneziană, rusă și japoneză. Alege limba înainte de a extrage, deoarece motorul compară formele cu modelul pe care îl alegi și modelul greșit citește prost. Pagini care au deja un strat de text ignoră complet setarea, deoarece acele caractere sunt citite din fișier așa cum sunt, indiferent de scriptul în care sunt scrise.

Pot extrage text din mai multe PDF-uri deodată?

Da. Selectează un lot și fișierele sunt procesate în secvență, mai degrabă decât în paralel. Fiecare rezultat apare imediat ce fișierul său este terminat, așa că poți începe să citești în timp ce restul sunt încă în execuție. Zona de drag-and-drop arată limita pentru o singură rundă. Procesarea secvențială menține utilizarea memoriei previzibilă, ceea ce contează cel mai mult pe un telefon.

Păstrează tabelele și layout-ul?

Nu. Ieșirea este text simplu, așa că un tabel revine ca conținutul celulelor sale, mai degrabă decât ca o grilă, iar anteturile, notele de subsol și titlurile nu sunt marcate ca nimic. Ordinea de citire poate diferi de layout-ul vizual, deoarece poziția este ceea ce stochează fișierul și semnificația nu este. Proza directă trece aproape întotdeauna în ordinea corectă. O pagină cu bare laterale, mai multe coloane sau un formular completat este unde ar trebui să citești ieșirea înainte de a te baza pe ea.

Poate citi scrisul de mână într-un PDF scanat?

Nu, și am prefera să spunem asta aici decât să te lași să descoperi cu un fișier care contează. Motorul OCR este antrenat pe caractere tipărite. Scrisul de mână, semnăturile și câmpurile de formular scrise de mână sunt în afara a ceea ce poate face, iar ceea ce revine de la ele este zgomot modelat ca text. O pagină scanată care amestecă tiparul cu scrisul de mână îți oferă partea tipărită și nonsens acolo unde este scrisul.

În ce format este textul extras?

Text simplu. Copiază-l în clipboard-ul tău cu un buton sau descarcă-l ca fișier .txt, cu paginile separate și etichetate astfel încât să îți poți găsi locul într-un document lung. Nu există fișier de procesare a textului, nu există PDF căutabil și nu se păstrează formatarea. Dacă ai nevoie de cuvinte în altă parte, lipește-le într-un document, un tabel sau un translator.

Cum transform imagini într-un PDF în schimb?

Aceasta este direcția opusă, și are propria sa pagină pe acest site. Converterul JPG în PDF ia fotografii sau scanuri și le scrie într-un singur PDF, în browserul tău, fără nimic încărcat. Folosește-l când ai imagini și ai nevoie de un document. Folosește această pagină când ai un document și ai nevoie de cuvintele din el.

Converterul PDF în text este cu adevărat gratuit?

Da, gratuit fără cont și fără contor de utilizare. Nu există înscriere, nu există filigran pe text, nu există credite și nu există un nivel plătit care să rețină o versiune mai bună. Extracția se desfășoară pe hardware-ul tău, așa că nu există cost pe fișier pe server pe care să ți-l transferăm.

Lucrezi cu imagini în schimb? Extrage text din imagini citește capturi de ecran, scanări și fotografii ale documentelor. Mergi în cealaltă direcție? Transformă imaginile într-un PDF cu convertorul JPG în PDF.