PDF naar Tekst — Gratis Online Tekst Extractor
Haal de tekst uit een digitale of gescande PDF, direct in je browser. Gratis, geen registratie en de PDF verlaat nooit je apparaat.
Wil je ons bedanken? Vertel je vrienden over LeanImg!
Hoe een PDF naar Tekst te Converteren
Kies je PDF
Drop het bestand in de doos of kies het van je apparaat. Digitale PDF's, gescande PDF's en bestanden die de twee mixen werken allemaal.
Kies een taal en extraheer
Kies de taal van het document en begin dan met de extractie. Pagina's met een tekstlaag worden direct gelezen. Pagina's die OCR nodig hebben worden één voor één herkend, met voortgang die wordt weergegeven naarmate elke pagina binnenkomt.
Kopieer of download de tekst
Lees het resultaat, kopieer het naar je klembord of sla het op als een .txt-bestand met de pagina's gelabeld.
Hoe PDF naar tekst extractie werkt
Een PDF is een container, en wat erin zit bepaalt hoe de tekst eruit komt. Een bestand geëxporteerd vanuit een tekstverwerker, een browser of een boekhoudapp bevat een tekstlaag. De tekens worden opgeslagen als tekens, samen met hun positie op de pagina. Het lezen van die laag geeft je de tekst precies zoals het bestand het opslaat. Er draait geen herkenningsstap, dus er is niets dat fout kan gaan.
Een gescande PDF is een andere zaak met dezelfde bestandsextensie. Een scanner of een telefooncamera produceerde een afbeelding van elke pagina, en de afbeelding werd verpakt in een PDF. Er zijn geen tekens in het bestand, alleen pixels die eruitzien als tekens voor een menselijk oog. Woorden eruit halen vereist OCR, dat de pagina weergeeft en vormen vergelijkt met een getraind model voor de taal die je kiest.
De extractor controleert elke pagina voordat hij beslist. Als de pagina een bruikbare tekstlaag heeft, wordt die laag gelezen en is het resultaat exact. Als dat niet het geval is, wordt de pagina weergegeven als een afbeelding en verzonden via dezelfde OCR-engine die de afbeelding extractor aandrijft. Bestanden die de twee mixen krijgen beide behandelingen, één pagina tegelijk, en de samenvatting op het resultaat geeft aan welke methode elke pagina gebruikte. Elk bestand wordt gelezen tot 25 pagina's per PDF.
Bankafschriften, ID's en contracten blijven op je apparaat
De documenten waar mensen het meest tekst uit willen halen zijn de documenten waarvan ze het minst bereid zouden moeten zijn om te uploaden. Bankafschriften, loonstroken, belastingformulieren, ondertekende contracten, medische brieven en scans van een paspoort of een identiteitskaart. Elk van die bestanden zou je niet naar een vreemde e-mailen, en het overhandigen aan een website die je in een zoekresultaat hebt gevonden is dezelfde handeling met minder stappen.
Deze extractor heeft geen upload-eindpunt. Je PDF wordt van de schijf in de pagina gelezen, geopend door een PDF-lezer die in je browser draait en omgezet in tekst in het geheugen. De verzoeken die de pagina doet zijn voor zijn eigen machine: de lezer zelf en, wanneer een pagina OCR nodig heeft, de herkenningsengine en het taalmodel. Al deze worden van deze site geleverd, en ze reizen alleen naar jou toe.
Je hoeft dat niet op geloof te nemen. Open het netwerktabblad van je browser voordat je een run start, en kijk ernaar terwijl de tekst verschijnt. Je zult de machine zien aankomen en niets dat je document wegneemt. Dat is een claim die je in minder dan een minuut kunt controleren, wat meer is dan een privacybeleid je biedt.
Wat deze tool niet doet
Deze pagina gaat maar één richting op. Het leest een PDF en geeft je platte tekst. Het schrijft geen PDF. Het geeft geen doorzoekbare PDF terug met een toegevoegde tekstlaag. Het bouwt je document niet opnieuw op als een tekstverwerkerbestand met de oorspronkelijke lay-out intact. Wat je krijgt zijn de woorden.
Het voegt ook niets samen, splitst niets, roteert niets, comprimeert niets of beschermt niets met een wachtwoord. Er zijn sites voor dat alles, en de meeste hebben je bestand op hun server nodig om het werk te doen. Dat is de ruil waar deze pagina voor is gebouwd om te vermijden.
Als je de andere kant op wilt gaan en foto's of scans in een enkele PDF wilt omzetten, doet de JPG naar PDF converter op deze site dat. Het draait in de browser precies zoals deze pagina doet. Als je bron een screenshot of een foto is in plaats van een PDF, is de afbeelding extractor de pagina die je wilt.
Waarom LeanImg?
De PDF wordt op je apparaat gelezen, pagina voor pagina, en de tekst blijft daar met het. Verken al onze gratis afbeeldingshulpmiddelen om de rest van je workflow ook in de browser te houden.
Niets Uploads
Bankafschriften, ID's en contracten zijn precies de bestanden die je niet naar de server van een vreemde moet sturen. Deze tool heeft geen server om ze naartoe te sturen.
Exact Waar Het Kan Zijn
Digitale PDF's worden letterlijk gelezen vanuit hun tekstlaag. Alleen gescande pagina's gaan door OCR, en elk resultaat zegt welke methode is gebruikt.
Gratis en Onbeperkt
Geen aanmelding, geen credits, geen watermerken en geen betaald niveau. Tot 25 pagina's per PDF, zoveel PDF's als je nodig hebt.
Hoe de cijfers eruit zien
Vier PDF's zijn door deze extractor gegaan met hun tekst van tevoren bekend. De score is een karakter-voor-karakter vergelijking van de output met die tekst. Drie van de bestanden waren digitaal geboren, rechtstreeks geëxporteerd vanuit een browser, dus de karakters zaten al in hen. De gescande was gemaakt door een screenshot door de JPG naar PDF-converter van deze site te duwen, wat een afbeelding van een pagina achterlaat en helemaal geen karakters. De laatste rij is een bestand van 28 pagina's. Het was gebouwd om de pagina limiet te overschrijden, dus geen van deze werd gescoord op nauwkeurigheid.
| Fixture | Pagina's | Methode | Gelijkenis |
|---|---|---|---|
| Geboren digitale PDF | 1 van 1 | Tekstlaag | 100.0% |
| Gescande PDF | 1 van 1 | OCR | 100.0% |
| Drie-pagina digitale PDF | 3 van 3 | Tekstlaag | 100.0% |
| Oversized PDF | 25 van 28 | Tekstlaag | Niet gescoord |
Twee methoden produceerden die rijen, en het bestand bepaalt welke er draait. Elke pagina wordt eerst gecontroleerd op een tekstlaag, en wanneer de karakters daar zijn, worden ze letterlijk gelezen zonder enige herkenningsstap. Dat is waar het woord exact thuishoort, en nergens anders op deze pagina. Een pagina zonder bruikbare tekstlaag wordt weergegeven als een afbeelding en overhandigd aan dezelfde OCR-engine die screenshots leest, dus het draagt de nauwkeurigheid van die engine en zijn foutmodi. Bestanden die de twee mixen krijgen beide behandelingen, één pagina tegelijk.
Het resultaat vertelt je wat er is gebeurd. Een PDF die volledig vanuit zijn tekstlaag is gelezen, wordt gemarkeerd als exact, en de kaart draagt geen vertrouwensscore voor het. Elk document met een OCR-pagina erin toont een score. Een document van meer dan één pagina draagt ook een regel die het aantal pagina's telt dat is gelezen vanuit de tekstlaag tegen de pagina's die door OCR zijn gegaan. Die score is een karakter-gewogen gemiddelde over het hele document, en tekstlaag pagina's komen erin op 100. Op een gemengd bestand, lees het als hoeveel van de tekst betrouwbaar is, niet als hoe goed OCR het deed. De per-pagina samenvattingsregel is wat je vertelt hoeveel pagina's er überhaupt zijn herkend.
Wat er gedownload wordt bij eerste gebruik
Beide engines draaien op je machine, dus ze moeten er eerst komen. Het openen van een PDF haalt de pdf.js worker op, die ongeveer 1.3 MB is. De OCR-engine en één taamodel komen samen met het, ongeveer 6 MB samen, en ze komen zelfs naar beneden wanneer elke pagina blijkt digitaal te zijn en er nooit herkenning draait. Dat is een verspilde download op een geboren-digitaal bestand. Het is een huidige beperking en het oplossen ervan staat op de lijst.
Alles wordt geserveerd vanaf deze site en niets daarvan van een derde partij CDN. Je browser cacheert alles, dus de volgende PDF in die taal begint met niets om op te halen. Documenten gebouwd met ongebruikelijke lettertypen trekken nog een klein bestand voor de karakterkaarten, en alleen die documenten doen dat. Niets reist de andere kant op. Je PDF wordt van de schijf gelezen in de pagina en geopend in het geheugen, en geen verzoek draagt het eruit.
Waar de limieten zijn
Één PDF krijgt 25 pagina's. De oversized fixture houdt er 28 van vast, en de run nam de eerste 25 en zei dat op de resultaatkaart. Een langer document geeft je nog steeds iets, en de weg erdoor is om het bestand in een PDF-lezer te splitsen en de resterende pagina's als een tweede run te verzenden.
Een met een wachtwoord beveiligde PDF wordt geweigerd. Het kan niet worden geopend zonder het wachtwoord, en deze pagina zal je er niet om vragen. De extractor zegt precies dat en stopt. Open het bestand in de lezer die je al gebruikt, sla een kopie op met het wachtwoord verwijderd en voer die kopie uit.
De leesvolgorde is de stillere limiet. Een tekstlaag registreert waar elke reeks karakters zich op de pagina bevindt en niets over wat het ook maar betekent, dus kolommen, zijbalken en voetnoten kunnen terugkomen in een volgorde die je ogen nooit zouden nemen. Tabellen verliezen het raster en komen terug als hun celinhoud in volgorde. Rechte proza is bijna altijd goed. Een ingevuld formulier of een pagina met twee kolommen is het waard om te lezen voordat je erop vertrouwt.
Handschrift in een scan valt buiten deze engine. Het is getraind op gedrukte karakters, en een handgeschreven regel komt terug als ruis in de vorm van tekst. Een scan die print met handschrift mengt, geeft je het gedrukte deel en nonsens in plaats van het schrijven.
Een andere grens die het waard is om te weten: een scan die al door andere software is OCR'd, draagt de onzichtbare tekstlaag van die software, en deze tool leest het letterlijk. Het resultaat is exact voor het bestand, niet noodzakelijk voor het papier waar het van is gescand.
Veelgestelde Vragen
Wat is het verschil tussen een digitale PDF en een gescande PDF?
Een digitale PDF is geproduceerd door software, dus het bevat de karakters zelf. Een gescande PDF is een stapel pagina-afbeeldingen geproduceerd door een scanner of een camera, dus het bevat helemaal geen karakters. Dat verschil bepaalt alles over het resultaat. Het digitale bestand geeft je exacte tekst. Het gescande bestand moet worden herkend, en de herkenning is erg goed bij schone scans en minder goed bij scheve, vage of slecht verlichte scans. Je kunt meestal vertellen welke soort je hebt door het bestand te openen in een PDF-lezer en te proberen een regel tekst met je muis te selecteren. Als de selectie woorden markeert, is er een tekstlaag.
Is de geëxtraheerde tekst exact voor digitale PDF's?
Voor pagina's met een echte tekstlaag, ja. De karakters worden uit het bestand gelezen in plaats van herkend uit een afbeelding, dus er draait geen OCR op hen en er is niets om verkeerd te lezen. De leesvolgorde is het enige dat je nog kan verrassen, omdat de tekstlaag opslaat waar elke reeks karakters zich bevindt in plaats van wat het betekent, dus een pagina met kolommen of zijbalken kan in een volgorde komen die niet overeenkomt met de manier waarop je ogen bewegen. De woorden zelf zijn de woorden in het bestand. Pagina's zonder tekstlaag gaan in plaats daarvan door OCR, en die hebben de gebruikelijke herkenningsnauwkeurigheid.
Hoeveel pagina's kan ik tegelijk extraheren?
Tot 25 pagina's per PDF. Een langer bestand wordt nog steeds geaccepteerd: de eerste 25 pagina's worden geëxtraheerd en een melding over het resultaat vertelt je hoeveel pagina's zijn weggelaten. De limiet is er omdat het werk op je eigen hardware draait, en een lang gescand document betekent één OCR-pass per pagina in je browser-tab. Als je de rest nodig hebt, splits het bestand in een PDF-lezer en voer de resterende pagina's als een tweede bestand uit.
Kan ik tekst extraheren uit een met een wachtwoord beveiligde PDF?
Nee. Een versleutelde PDF kan niet worden geopend zonder het wachtwoord, en deze pagina vraagt je er niet om of probeert de bescherming te omzeilen. Je krijgt een duidelijke foutmelding in plaats van een leeg resultaat. Open het bestand in de lezer die je normaal gebruikt, authenticeer op de manier die je normaal doet, sla een kopie op met het wachtwoord verwijderd en voer die kopie hier door.
Wordt mijn PDF geüpload naar een server?
Nee. Het bestand wordt van je schijf gelezen in de pagina en geopend door een PDF-lezer die in je browser draait. Er is geen upload-eindpunt op deze site om het te ontvangen. Dat is het hele punt voor de documenten die mensen daadwerkelijk naar een tool zoals deze brengen: bankafschriften, loonstroken, belastingformulieren, ondertekende contracten en scans van een ID. Kijk naar het netwerktabblad tijdens een run en je zult de lezer en het OCR-model zien aankomen, en niets dat je document verlaat.
Welke talen kan het lezen?
De OCR-kant leest Engels, Spaans, Roemeens, Arabisch, Grieks, Turks, Indonesisch, Russisch en Japans. Kies de taal voordat je extraheren, omdat de engine vormen vergelijkt met het model dat je kiest en het verkeerde model slecht leest. Pagina's die al een tekstlaag hebben, negeren de instelling volledig, aangezien die karakters uit het bestand worden gelezen zoals ze zijn, ongeacht in welk schrift ze zijn geschreven.
Kan ik tekst extraheren uit meerdere PDF's tegelijk?
Ja. Selecteer een batch en de bestanden worden sequentieel verwerkt in plaats van parallel. Elk resultaat verschijnt zodra het bestand is voltooid, zodat je kunt beginnen met lezen terwijl de rest nog steeds draait. De dropzone toont de limiet voor een enkele run. Sequentiële verwerking houdt het geheugengebruik voorspelbaar, wat vooral belangrijk is op een telefoon.
Behouden ze tabellen en lay-out?
Nee. De output is platte tekst, dus een tabel komt terug als de inhoud van de cellen in plaats van een raster, en koppen, voetnoten en bijschriften worden niet gemarkeerd als iets. De leesvolgorde kan ook verschillen van de visuele lay-out, omdat positie is wat het bestand opslaat en betekenis niet. Rechte proza komt bijna altijd in de juiste volgorde door. Een pagina met zijbalken, meerdere kolommen of een ingevuld formulier is waar je de output moet lezen voordat je erop vertrouwt.
Kan het handschrift in een gescande PDF lezen?
Nee, en we zouden liever hier zeggen dan dat je het ontdekt met een bestand dat ertoe doet. De OCR-engine is getraind op gedrukte karakters. Handschrift, handtekeningen en handgeschreven formulier velden vallen buiten wat het kan doen, en wat daaruit komt is ruis in de vorm van tekst. Een gescande pagina die print met handschrift mengt, geeft je het gedrukte deel en nonsens waar het schrijven is.
In welk formaat is de geëxtraheerde tekst?
Platte tekst. Kopieer het naar je klembord met één knop of download het als een .txt-bestand, met de pagina's gescheiden en gelabeld zodat je je plek in een lang document kunt vinden. Er is geen tekstverwerkerbestand, geen doorzoekbare PDF en geen opmaak die is overgedragen. Als je de woorden ergens anders nodig hebt, plak ze in een document, een spreadsheet of een vertaler.
Hoe zet ik afbeeldingen om in een PDF?
Dat is de andere richting, en het heeft zijn eigen pagina op deze site. De JPG naar PDF-converter neemt foto's of scans en schrijft ze in een enkele PDF, in je browser, zonder iets te uploaden. Gebruik het wanneer je afbeeldingen hebt en een document nodig hebt. Gebruik deze pagina wanneer je een document hebt en de woorden eruit wilt halen.
Is de PDF naar tekst converter echt gratis?
Ja, gratis zonder account en zonder gebruiksstatistieken. Er is geen aanmelding, geen watermerk op de tekst, geen credits en geen betaald niveau dat een betere versie tegenhoudt. De extractie draait op je eigen hardware, dus er zijn geen kosten per bestand die we aan jou doorgeven.
Werken met afbeeldingen in plaats daarvan? Extraheer tekst uit afbeeldingen leest screenshots, scans en foto's van documenten. De andere kant op? Zet afbeeldingen om in een PDF met de JPG naar PDF converter.