LeanImg

PDF'den Metne — Ücretsiz Çevrimiçi Metin Çıkarıcı

Dijital veya taranmış bir PDF'den metni tarayıcınızda çıkarın. Ücretsiz, kayıt yok ve PDF'niz asla cihazınızı terk etmez.

Metin çıkarıcı yükleniyor...

Bize teşekkür etmek ister misiniz? Arkadaşlarınıza LeanImg'den bahsedin!

PDF'yi Metne Dönüştürme Nasıl Yapılır

1

PDF'nizi seçin

Dosyayı kutuya bırakın veya cihazınızdan seçin. Dijital PDF'ler, taranmış PDF'ler ve ikisini birleştiren dosyalar hepsi çalışır.

2

Bir dil seçin ve çıkarın

Belgenin dilini seçin, ardından çıkarma işlemini başlatın. Metin katmanı olan sayfalar hemen okunur. OCR'ye ihtiyaç duyan sayfalar birer birer tanınır, her biri indiğinde ilerleme gösterilir.

3

Metni kopyalayın veya indirin

Sonucu okuyun, panonuza kopyalayın veya sayfaları etiketlenmiş bir .txt dosyası olarak kaydedin.

PDF'den metin çıkarma nasıl çalışır

Bir PDF bir konteynerdir ve içindeki şey, metnin nasıl çıktığını belirler. Bir kelime işlemcisinden, bir tarayıcıdan veya bir muhasebe uygulamasından dışa aktarılan bir dosya, bir metin katmanı taşır. Karakterler, sayfadaki konumlarıyla birlikte karakterler olarak saklanır. O katmanı okumak, size dosyanın sakladığı metni tam olarak verir. Hiçbir tanıma adımı çalışmaz, bu nedenle yanlış bir şey yoktur.

Taranmış bir PDF, aynı dosya uzantısını taşıyan farklı bir şeydir. Bir tarayıcı veya telefon kamerası, her sayfanın bir resmini üretti ve resim bir PDF'ye sarıldı. Dosyada karakter yoktur, yalnızca insan gözüne karakter gibi görünen pikseller vardır. İçinden kelimeleri çıkarmak için OCR gerekir, bu sayfayı işler ve seçtiğiniz dil için eğitilmiş bir modelle şekilleri eşleştirir.

Çıkarıcı, karar vermeden önce her sayfayı kontrol eder. Sayfanın kullanılabilir bir metin katmanı varsa, o katman okunur ve sonuç tamdır. Yoksa, sayfa bir görüntü olarak işlenir ve görüntü çıkarıcısını güçlendiren aynı OCR motorundan geçirilir. İkisini birleştiren dosyalar, her sayfa için birer birer her iki işlemi de alır ve sonuçtaki özet, her sayfanın hangi yöntemi kullandığını belirtir. Her dosya, PDF başına 25 sayfaya kadar okunur.

Banka hesap özetleri, kimlikler ve sözleşmeler cihazınızda kalır

İnsanların metin çıkarmak istediği belgeler, yüklemeye en az istekli olmaları gerekenlerdir. Banka hesap özetleri, maaş bordroları, vergi formları, imzalı sözleşmeler, tıbbi mektuplar ve bir pasaport veya kimlik kartının taramaları. Bunların her biri, bir yabancıya e-posta ile göndermeyeceğiniz bir dosyadır ve arama sonuçlarında bulduğunuz bir web sitesine vermek, daha az adımla aynı eylemdir.

Bu çıkarıcının yükleme noktası yoktur. PDF'niz diskinizden sayfaya okunur, tarayıcınızda çalışan bir PDF okuyucu tarafından açılır ve bellekte metne dönüştürülür. Sayfanın yaptığı istekler, kendi makineleri içindir: okuyucu kendisi ve bir sayfanın OCR'ye ihtiyacı olduğunda, tanıma motoru ve dil modeli. Hepsi bu siteden sağlanır ve sadece size doğru hareket eder.

Buna güvenmek zorunda değilsiniz. Bir çalışmaya başlamadan önce tarayıcınızın ağ sekmesini açın, ardından metin görünürken izleyin. Makinelerin geldiğini göreceksiniz ve belgenizi taşıyan hiçbir şey yok. Bu, bir dakikadan kısa sürede kontrol edebileceğiniz bir iddiadır, bu da bir gizlilik politikasının size verdiğinden daha fazladır.

Bu aracın yapmadığı şeyler

Bu sayfa yalnızca bir yönde gider. Bir PDF okur ve size düz metin verir. Bir PDF yazmaz. Eklenmiş bir metin katmanı ile arama yapılabilir bir PDF geri vermez. Belgenizi orijinal düzeni koruyarak bir kelime işlemci dosyası olarak yeniden inşa etmez. Aldığınız şey kelimelerdir.

Ayrıca hiçbir şeyi birleştirmez, bölmez, döndürmez, sıkıştırmaz veya şifre korumaz. Bunun için siteler vardır ve bunların çoğu, işi yapmak için dosyanızı sunucularında bulundurur. Bu sayfanın kaçınmak için inşa edildiği ticaret budur.

Diğer yöne gitmek ve fotoğrafları veya taramaları tek bir PDF'ye dönüştürmek istiyorsanız, bu sitedeki JPG'den PDF'ye dönüştürücü bunu yapar. Bu sayfanın yaptığı gibi tarayıcıda çalışır. Kaynağınız bir PDF yerine bir ekran görüntüsü veya fotoğraf ise, görüntü çıkarıcısı istediğiniz sayfadır.

Neden LeanImg?

PDF, cihazınızda, sayfa sayfa okunur ve metin orada kalır. İş akışınızın geri kalanını da tarayıcıda tutmak için tüm ücretsiz görüntü araçlarımızı keşfedin.

Hiçbir şey Yüklenmez

Banka ekstreleri, kimlikler ve sözleşmeler, bir yabancının sunucusuna göndermemeniz gereken dosyalardır. Bu aracın gönderecek bir sunucusu yoktur.

Mümkün Olduğunca Tam

Dijital PDF'ler, metin katmanlarından kelimesi kelimesine okunur. Sadece taranmış sayfalar OCR'dan geçer ve her sonuç hangi yöntemin kullanıldığını belirtir.

Ücretsiz ve Sınırsız

Kayıt yok, kredi yok, su izi yok ve ücretli bir katman yok. Her PDF için en fazla 25 sayfa, ihtiyaç duyduğunuz kadar PDF.

Sayılar nasıl görünüyor

Dört PDF, metni önceden bilinen bu çıkarıcıdan geçti. Skor, çıktının o metinle karakter karakter karşılaştırmasıdır. Üç dosya dijital olarak doğdu, doğrudan bir tarayıcıdan dışa aktarıldı, bu nedenle karakterler zaten içinde bulunuyordu. Taranmış olan, bu sitenin kendi JPG'den PDF'ye dönüştürücüsü aracılığıyla bir ekran görüntüsü iterek yapıldı, bu da bir sayfanın resmini bırakır ve hiç karakter taşımaz. Son satır, 28 sayfalık bir dosyadır. Sayfa sınırını aşmak için oluşturulmuştur, bu nedenle bunun için doğruluk açısından hiçbir şey puanlanmamıştır.

2026-08-12 tarihinde, masaüstü donanımında gerçek çalışmalardan ölçümler. Süreler kasıtlı olarak dışarıda bırakılmıştır, çünkü bir telefon bu makinadan daha yavaştır. Taranmış satır, temiz sentetik bir yakalamadır; bozulma maliyetleri için, metin sayfasındaki 92.4% satırına bakın.
ÖğeSayfalarYöntemBenzerlik
Dijital doğmuş PDF1 içinden 1Metin katmanı100.0%
Taranmış PDF1 içinden 1OCR100.0%
Üç sayfalık dijital PDF3 içinden 3Metin katmanı100.0%
Büyük PDF25 içinden 28Metin katmanıPuanlanmadı

Bu satırları üreten iki yöntem vardır ve dosya hangi yöntemin çalışacağını belirler. Her sayfa önce bir metin katmanı için kontrol edilir ve karakterler oradaysa, hiç tanıma adımı olmadan kelimesi kelimesine okunur. Burada 'tam' kelimesi geçerlidir ve bu sayfada başka bir yerde yoktur. Kullanılabilir bir metin katmanı olmayan bir sayfa, bir görüntü olarak işlenir ve ekran görüntülerini okuyan aynı OCR motoruna verilir, bu nedenle o motorun doğruluğunu ve hata modlarını taşır. İkisini birleştiren dosyalar, her seferinde bir sayfa olarak her iki tedavi yöntemini alır.

Sonuç, hangi olayın gerçekleştiğini size söyler. Tamamen metin katmanından okunan bir PDF 'tam' olarak etiketlenir ve kart bunun için hiçbir güven puanı taşımaz. İçinde bir OCR sayfası olan herhangi bir belge bir puan gösterir. Birden fazla sayfadan oluşan bir belge de, metin katmanından okunan sayfalar ile OCR'dan geçen sayfalar arasında bir satır taşır. Bu puan, tüm belgede karakter ağırlıklı bir ortalamadır ve metin katmanı sayfaları buna 100 ile girer. Karışık bir dosyada, metnin ne kadarının güvenilir olduğunu okuyun, OCR'nin ne kadar iyi çalıştığını değil. Sayfa başına özet satırı, toplamda kaç sayfanın tanındığını size söyler.

İlk kullanımda neler indirilir

Her iki motor da makinenizde çalışır, bu nedenle önce oraya ulaşmaları gerekir. Bir PDF açmak, yaklaşık 1.3 MB olan pdf.js işçisini alır. OCR motoru ve bir dil modeli bununla birlikte gelir, toplamda yaklaşık 6 MB ve her sayfanın dijital olduğu ve tanımanın hiç çalışmadığı durumlarda bile gelir. Bu, dijital bir dosya için boşa harcanmış bir indirmedir. Bu, mevcut bir sınırlamadır ve bunu düzeltmek listede bulunmaktadır.

Her şey bu siteden sunulur ve üçüncü taraf bir CDN'den hiçbir şey yoktur. Tarayıcınız bunların hepsini önbelleğe alır, bu nedenle o dildeki bir sonraki PDF, hiçbir şey almak zorunda kalmadan başlar. Alışılmadık yazı tipleri ile oluşturulan belgeler, karakter haritaları için bir küçük dosya daha çeker ve yalnızca bu belgeler yapar. Hiçbir şey diğer yöne gitmez. PDF'iniz diskinizden sayfaya okunur ve bellekte açılır ve hiçbir isteğin onu dışarı taşımaz.

Sınırların nerede olduğu

Bir PDF 25 sayfa alır. Büyük öge 28'ini tutar ve çalıştırma ilk 25 sayfayı alır ve sonuç kartında bunu belirtir. Daha uzun bir belge hala size bir şey verir ve yol, dosyayı bir PDF okuyucusunda bölmek ve kalan sayfaları ikinci bir çalıştırma olarak göndermektir.

Şifre korumalı bir PDF reddedilir. Şifresi olmadan açılamaz ve bu sayfa sizden bir şifre istemez. Çıkarıcı tam olarak bunu söyler ve durur. Zaten kullandığınız okuyucuda dosyayı açın, şifresi kaldırılmış bir kopyasını kaydedin ve o kopyayı çalıştırın.

Okuma sırası daha sessiz bir sınırlamadır. Bir metin katmanı, her karakter dizisinin sayfadaki nerede olduğunu kaydeder ve bunun anlamı hakkında hiçbir şey kaydetmez, bu nedenle sütunlar, yan çubuklar ve dipnotlar, gözünüzün asla almayacağı bir sırada geri dönebilir. Tablolar ızgarayı kaybeder ve hücre içerikleri olarak sıralı bir şekilde gelir. Düz yazı neredeyse her zaman iyidir. Doldurulmuş bir form veya iki sütunlu bir sayfa, ona güvenmeden önce okumanız gereken bir değerdir.

Bir taramada el yazısı bu motorun dışında kalır. Basılı karakterler üzerinde eğitilmiştir ve el yazısı bir satır, metin gibi şekillendirilmiş gürültü olarak geri gelir. Baskı ile el yazısını karıştıran bir tarama, basılı kısmı ve yazının yerinde anlamsızlık verir.

Bir sınır daha bilmeye değer: başka bir yazılım tarafından zaten OCR edilmiş bir tarama, o yazılımın görünmez metin katmanını taşır ve bu araç onu kelimesi kelimesine okur. Sonuç, dosyaya tam olarak uyar, tarandığı kağıda değil.

Sıkça Sorulan Sorular

Dijital PDF ile taranmış PDF arasındaki fark nedir?

Dijital PDF, yazılım tarafından üretilmiştir, bu nedenle karakterleri kendisi taşır. Taranmış PDF, bir tarayıcı veya kamera tarafından üretilen sayfa görüntülerinin bir yığınıdır, bu nedenle hiç karakter taşımaz. Bu fark, sonucun her şeyini belirler. Dijital dosya size tam metin verir. Taranmış dosyanın tanınması gerekir ve tanıma, temiz taramalarda çok iyi, eğik, bulanık veya kötü aydınlatılmış olanlarda ise daha az iyidir. Genellikle, bir PDF okuyucusunda dosyayı açarak ve farenizle bir metin satırını seçmeye çalışarak hangi türde olduğunu anlayabilirsiniz. Seçim kelimeleri vurguluyorsa, bir metin katmanı vardır.

Dijital PDF'ler için çıkarılan metin tam mı?

Gerçek bir metin katmanına sahip sayfalar için evet. Karakterler, bir resimden tanınmak yerine dosyadan okunur, bu nedenle üzerinde OCR çalışmaz ve yanlış okunacak bir şey yoktur. Okuma sırası, sizi hala şaşırtabilecek tek şeydir, çünkü metin katmanı, her karakter dizisinin nerede olduğunu saklar, ne anlama geldiğini değil, bu nedenle sütunlar veya yan çubuklar içeren bir sayfa, gözünüzün hareket ettiği şekilde eşleşmeyen bir sırada çıkabilir. Kelimeler kendileri dosyadaki kelimelerdir. Metin katmanı olmayan sayfalar bunun yerine OCR'dan geçer ve bunlar genellikle tanıma doğruluğunu taşır.

Bir seferde kaç sayfa çıkarabilirim?

Bir PDF için en fazla 25 sayfa. Daha uzun bir dosya hala kabul edilir: ilk 25 sayfa çıkarılır ve sonuçta kaç sayfanın dışarıda kaldığını belirten bir bildirim alırsınız. Sınır, çalışmanın kendi donanımınızda çalışmasından kaynaklanır ve uzun bir taranmış belge, tarayıcı sekmenizde her sayfa için bir OCR geçişi anlamına gelir. Geri kalanını istiyorsanız, dosyayı bir PDF okuyucusunda bölün ve kalan sayfaları ikinci bir dosya olarak çalıştırın.

Şifre korumalı bir PDF'den metin çıkarabilir miyim?

Hayır. Şifreli bir PDF, şifresi olmadan açılamaz ve bu sayfa sizden bir şifre istemez veya korumayı aşmaya çalışmaz. Boş bir sonuç yerine net bir hata alırsınız. Dosyayı normalde kullandığınız okuyucuda açın, normalde yaptığınız şekilde kimlik doğrulaması yapın, şifresi kaldırılmış bir kopyasını kaydedin ve o kopyayı buradan çalıştırın.

PDF'im bir sunucuya yükleniyor mu?

Hayır. Dosya, diskinizden sayfaya okunur ve tarayıcınızda çalışan bir PDF okuyucu tarafından açılır. Bu sitede onu alacak bir yükleme noktası yoktur. Bu, insanların aslında bu tür bir araca getirdiği belgeler için tam olarak budur: banka ekstreleri, maaş bordroları, vergi formları, imzalı sözleşmeler ve kimlik taramaları. Bir çalıştırma sırasında ağ sekmesine bakın ve okuyucunun ve OCR modelinin geldiğini göreceksiniz, ve belgenizle birlikte hiçbir şey çıkmayacak.

Hangi dilleri okuyabilir?

OCR tarafı İngilizce, İspanyolca, Romence, Arapça, Yunanca, Türkçe, Endonezyaca, Rusça ve Japonca okur. Çıkarmadan önce dili seçin, çünkü motor, seçtiğiniz modele karşı şekilleri eşleştirir ve yanlış model kötü okur. Zaten bir metin katmanına sahip sayfalar, bu ayarı tamamen göz ardı eder, çünkü bu karakterler, hangi yazı tipinde yazılmış olursa olsun, dosyadan olduğu gibi okunur.

Birden fazla PDF'den aynı anda metin çıkarabilir miyim?

Evet. Bir grup seçin ve dosyalar sıralı olarak işlenir, paralel değil. Her sonuç, dosyası tamamlandığı anda görünür, böylece geri kalanları hala çalışırken okumaya başlayabilirsiniz. Dropzone, tek bir çalıştırma için sınırı gösterir. Ardışık işleme, bellek kullanımını öngörülebilir tutar, bu da en çok bir telefonda önemlidir.

Tabloları ve düzeni korur mu?

Hayır. Çıktı düz metindir, bu nedenle bir tablo, hücre içerikleri olarak geri gelir, bir ızgara olarak değil ve başlıklar, dipnotlar ve açıklamalar hiçbir şey olarak işaretlenmez. Okuma sırası, görsel düzenle de farklılık gösterebilir, çünkü konum, dosyanın sakladığı şeydir ve anlam değildir. Düz yazı neredeyse her zaman doğru sırada gelir. Yan çubuklar, birkaç sütun veya doldurulmuş bir form içeren bir sayfa, ona güvenmeden önce çıktıyı okumanız gereken yerdir.

Taranmış bir PDF'deki el yazısını okuyabilir mi?

Hayır, ve önemli bir dosyayla bunu öğrenmenize izin vermektense burada bunu söylemeyi tercih ederiz. OCR motoru, basılı karakterler üzerinde eğitilmiştir. El yazısı, imzalar ve el yazısı form alanları, onun yapabileceği şeylerin dışında kalır ve bunlardan gelen sonuç, metin gibi şekillendirilmiş gürültüdür. Baskı ile el yazısını karıştıran bir taranmış sayfa, basılı kısmı ve yazının yerinde anlamsızlık verir.

Çıkarılan metin hangi formatta?

Düz metin. Tek bir düğmeyle panonuza kopyalayın veya sayfalar ayrılmış ve etiketlenmiş olarak .txt dosyası olarak indirin, böylece uzun bir belgede yerinizi bulabilirsiniz. Hiçbir kelime işlemci dosyası, arama yapılabilir PDF ve hiçbir biçimlendirme taşınmaz. Kelimeleri başka bir yerde istiyorsanız, bir belgeye, bir elektronik tabloya veya bir çevirmen uygulamasına yapıştırın.

Görüntüleri PDF'ye nasıl dönüştürebilirim?

Bu diğer yöndür ve bu sitenin kendi sayfası vardır. JPG'den PDF'ye dönüştürücü, fotoğrafları veya taramaları alır ve bunları tek bir PDF'ye yazar, tarayıcınızda, hiçbir şey yüklenmeden. Resimleriniz olduğunda ve bir belgeye ihtiyacınız olduğunda bunu kullanın. Bir belgeniz olduğunda ve içinden kelimeleri çıkarmanız gerektiğinde bu sayfayı kullanın.

PDF'den metin dönüştürücü gerçekten ücretsiz mi?

Evet, hesap olmadan ve kullanım sayacı olmadan ücretsizdir. Kayıt yok, metinde su izi yok, kredi yok ve daha iyi bir versiyonu engelleyen ücretli bir katman yok. Çıkarma, kendi donanımınızda çalışır, bu nedenle bize geçirecek bir dosya başına sunucu maliyeti yoktur.

Resimlerle mi çalışıyorsunuz? Görüntülerden metin çıkarın ekran görüntülerini, taramaları ve belgelerin fotoğraflarını okur. Diğer yöne mi gidiyorsunuz? Görüntüleri PDF'ye dönüştürün JPG'den PDF'ye dönüştürücü ile.