Ekran görüntüsünden metni nasıl çıkarabilirim, yüklemeden?
Hangi tarayıcı OCR gerçekten okur: altı örnekte ölçülen benzerlik, içinde metin olmayan bir fotoğraftan türettiği 515 karakter ve bir kez ödediğiniz model indirme.
Çoğu OCR sitesi ekran görüntünüzü alır, bir sunucuya gönderir ve orada okur. Bu, bir restoran menüsünün fotoğrafı için uygundur. Ancak bir maaş bordrosu, bir pasaport sayfası veya özel bir sohbetin ekran görüntüsü için farklı bir karar gerektirir. Bizim resimden metne aracı tarayıcı sekmenizde tanıma işlemini gerçekleştirir, böylece dosya diskinizde kalır ve metin yanında görünür.
Motor Tesseract, WebAssembly ile derlenmiş ve sayfa ile birlikte gönderilmiştir. İlk çalıştırmanızda bir işçi betiği, WebAssembly çekirdeği ve bir dil modeli indirilir. Tarayıcınız bu üçünü önbelleğe alır. Sonrasında başka bir şey indirilmez.
Ekran görüntüm yükleniyor mu?
Hayır. Bu kod tabanında alacak bir yükleme uç noktası yok. Araç tarafından yapılan tek ağ trafiği aynı kökenli: İngilizce için toplamda yaklaşık 6 MB olan 3 istek, bunların her biri bu alan adından sunulmaktadır. Dosyanız sayfa içinde çözülür, motoruna piksel olarak verilir ve orada metne dönüştürülür. Bir çalıştırma sırasında ağ sekmesini açarsanız, model parçalarının geldiğini ve görüntünüzü taşıyan hiçbir şeyin olmadığını göreceksiniz. Gizlilik sayfamız topladığımız tek şeyleri listeler: sayfa görüntülemeleri ve anonim araç sayıları.
Mevcut olanlar tam tersine çalışır. Smallpdf ve iLovePDF tanımayı kendi makinelerinde yapar, bu nedenle dosyanızın onlara ulaşması gerekir. Gizlilik sorusuna verdikleri cevap bir saklama vaadi: kopya bir süre sonra silinir. Saklama ifadelerini JPG'den PDF'ye geçişte alıntıladık. Bir saklama vaadi, pasaport taramanızın başkasının diskinin üzerinde ne kadar süre kalacağını söyler. Orada bu soru ortaya çıkmaz.
Gerçek bir ekran görüntüsünde ne kadar doğru?
Bunu ölçtük. Bilinen metin içeren altı örnek, 2026-08-11 tarihinde motor üzerinden geçti ve aşağıdaki puan, çıktının resimde bildiğimiz metinle karakter karakter karşılaştırmasıdır. Örnekler sentetik: bir tarayıcıda render edilmiş HTML sayfaları ve gerçek ekran görüntüleri olarak yakalanmıştır, bozulmuş olanı CSS'de bulanıklaştırılmış ve döndürülmüştür, böylece kötü bir telefon çekimini taklit eder.
| Örnek | Dil | Benzerlik | Güven |
|---|---|---|---|
| Temiz ekran görüntüsü | İngilizce | 100.0% | 95 |
| Yoğun paragraf | İngilizce | 100.0% | 95 |
| Simüle edilmiş bozulmuş çekim | İngilizce | 92.4% | 65 |
| Rusça örnek | Rusça | 100.0% | 96 |
| Japonca örnek | Japonca | 100.0% | 93 |
| İçinde metin olmayan fotoğraf | İngilizce | Türetilmiş 515 karakter metin | 32 |

İki İngilizce örnek %100.0, karakter karakter geri döndü, her ikisi de %95 güvenle. Aynı paragrafın bulanık ve döndürülmüş kopyası %92.4 ve %65 güvenle geldi. Bu, 7.6 benzerlik puanının kaybolduğu anlamına geliyor ve yukarıdaki rakam, nerede gittiğini gösteriyor: açılış kelimeleri bozulmuşken, paragrafın ortası hayatta kalıyor. %65 güven de kartta düşük güven uyarısını tetikler, bu nedenle kopyalamadan önce bilgilendirilirsiniz.
Resimde metin yoksa ne olur?
Bu, diğer OCR sayfalarının atladığı kısım. Motora, yosunlu bir kütük üzerinde kelebeklerin karanlık bir fotoğrafını verdik ve içinde hiçbir yazı yoktu. Hiç var olmayan 515 karakter metin döndürdü. OCR motorlarının yaptığı budur. Karakter şekillerini bulmak için tasarlanmışlardır, bu nedenle tanecik ve doku karakter olarak rapor edilir ve boru hattındaki hiçbir aşama, bir resmin boş olduğunu belirlemez.
Boş bir görüntüyü tespit ettiğimizi iddia etmiyoruz, çünkü bunu yapamayız. Her sonuç, güven puanını taşır ve ortalama 60'ın altına düştüğünde bir uyarı tetiklenir. O fotoğraf 32 puan aldı. Temiz bir ekran görüntüsü 95 puan alır. Bu iki sayı arasındaki mesafe sinyaldir ve metne dokunmadan önce kartta yazılıdır.
Rusça ve Japonca okur mu?
Dokuz dil: İngilizce, İspanyolca, Romence, Arapça, Yunanca, Türkçe, Endonezyaca, Rusça ve Japonca. Çıkarmadan önce birini seçin, çünkü motor, seçtiğiniz modelle şekilleri eşleştirir ve yanlış model kötü okur. Henüz otomatik tespit yok. Her iki Latin dışı örnek de temiz geri döndü, Rusça %100.0 ve güven %96, Japonca %100.0 ve güven %93, boşluk normalleştirildiğinde, çünkü motor Japonca karakterler arasında boşluklar ekler.

Her dil ayrı bir model dosyasıdır, tessdata_fast Tesseract projesinden, diğer her şey gibi bu alan adından sunulmaktadır. Birini eklemek, ilk kez seçtiğinizde yaklaşık 0.6 ile 2 MB arasında bir maliyeti vardır ve toplam dokuz dil yaklaşık 11 MB'dır. Tarayıcınız bunları saklar, bu nedenle her dil için bir kez maliyet vardır ve herhangi bir dilde ikinci çalıştırma hemen başlar.
Bunu ne zaman kullanmamalısınız?
El yazısı. Tesseract projesi bunu açıkça söyler: el yazısına yönlendirebilirsiniz, ancak iyi çalışmaz, çünkü motor basılı metin için tasarlanmıştır. Bir sahnede fotoğraflanan metin diğer zayıf durumdur, dükkan tabelası ve raf etiketi. Telefonunuzun yerleşik metin seçimi bunları daha iyi işler ve el yazısı üzerinde eğitim almış bir hizmet, büyükannenizden gelen bir mektupta bizden daha iyi sonuç alır. Bir bozulmuş paragraf vermektense bunu söylemeyi tercih ederiz.
Diğer her şey için, Tesseract kalite notları örneklerde gördüğümüzle eşleşir: daha büyük ve keskin karakterler daha iyi okunur ve açık bir arka planda koyu metin kolay durumdur. Kaynağı ekran görüntüsü alınabildiği yerden alın. Alınamadığı yerlerde, düzgün ışıkla doğrudan çekim yapın ve çerçeveyi metinle doldurun.
Resimle sonra ne yapmalıyım?
Çıktı düz metindir. Tarayıcının Clipboard API kullanarak butonla kopyalayın. Her görüntü için bir .txt indirin veya tüm grubu tek bir dosya olarak indirin. Resminiz bunlardan etkilenmez. Göndermeden önce daha küçük hale getirilmesi gerekiyorsa, sıkıştırıcı bunu aynı sekmede yapar ve boyutlandırıcı piksel boyutlarını değiştirir. Çıkarma işleminden sonra herhangi birini yapın. Önce bir ekran görüntüsünü küçültmek, karakterlerin yapıldığı pikselleri atar.
Bilmeniz gereken iki zincir. Bir iPhone'dan alınan bir HEIC fotoğrafı doğrudan girer, motor görmeden önce tarayıcı tarafından çözülür, bu nedenle önce yapılacak bir format dönüşümü adımı yoktur. Ve uzun bir ekran görüntüsünden yalnızca bir metin bloğu istiyorsanız, önce kırpıcıdan geçirerek, çıktı istediğiniz kısım olur ve başka bir şey olmaz. Bu sitede yerel olarak çalışan diğer model, hangi piksellerin konu olduğunu belirleyen modeldir.
Elinizdeki en kötü ekran görüntüsünde deneyin. Resimden metne aracı üzerine bırakın, dili seçin, ardından metinden önce güven numarasını okuyun.
PDF'ler hakkında ne olacak?
Bir PDF, bunun uygulanmasından önce ikiye bölünür. Bir kelime işlemci veya tarayıcıdan dışa aktarılan bir dosya, bir metin katmanı taşır, bu nedenle karakterler zaten oradadır ve çıkarmak hiçbir tanıma gerektirmez. Bir tarayıcıdan veya telefondan gelen bir dosya, bir PDF içinde sarılmış bir resimdir ve bir görüntüde olduğu gibi aynı OCR geçişine ihtiyaç duyar. PDF'den metne sayfamız her sayfayı kontrol eder ve seçer, ve hangi sayfaların tam olarak okunduğunu ve hangilerinin tanındığını nasıl belirlediği daha uzun bir yazıdır. Örneklerde, dijital bir dosya ve üç sayfalık bir dijital dosya, her ikisi de metin katmanından %100.0 geri döndü ve bu sitenin kendi JPG'den PDF'ye dönüştürücüsü ile oluşturulmuş bir taranmış sayfa %100.0 geri döndü.

Her dosya için 25 sayfa limiti vardır. Aşırı boyutlu örnek 28 sayfadır ve çalıştırma ilk 25 sayfayı okur ve bununla ilgili bir bildirim basar. PDF okuyucusunda daha uzun olan her şeyi bölün ve geri kalanını ikinci bir çalıştırma olarak gönderin. Başlamadan önce bilmeniz gereken bir şey daha: bir PDF, OCR motoru ve modeli üzerine okuyucu için yaklaşık 1.3 MB çeker ve her sayfa dijital çıkarsa ve tanınması gereken hiçbir şey yoksa, bu OCR indirmesi yine de gerçekleşir.
Gizlilik durumu burada ekran görüntülerine göre daha güçlüdür. Banka ekstreleri, maaş bordroları ve kimlik taramaları, insanların en çok metin çıkarmak istediği belgelerdir ve bunları bir yabancı sunucusuna vermek istemeyeceğiniz belgelerdir. PDF sayfası, resimden metne aracı gibi çalışır, dosya diskinizden sekmeye okunur ve hiçbir şey gönderilmez. Kaynağınız bir PDF ise, her sayfayı ekran görüntüsü almak yerine oradan başlayın.