LeanImg

Bagaimana cara mengekstrak teks dari tangkapan layar tanpa mengunggahnya?

Apa yang sebenarnya dibaca oleh OCR browser: kesamaan yang diukur pada enam fixture, 515 karakter yang diciptakannya dari foto tanpa teks di dalamnya dan model unduhan yang Anda bayar sekali.

Sebagian besar situs OCR mengambil tangkapan layar Anda, mengunggahnya ke server dan membacanya di sana. Itu baik untuk foto menu restoran. Ini adalah keputusan yang berbeda untuk slip gaji, halaman paspor atau tangkapan layar dari obrolan pribadi. Alat gambar ke teks kami menjalankan pengenalan di dalam tab browser Anda, sehingga file tetap di disk Anda dan teks muncul di sampingnya.

Mesin ini adalah Tesseract, dikompilasi ke WebAssembly dan dikirimkan dengan halaman. Jalankan pertama Anda mengunduh skrip pekerja, inti WebAssembly dan satu model bahasa. Browser Anda menyimpan ketiganya. Setelah itu tidak ada yang perlu diambil.

Apakah tangkapan layar saya diunggah?

Tidak. Tidak ada titik akhir unggah dalam kode ini yang dapat menerima satu. Satu-satunya lalu lintas jaringan yang dibuat alat ini adalah same-origin: 3 permintaan dengan total sekitar 6 MB untuk bahasa Inggris, setiap permintaan dilayani dari domain ini. File Anda didekodekan di dalam halaman, diserahkan kepada mesin sebagai piksel dan diubah menjadi teks di sana. Buka tab jaringan selama proses berjalan dan Anda akan melihat potongan model tiba dan tidak ada yang membawa gambar Anda pergi. Halaman privasi kami mencantumkan satu-satunya hal yang kami kumpulkan, yaitu tampilan halaman dan jumlah alat anonim.

Para pesaing bekerja sebaliknya. Smallpdf dan iLovePDF keduanya melakukan pengenalan di mesin mereka sendiri, sehingga file Anda harus mencapai mereka sebelum ada yang terjadi. Jawaban mereka untuk pertanyaan privasi adalah janji retensi: salinan dihapus setelah beberapa waktu. Kami mengutip kata-kata retensi mereka dalam panduan JPG ke PDF. Janji retensi memberi tahu Anda berapa lama pemindaian paspor Anda berada di disk orang lain. Itu tidak mengatakan apa-apa tentang apakah itu sampai di sana. Di sini pertanyaan itu tidak muncul.

Seberapa akurat itu pada tangkapan layar yang sebenarnya?

Kami mengukurnya. Enam fixture dengan teks yang diketahui melalui mesin pada 2026-08-11, dan skor di bawah adalah perbandingan karakter demi karakter dari output terhadap teks yang kami tahu ada di gambar. Fixture tersebut bersifat sintetis: halaman HTML yang dirender di browser dan ditangkap sebagai tangkapan layar yang sebenarnya, dengan yang terdegradasi diburamkan dan diputar dalam CSS sehingga meniru tangkapan ponsel yang buruk.

Jalankan nyata di perangkat keras desktop, 2026-08-11. Skor Jepang diambil dengan spasi dinormalisasi. Durasi tidak dicantumkan karena ponsel akan lebih lambat.
FixtureBahasaKesamaanKepercayaan
Tangkapan layar bersihInggris100,0%95
Paragraf padatInggris100,0%95
Tangkapan terdegradasi yang disimulasikanInggris92,4%65
Contoh RusiaRusia100,0%96
Contoh JepangJepang100,0%93
Foto tanpa teks di dalamnyaInggris515 karakter teks yang diciptakan32
Tiga kartu hasil di alat gambar ke teks: clean-screenshot.png dan dense-paragraph.png keduanya dengan kepercayaan 95% dengan teks bersih; degraded.png pada 65% dengan kata-kata yang tidak jelas
Keberhasilan dan kegagalan dalam satu bingkai. Tangkapan terdegradasi di bagian bawah dibuka dengan "ea auaracer recognition" di mana sumbernya mengatakan "Optical character recognition".

Dua dari fixture bahasa Inggris kembali dengan 100,0%, karakter demi karakter, keduanya dengan kepercayaan 95. Salinan yang diburamkan dan diputar dari paragraf yang sama mencapai 92,4% dan kepercayaan 65. Itu adalah 7,6 poin kesamaan yang hilang, dan angka di atas menunjukkan ke mana perginya: kata-kata pembuka teracak sementara bagian tengah paragraf bertahan. Kepercayaan 65 juga memicu peringatan kepercayaan rendah di kartu, jadi Anda diberitahu sebelum Anda menyalin.

Apa yang terjadi jika tidak ada teks di dalam gambar?

Ini adalah bagian yang dilewati oleh halaman OCR lainnya. Kami menyerahkan mesin foto gelap kupu-kupu di atas batang lumut, dan tidak ada tulisan di mana pun di dalamnya. Itu mengembalikan 515 karakter teks yang tidak pernah ada. Itulah yang dilakukan mesin OCR. Mereka dibangun untuk menemukan bentuk karakter, sehingga butiran dan tekstur dilaporkan sebagai karakter, dan tidak ada tahap dalam alur kerja yang memutuskan bahwa gambar itu kosong.

Kami tidak mengklaim dapat mendeteksi gambar kosong, karena kami tidak bisa. Setiap hasil membawa skor kepercayaan, dan peringatan muncul ketika rata-rata turun di bawah 60. Foto itu mendapat skor 32. Tangkapan layar bersih mendapat skor 95. Jarak antara kedua angka tersebut adalah sinyal, dan dicetak di kartu sebelum Anda menyentuh teks.

Apakah ia membaca bahasa Rusia dan Jepang?

Sembilan bahasa: Inggris, Spanyol, Rumania, Arab, Yunani, Turki, Indonesia, Rusia dan Jepang. Pilih satu sebelum Anda mengekstrak, karena mesin mencocokkan bentuk dengan model yang Anda pilih dan model yang salah dibaca dengan buruk. Belum ada deteksi otomatis. Kedua fixture non-Latin kembali bersih, Rusia di 100,0% dan kepercayaan 96, Jepang di 100,0% dan kepercayaan 93 setelah spasi dinormalisasi, karena mesin menyisipkan spasi di antara karakter Jepang.

Kartu hasil untuk russian.png pada 96% kepercayaan dan japanese.png pada 93%, keduanya menunjukkan teks yang diekstrak dengan benar, di atas bilah batch yang membaca Teks diekstrak dari 6 gambar.
Fixture Rusia dan Jepang, dibaca dengan benar dalam batch yang sama dengan yang bahasa Inggris.

Setiap bahasa adalah file model terpisah, tessdata_fast dari proyek Tesseract, dilayani dari domain ini seperti yang lainnya. Menambahkan satu biaya antara sekitar 0,6 dan 2 MB pada saat pertama Anda memilihnya, dan semua sembilan bersama-sama sekitar 11 MB. Browser Anda menyimpannya, jadi ini adalah biaya satu kali per bahasa dan jalur kedua dalam bahasa apa pun dimulai segera.

Kapan Anda tidak boleh menggunakan ini?

Tulisan tangan. Proyek Tesseract mengatakan dengan jelas: Anda dapat mengarahkannya pada tulisan tangan, dan itu tidak akan berfungsi dengan baik, karena mesin dirancang untuk teks cetak. Teks yang difoto dalam suatu adegan adalah kasus lemah lainnya, tanda toko dan label rak. Pemilihan teks bawaan ponsel Anda menangani itu dengan lebih baik, dan layanan yang dilatih pada tulisan tangan akan mengalahkan kami pada surat dari nenek Anda. Kami lebih suka mengatakan itu daripada mengambil jalannya dan memberikan Anda paragraf yang tidak jelas.

Untuk segala hal lainnya, catatan kualitas Tesseract cocok dengan apa yang kami lihat di fixture: karakter yang lebih besar dan lebih tajam dibaca lebih baik, dan teks gelap di latar belakang terang adalah kasus yang mudah. Ambil tangkapan layar dari sumber di mana Anda bisa. Di mana Anda tidak bisa, ambil gambar langsung dengan cahaya merata dan isi bingkai dengan teks.

Apa yang harus saya lakukan dengan gambar setelahnya?

Output adalah teks biasa. Salin dengan tombol, yang menggunakan Clipboard API browser. Unduh .txt per gambar, atau ambil seluruh batch sebagai satu file. Gambar Anda tidak tersentuh oleh salah satu dari itu. Jika harus lebih kecil sebelum Anda mengirimkannya, kompresor melakukan itu di tab yang sama dan pengubah ukuran mengubah dimensi piksel. Lakukan salah satu setelah ekstraksi. Mengecilkan tangkapan layar terlebih dahulu membuang piksel tempat karakter dibuat.

Dua rantai yang perlu diketahui. Foto HEIC dari iPhone langsung masuk, didekodekan oleh browser sebelum mesin melihatnya, jadi tidak ada langkah konversi format yang perlu dilakukan terlebih dahulu. Dan jika Anda hanya ingin satu blok teks dari tangkapan layar yang panjang, jalankan melalui pemotong terlebih dahulu, sehingga output adalah bagian yang Anda minta dan tidak ada yang lain. Model lain yang berjalan secara lokal di situs ini adalah yang memutuskan piksel mana yang menjadi subjek.

Cobalah pada tangkapan layar terburuk yang Anda miliki. Jatuhkan di alat gambar ke teks, pilih bahasa, lalu baca angka kepercayaan sebelum teks.

Bagaimana dengan PDF?

Sebuah PDF terpisah menjadi dua sebelum semua ini berlaku. File yang diekspor dari pengolah kata atau browser membawa lapisan teks, sehingga karakter sudah ada di dalamnya dan menariknya keluar tidak melibatkan pengenalan sama sekali. File yang berasal dari pemindai atau ponsel adalah gambar yang dibungkus dalam PDF, dan memerlukan proses OCR yang sama seperti gambar. Halaman PDF kami memeriksa setiap halaman dan memilih, dan bagaimana ia memutuskan halaman mana yang dibaca dengan tepat dan mana yang dikenali adalah tulisan yang lebih panjang. Pada fixture, file digital yang lahir dan file digital tiga halaman keduanya kembali dengan 100,0% langsung dari lapisan teks, dan halaman yang dipindai yang dibuat dengan konverter JPG ke PDF situs ini sendiri kembali dengan 100,0% melalui OCR.

Tiga kartu hasil PDF menunjukkan ekstraksi lapisan teks, ekstraksi OCR dan ringkasan halaman.
digital.pdf kembali diberi label "Lapisan teks: tepat" dengan paragraf secara verbatim. scanned.pdf melalui OCR, dan kartu melaporkan kepercayaan 93% untuk proses itu. multipage.pdf membaca "3 halaman: 3 dibaca tepat dari lapisan teks, 0 melalui OCR."

Ada batas 25 halaman per file. Fixture oversized adalah 28 halaman, dan proses membaca 25 halaman pertama dan mencetak pemberitahuan yang mengatakan demikian. Pisahkan apa pun yang lebih panjang di pembaca PDF dan kirim sisanya sebagai jalur kedua. Satu hal lagi yang perlu diketahui sebelum Anda mulai: sebuah PDF menarik sekitar 1,3 MB untuk pembaca di atas mesin OCR dan model, dan unduhan OCR itu masih terjadi ketika setiap halaman ternyata digital dan tidak ada yang perlu dikenali.

Kasus privasi lebih kuat di sini daripada untuk tangkapan layar. Pernyataan bank, slip gaji dan pemindaian ID adalah dokumen yang paling ingin orang ambil teksnya, dan mereka adalah yang paling tidak ingin Anda serahkan ke server orang asing. Halaman PDF bekerja seperti alat gambar ke teks, dengan file dibaca dari disk Anda ke dalam tab dan tidak ada yang dikirim ke mana pun. Jika sumber Anda adalah PDF, mulailah di sana daripada mengambil tangkapan layar setiap halaman.