LeanImg

Bagaimana cara mengekstrak teks dari PDF tanpa mengunggahnya?

PDF digital memberikan teksnya secara tepat dan pemindaian harus dikenali. Yang mana yang Anda miliki, apa enam fixture yang diukur, batas 25 halaman dan unduhan yang Anda bayar untuk keduanya.

· Updated

Dua file dapat berakhir dengan .pdf dan memerlukan pekerjaan yang sama sekali berbeda untuk mengambil kata-kata. Salah satunya dicetak ke PDF oleh pengolah kata dan sudah memuat karakter. Yang lainnya adalah foto kertas dalam pembungkus PDF. Halaman PDF ke teks kami membuka file di tab browser Anda, memeriksa setiap halaman dan memilih apa yang diperlukan halaman tersebut. Dokumen Anda tidak pernah meninggalkan disk.

Dua mesin berbagi tab. pdf.js, pembaca PDF dari Mozilla, mem-parsing dokumen dan menyerahkan baik teks yang disimpan atau gambar yang dirender dari halaman. Tesseract yang dikompilasi ke WebAssembly mengenali halaman ketika ternyata itu adalah gambar. Keduanya disajikan dari domain ini dan di-cache setelah run pertama Anda.

Mengapa satu PDF tepat dan yang lainnya dikenali?

PDF adalah wadah, dan spesifikasi ISO 32000-1 memberikan tempat untuk menyimpan operator teks bersama dengan posisinya di halaman. Perangkat lunak yang menghasilkan PDF menulis karakter nyata di sana, sehingga mengambilnya kembali adalah pembacaan. Tidak ada yang ditebak. Itu adalah satu-satunya tempat kata tepat berada.

Sebuah pemindaian sama sekali tidak menyimpan karakter. Sesuatu yang difoto setiap halaman dan gambar tersebut dibungkus dalam PDF, sehingga halaman-halaman tersebut dirender dan diproses melalui OCR satu per satu. Mereka mewarisi akurasi mesin itu dan mode kegagalannya, yang kami ukur pada tangkapan layar di tulisan gambar ke teks. Mesin yang sama, model yang sama.

Bagaimana cara menentukan bahwa sebuah halaman adalah pemindaian?

Dengan menghitung, halaman demi halaman. Ia membaca lapisan teks terlebih dahulu dan menghitung karakter di dalamnya yang bukan spasi. Lebih dari 20 dan halaman diambil secara verbatim dan dilabeli tepat. Dua puluh atau kurang dan halaman dirender dan dikirim ke OCR. Halaman digital yang lahir melewati garis itu dengan margin yang lebar: fixture padat yang kami uji membawa 426 karakter.

Garis tersebut ada untuk menangkap pemindaian yang masih menyimpan objek teks yang tersisa, nomor halaman atau cap header, yang jika tidak akan dikembalikan sebagai seluruh halaman. Ini adalah ambang batas dan bukan tes, jadi ia memiliki tepi. Sebuah pemindaian yang membawa lebih dari 20 karakter teks tersisa melewati garis, dan Anda mendapatkan kop surat yang dilabeli tepat sementara isi tetap terkunci dalam gambar. Ringkasan halaman adalah tempat itu muncul: dokumen yang Anda tahu dipindai melaporkan halaman yang dibaca dari lapisan teks adalah kasus yang perlu diperhatikan.

Pada resolusi berapa halaman yang dipindai dibaca?

200 DPI. PDF mengukur halamannya dalam satuan 72nd inci, jadi merender satu pada skala 1 membuat teks tubuh sekitar 10 piksel tinggi, di bawah sekitar 20 piksel di mana akurasi pengenalan menurun. Merender pada 200 DPI membuat teks tersebut mendekati 28 piksel dan membuat halaman US Letter 1700 x 2200, yang merupakan konvensi pemindaian yang diikuti alat ini.

Ada batas kedua di belakangnya: 4096 piksel di sisi terpanjang, diterapkan setelah skala DPI. Halaman biasa tidak mendekatinya. Halaman yang lebih panjang dari sekitar 20 inci dikurangi untuk muat dan dibaca pada kurang dari 200 DPI, sebanding dengan seberapa jauh ia melewati. Sebuah set rencana atau poster adalah yang mencapai itu, dan tidak ada pada kartu yang memperingatkan Anda.

Apa yang ditunjukkan oleh pengukuran yang dilakukan?

Enam fixture melewati mesin pada 2026-08-12, pada perangkat keras desktop. Kesamaan membandingkan output terhadap teks yang kami ketahui ada dalam dokumen, karakter demi karakter.

Pengukuran nyata, 2026-08-12. Durasi tidak dicantumkan karena ini adalah pengukuran desktop dan ponsel lebih lambat.
FixtureHalaman dibacaMetodeKesamaan
PDF digital lahir1 dari 1Lapisan teks100,0%
Halaman yang dipindai1 dari 1OCR100,0%
PDF digital tiga halaman3 dari 3Lapisan teks100,0%
Dokumen 28 halaman25 dari 28Lapisan tekstidak dinilai
File koruptidak adaDitolaktidak dinilai
File yang dilindungi kata sanditidak adaDitolaktidak dinilai
Tiga kartu hasil PDF: digital.pdf dilabeli Lapisan teks tepat, scanned.pdf membawa skor kepercayaan 93% dari pass OCR-nya dan multipage.pdf merangkum tiga halaman dibaca dari lapisan teks
Kartu tersebut menyebutkan metode sebelum Anda membaca satu kata dari output. digital.pdf kembali dilabeli "Lapisan teks: tepat" tanpa skor yang dilampirkan padanya. scanned.pdf melewati OCR dan melaporkan 93% kepercayaan untuk pass itu. multipage.pdf membaca "3 halaman: 3 dibaca tepat dari lapisan teks, 0 melalui OCR."

Fixture yang dipindai juga kembali pada 100,0%, dan baris itu memerlukan asterisk. Kami membangunnya dengan mendorong gambar melalui konverter JPG ke PDF situs ini, sehingga jenis yang dirender tajam tanpa lensa dan tanpa skew. Pemindai bank Anda adalah kasus yang lebih sulit. Batch empat file dengan dokumen 25 halaman di dalamnya memerlukan 3,0 detik pada jam dinding di desktop.

Apa yang sebenarnya diukur oleh skor kepercayaan?

Ini mengukur pass OCR, dan hanya pada halaman di mana OCR dijalankan. Halaman lapisan teks masuk ke rata-rata pada 100 berdasarkan definisi, jadi file dengan satu pemindaian buruk yang terpendam dalam tumpukan halaman digital tetap melaporkan angka yang nyaman. Pada dokumen campuran, rata-rata itu memberi tahu Anda seberapa banyak teks yang dapat dipercaya. Garis ringkasan halaman adalah yang menjawab pertanyaan OCR. "3 halaman: 3 dibaca tepat dari lapisan teks, 0 melalui OCR" berarti tidak ada yang dikenali. PDF yang dibaca sepenuhnya dari lapisan teksnya tidak membawa skor.

Apa yang terjadi pada halaman 26?

Satu PDF mendapatkan 25 halaman. Fixture oversize memuat 28, dan run membaca 25 pertama dan mencetak pemberitahuan pada kartu yang mengatakan demikian. Tidak ada yang gagal dengan tenang. Untuk apa pun yang lebih panjang, Anda ingin membaginya di pembaca PDF apa pun yang Anda miliki, lalu kirim sisa sebagai run kedua.

Dua jenis file ditolak secara langsung. PDF korup ditolak dengan kata-kata pdf.js sendiri, "Struktur PDF tidak valid.", yang tiba dalam bahasa Inggris di setiap lokal karena berasal dari pembaca daripada terjemahan kami. PDF yang dilindungi kata sandi juga ditolak, dan halaman ini tidak akan meminta Anda untuk kata sandi. Hapus perlindungan di pembaca yang sudah Anda gunakan, lalu jalankan salinannya.

Apakah aman untuk menjalankan laporan bank melalui ini?

Itu adalah kasus yang dibangun untuk alat ini. Slip gaji, kontrak, dan pemindaian ID adalah dokumen yang paling ingin orang ambil teksnya, dan mereka adalah yang terakhir yang Anda inginkan berada di mesin orang asing. Tidak ada titik akhir unggah dalam basis kode ini yang dapat menerima satu. Buka tab jaringan selama run: potongan mesin tiba dari domain ini dan tidak ada yang membawa dokumen Anda pergi.

Layanan PDF besar bekerja sebaliknya. File Anda mencapai mesin mereka terlebih dahulu, dan jawaban mereka untuk pertanyaan privasi adalah janji retensi: salinan dihapus setelah sejumlah jam. Kami mengutip kata-kata itu di artikel pertama dalam seri ini. Itu memberi tahu Anda berapa lama slip gaji Anda berada di disk orang lain. Apakah itu sampai di sana adalah pertanyaan terpisah. Halaman privasi kami mencantumkan apa yang kami kumpulkan.

Kapan ini adalah alat yang salah?

Tulisan tangan. Proyek Tesseract mengatakan dengan jelas: Anda dapat mengarahkannya pada tulisan tangan dan itu tidak akan bekerja dengan baik, karena mesin ini dibangun untuk karakter cetak. Formulir yang dipindai dengan label yang diketik dan jawaban yang ditulis tangan memberikan label dan kebisingan di mana jawaban itu berada. Jarang sepadan dengan run.

Tata letak adalah yang lainnya. Lapisan teks mencatat di mana setiap rangkaian karakter berada dan tidak ada tentang apa pun yang berarti, jadi halaman dua kolom atau blok catatan kaki dapat kembali dalam urutan yang tidak akan pernah Anda ambil. Tabel kehilangan grid dan tiba sebagai isi sel dalam urutan. Prosa lurus hampir selalu baik. Dokumen yang dibangun kembali dengan tata letak asli bukanlah sesuatu yang dihasilkan halaman ini.

Untuk setengah yang dipindai, catatan kualitas Tesseract cocok dengan apa yang ditunjukkan oleh fixture kami: karakter yang lebih besar dan lebih tajam dibaca lebih baik. Jika Anda memotret kertas daripada memindainya, pengambil gambar dengan pemotongan hingga blok teks mengalahkan membungkus foto itu dalam PDF terlebih dahulu.

Mengapa PDF digital masih mengunduh mesin OCR?

Karena jalur itu belum dibagi. Run PDF menarik pekerja pdf.js, 1.262.398 byte dalam build 6.2.108 yang kami kirim, ditambah mesin OCR dan satu model bahasa sekitar 6 MB. Setengah OCR dimuat bahkan ketika setiap halaman ternyata digital lahir dan tidak ada yang perlu dikenali, jadi pada file seperti itu unduhan menjadi terbuang. Ini adalah batasan yang diketahui. Sisa pembaca lebih malas: peta karakter dan codec gambar tiba hanya ketika dokumen membutuhkannya.

Apa yang harus saya lakukan dengan teks setelahnya?

Anda mendapatkan teks biasa. Salin dengan tombol, atau unduh .txt dengan halaman yang dipisahkan dan dilabeli. Jika sumber Anda adalah tangkapan layar, alat gambar ke teks adalah halaman untuk itu, dan enam fixture tangkapan layar yang kami nilai mencakup 515 karakter yang dihasilkan OCR dari foto tanpa tulisan di dalamnya. Menuju arah yang lain, konverter JPG ke PDF membangun dokumen dari gambar dan kompresor menguranginya terlebih dahulu ketika mereka berat.

Cobalah pada PDF terburuk yang Anda miliki. Jatuhkan di halaman PDF ke teks, lalu baca garis ringkasan halaman sebelum Anda membaca teks.