PDF ke Teks — Ekstraktor Teks Online Gratis
Ambil teks dari PDF digital atau yang dipindai, langsung di browser Anda. Gratis, tanpa pendaftaran dan PDF tidak pernah meninggalkan perangkat Anda.
Ingin berterima kasih kepada kami? Ceritakan kepada teman-teman Anda tentang LeanImg!
Cara Mengonversi PDF ke Teks
Pilih PDF Anda
Jatuhkan file ke dalam kotak atau pilih dari perangkat Anda. PDF digital, PDF yang dipindai, dan file yang mencampurkan keduanya semuanya berfungsi.
Pilih bahasa dan ekstrak
Pilih bahasa dokumen, lalu mulai ekstraksi. Halaman dengan lapisan teks dibaca langsung. Halaman yang membutuhkan OCR dikenali satu per satu, dengan kemajuan ditampilkan saat masing-masing mendarat.
Salin atau unduh teks
Baca hasilnya, salin ke clipboard Anda atau simpan sebagai file .txt dengan halaman yang diberi label.
Cara kerja ekstraksi PDF ke teks
PDF adalah wadah, dan apa yang ada di dalamnya menentukan bagaimana teks keluar. File yang diekspor dari pengolah kata, browser atau aplikasi akuntansi membawa lapisan teks. Karakter disimpan sebagai karakter, bersama dengan posisinya di halaman. Membaca lapisan itu memberi Anda teks persis seperti yang disimpan file. Tidak ada langkah pengenalan yang dijalankan, jadi tidak ada yang bisa salah.
PDF yang dipindai adalah hal yang berbeda dengan ekstensi file yang sama. Sebuah pemindai atau kamera ponsel menghasilkan gambar dari setiap halaman, dan gambar tersebut dibungkus dalam PDF. Tidak ada karakter dalam file, hanya piksel yang terlihat seperti karakter bagi mata manusia. Mengambil kata-kata dari situ membutuhkan OCR, yang merender halaman dan mencocokkan bentuk dengan model terlatih untuk bahasa yang Anda pilih.
Extractor memeriksa setiap halaman sebelum memutuskan. Jika halaman memiliki lapisan teks yang dapat digunakan, lapisan itu dibaca dan hasilnya tepat. Jika tidak, halaman dirender sebagai gambar dan dikirim melalui mesin OCR yang sama yang menggerakkan ekstraktor gambar. File yang mencampurkan keduanya mendapatkan kedua perlakuan, satu halaman pada satu waktu, dan ringkasan pada hasil menunjukkan metode yang digunakan setiap halaman. Setiap file dibaca hingga 25 halaman per PDF.
Laporan bank, ID dan kontrak tetap di perangkat Anda
Dokumen yang paling ingin orang ambil teksnya adalah yang seharusnya paling sedikit ingin diunggah. Laporan bank, slip gaji, formulir pajak, kontrak yang ditandatangani, surat medis dan pemindaian paspor atau kartu ID. Setiap file tersebut adalah file yang tidak akan Anda kirim melalui email kepada orang asing, dan menyerahkannya kepada situs web yang Anda temukan dalam hasil pencarian adalah tindakan yang sama dengan lebih sedikit langkah.
Extractor ini tidak memiliki titik akhir unggah. PDF Anda dibaca dari disk ke halaman, dibuka oleh pembaca PDF yang berjalan di browser Anda dan diubah menjadi teks dalam memori. Permintaan yang dibuat halaman adalah untuk mesinnya sendiri: pembaca itu sendiri dan, ketika halaman membutuhkan OCR, mesin pengenalan dan model bahasa. Semua itu dilayani dari situs ini, dan mereka hanya bergerak menuju Anda.
Anda tidak perlu mengambil itu dengan iman. Buka tab jaringan browser Anda sebelum Anda memulai, lalu lihat saat teks muncul. Anda akan melihat mesin tiba dan tidak ada yang membawa dokumen Anda pergi. Itu adalah klaim yang dapat Anda periksa dalam waktu kurang dari satu menit, yang lebih dari yang diberikan kebijakan privasi kepada Anda.
Apa yang tidak dilakukan alat ini
Halaman ini hanya berjalan satu arah. Ini membaca PDF dan memberi Anda teks biasa. Ini tidak menulis PDF. Ini tidak mengembalikan PDF yang dapat dicari dengan lapisan teks yang ditambahkan. Ini tidak membangun kembali dokumen Anda sebagai file pengolah kata dengan tata letak asli yang utuh. Apa yang Anda dapatkan adalah kata-kata.
Ini juga tidak menggabungkan, memisahkan, memutar, mengompres, atau melindungi kata sandi apa pun. Ada situs untuk semua itu, dan sebagian besar dari mereka memerlukan file Anda di server mereka untuk melakukan pekerjaan. Itu adalah perdagangan yang dihindari halaman ini.
Jika Anda ingin pergi ke arah sebaliknya dan mengubah foto atau pemindaian menjadi satu PDF, konverter JPG ke PDF di situs ini melakukan itu. Ini berjalan di browser persis seperti halaman ini. Jika sumber Anda adalah tangkapan layar atau foto daripada PDF, ekstraktor gambar adalah halaman yang Anda inginkan.
Mengapa LeanImg?
PDF dibaca di perangkat Anda, halaman demi halaman, dan teks tetap di sana bersamanya. Jelajahi semua alat gambar gratis kami untuk menjaga sisa alur kerja Anda di browser juga.
Tidak Ada yang Diunggah
Laporan bank, ID, dan kontrak adalah file yang seharusnya tidak Anda kirim ke server orang asing. Alat ini tidak memiliki server untuk mengirimkannya.
Tepat Di Mana Bisa
PDF digital dibaca dari lapisan teksnya secara verbatim. Hanya halaman yang dipindai yang melewati OCR, dan setiap hasil mengatakan metode mana yang digunakan.
Gratis dan Tanpa Batas
Tidak ada pendaftaran, tidak ada kredit, tidak ada watermark dan tidak ada tingkat berbayar. Hingga 25 halaman per PDF, sebanyak PDF yang Anda butuhkan.
Bagaimana angka terlihat
Empat PDF telah melalui ekstraktor ini dengan teks mereka diketahui sebelumnya. Skor adalah perbandingan karakter demi karakter dari output terhadap teks tersebut. Tiga dari file lahir digital, diekspor langsung dari browser, jadi karakter sudah ada di dalamnya. Yang dipindai dibuat dengan mendorong tangkapan layar melalui konverter JPG ke PDF milik situs ini, yang meninggalkan gambar halaman dan tidak ada karakter sama sekali. Baris terakhir adalah file 28 halaman. Itu dibangun untuk mencapai batas halaman, jadi tidak ada yang dinilai untuk akurasi.
| Fixture | Halaman | Metode | Kesamaan |
|---|---|---|---|
| PDF lahir digital | 1 dari 1 | Lapisan teks | 100.0% |
| PDF yang dipindai | 1 dari 1 | OCR | 100.0% |
| PDF digital tiga halaman | 3 dari 3 | Lapisan teks | 100.0% |
| PDF oversize | 25 dari 28 | Lapisan teks | Tidak dinilai |
Dua metode menghasilkan baris tersebut, dan file menentukan metode mana yang dijalankan. Setiap halaman diperiksa untuk lapisan teks terlebih dahulu, dan ketika karakter ada, mereka dibaca secara verbatim tanpa langkah pengenalan sama sekali. Di situlah kata tepat berada, dan tidak di tempat lain di halaman ini. Halaman tanpa lapisan teks yang dapat digunakan dirender sebagai gambar dan diserahkan kepada mesin OCR yang sama yang membaca tangkapan layar, jadi ia membawa akurasi mesin itu dan mode kegagalannya. File yang mencampur keduanya mendapatkan kedua perlakuan, satu halaman pada satu waktu.
Hasilnya memberi tahu Anda mana yang terjadi. PDF yang dibaca sepenuhnya dari lapisan teksnya diberi label tepat, dan kartu tidak membawa skor kepercayaan untuk itu. Setiap dokumen dengan halaman OCR di dalamnya menunjukkan skor. Dokumen lebih dari satu halaman juga membawa garis yang menghitung halaman yang dibaca dari lapisan teks dibandingkan dengan halaman yang melewati OCR. Skor itu adalah rata-rata berbobot karakter di seluruh dokumen, dan halaman lapisan teks masuk ke dalamnya pada 100. Pada file campuran, bacalah sebagai seberapa banyak teks yang dapat dipercaya, bukan seberapa baik OCR melakukannya. Garis ringkasan per halaman adalah yang memberi tahu Anda berapa banyak halaman yang dikenali sama sekali.
Apa yang diunduh pada penggunaan pertama
Kedua mesin berjalan di mesin Anda, jadi mereka harus sampai di sana terlebih dahulu. Membuka PDF mengambil pekerja pdf.js, yang sekitar 1,3 MB. Mesin OCR dan satu model bahasa datang bersamanya, sekitar 6 MB bersama-sama, dan mereka datang bahkan ketika setiap halaman ternyata digital dan tidak ada pengenalan yang pernah berjalan. Itu adalah unduhan yang terbuang pada file yang lahir digital. Ini adalah batasan saat ini dan memperbaikinya ada dalam daftar.
Semua dilayani dari situs ini dan tidak ada dari CDN pihak ketiga. Browser Anda menyimpan semua itu, jadi PDF berikutnya dalam bahasa itu dimulai tanpa ada yang perlu diambil. Dokumen yang dibangun dengan font yang tidak biasa menarik satu file kecil lagi untuk peta karakter, dan hanya dokumen tersebut yang melakukannya. Tidak ada yang bergerak ke arah sebaliknya. PDF Anda dibaca dari disk ke halaman dan dibuka dalam memori, dan tidak ada permintaan yang membawanya keluar.
Di mana batasnya
Satu PDF mendapatkan 25 halaman. Fixture oversize menampung 28 dari mereka, dan proses mengambil 25 pertama dan mengatakan demikian pada kartu hasil. Dokumen yang lebih panjang masih memberi Anda sesuatu, dan cara untuk melaluinya adalah dengan memisahkan file di pembaca PDF dan mengirim halaman yang tersisa sebagai proses kedua.
PDF yang dilindungi kata sandi ditolak. Itu tidak dapat dibuka tanpa kata sandinya, dan halaman ini tidak akan meminta Anda untuk satu. Ekstraktor mengatakan tepat itu dan berhenti. Buka file di pembaca yang sudah Anda gunakan, simpan salinan dengan kata sandi dihapus dan jalankan salinan itu.
Urutan baca adalah batas yang lebih tenang. Lapisan teks mencatat di mana setiap rangkaian karakter berada di halaman dan tidak ada tentang apa pun yang berarti, jadi kolom, sidebar, dan catatan kaki dapat kembali dalam urutan yang tidak akan pernah diambil mata Anda. Tabel kehilangan grid dan tiba sebagai konten selnya secara berurutan. Prosa langsung hampir selalu baik. Formulir yang diisi atau halaman dua kolom layak dibaca sebelum Anda mengandalkannya.
Tulisan tangan dalam pemindaian berada di luar mesin ini. Ini dilatih pada karakter cetak, dan garis tulisan tangan kembali sebagai kebisingan yang berbentuk seperti teks. Pemindaian yang mencampur cetakan dengan tulisan tangan memberi Anda bagian yang dicetak dan omong kosong di tempat tulisan.
Satu batasan lagi yang layak diketahui: pemindaian yang sudah di-OCR oleh perangkat lunak lain membawa lapisan teks tak terlihat dari perangkat lunak itu, dan alat ini membacanya secara verbatim. Hasilnya tepat untuk file, tidak selalu untuk kertas tempat ia dipindai.
Pertanyaan yang Sering Diajukan
Apa perbedaan antara PDF digital dan PDF yang dipindai?
PDF digital dihasilkan oleh perangkat lunak, jadi ia membawa karakter itu sendiri. PDF yang dipindai adalah tumpukan gambar halaman yang dihasilkan oleh pemindai atau kamera, jadi ia tidak membawa karakter sama sekali. Perbedaan itu menentukan segalanya tentang hasilnya. File digital memberi Anda teks yang tepat. File yang dipindai harus dikenali, dan pengenalan sangat baik pada pemindaian yang bersih dan kurang baik pada yang miring, kabur, atau kurang pencahayaan. Anda biasanya dapat mengetahui jenis mana yang Anda miliki dengan membuka file di pembaca PDF dan mencoba memilih satu baris teks dengan mouse Anda. Jika pemilihan menyoroti kata-kata, ada lapisan teks.
Apakah teks yang diekstrak tepat untuk PDF digital?
Untuk halaman dengan lapisan teks yang nyata, ya. Karakter dibaca dari file daripada dikenali dari gambar, jadi tidak ada OCR yang dijalankan pada mereka dan tidak ada yang salah baca. Urutan baca adalah satu-satunya hal yang masih dapat mengejutkan Anda, karena lapisan teks menyimpan di mana setiap rangkaian karakter berada daripada apa artinya, jadi halaman dengan kolom atau sidebar mungkin muncul dalam urutan yang tidak sesuai dengan cara mata Anda bergerak. Kata-kata itu sendiri adalah kata-kata dalam file. Halaman tanpa lapisan teks melewati OCR sebagai gantinya, dan itu membawa akurasi pengenalan yang biasa.
Berapa banyak halaman yang dapat saya ekstrak sekaligus?
Hingga 25 halaman per PDF. File yang lebih panjang masih diterima: 25 halaman pertama diekstrak dan pemberitahuan pada hasil memberi tahu Anda berapa banyak halaman yang tidak disertakan. Batas ini ada karena pekerjaan dilakukan pada perangkat keras Anda sendiri, dan dokumen yang dipindai yang panjang berarti satu kali pemindaian OCR per halaman di dalam tab browser Anda. Jika Anda memerlukan sisanya, pisahkan file di pembaca PDF dan jalankan halaman yang tersisa sebagai file kedua.
Bisakah saya mengekstrak teks dari PDF yang dilindungi kata sandi?
Tidak. PDF yang terenkripsi tidak dapat dibuka tanpa kata sandinya, dan halaman ini tidak meminta Anda untuk satu atau mencoba menghindari perlindungan. Anda mendapatkan kesalahan yang jelas alih-alih hasil kosong. Buka file di pembaca yang biasanya Anda gunakan, autentikasi dengan cara yang biasanya Anda lakukan, simpan salinan dengan kata sandi dihapus dan jalankan salinan itu di sini.
Apakah PDF saya diunggah ke server?
Tidak. File dibaca dari disk Anda ke halaman dan dibuka oleh pembaca PDF yang berjalan di browser Anda. Tidak ada titik akhir unggah di situs ini untuk menerimanya. Itulah inti dari dokumen yang sebenarnya dibawa orang ke alat seperti ini: laporan bank, slip gaji, formulir pajak, kontrak yang ditandatangani, dan pemindaian ID. Perhatikan tab jaringan selama proses berjalan dan Anda akan melihat pembaca dan model OCR tiba, dan tidak ada yang meninggalkan dokumen Anda.
Bahasa apa yang dapat dibaca?
Sisi OCR membaca bahasa Inggris, Spanyol, Rumania, Arab, Yunani, Turki, Indonesia, Rusia, dan Jepang. Pilih bahasa sebelum Anda mengekstrak, karena mesin mencocokkan bentuk dengan model yang Anda pilih dan model yang salah dibaca dengan buruk. Halaman yang sudah memiliki lapisan teks sepenuhnya mengabaikan pengaturan, karena karakter tersebut dibaca dari file apa adanya, terlepas dari skrip apa yang mereka tulis.
Bisakah saya mengekstrak teks dari beberapa PDF sekaligus?
Ya. Pilih satu batch dan file akan diproses secara berurutan daripada secara paralel. Setiap hasil muncul segera setelah file selesai, sehingga Anda dapat mulai membaca sementara yang lain masih berjalan. Dropzone menunjukkan batas untuk satu kali proses. Pemrosesan berurutan menjaga penggunaan memori dapat diprediksi, yang paling penting di ponsel.
Apakah ia mempertahankan tabel dan tata letak?
Tidak. Output adalah teks biasa, jadi tabel kembali sebagai konten selnya daripada grid, dan header, catatan kaki, dan keterangan tidak ditandai sebagai apa pun. Urutan baca juga dapat berbeda dari tata letak visual, karena posisi adalah apa yang disimpan file dan makna tidak. Prosa langsung hampir selalu datang dalam urutan yang benar. Halaman dengan sidebar, beberapa kolom, atau formulir yang diisi adalah tempat Anda harus membaca output sebelum Anda mengandalkannya.
Bisakah ia membaca tulisan tangan dalam PDF yang dipindai?
Tidak, dan kami lebih suka mengatakan demikian di sini daripada membiarkan Anda mengetahuinya dengan file yang penting. Mesin OCR dilatih pada karakter cetak. Tulisan tangan, tanda tangan, dan bidang formulir yang ditulis tangan berada di luar apa yang dapat dilakukannya, dan apa yang kembali dari mereka adalah kebisingan yang berbentuk seperti teks. Halaman yang dipindai yang mencampur cetakan dengan tulisan tangan memberi Anda bagian yang dicetak dan omong kosong di tempat tulisan.
Dalam format apa teks yang diekstrak?
Teks biasa. Salin ke clipboard Anda dengan satu tombol atau unduh sebagai file .txt, dengan halaman yang dipisahkan dan diberi label sehingga Anda dapat menemukan tempat Anda dalam dokumen yang panjang. Tidak ada file pengolah kata, tidak ada PDF yang dapat dicari dan tidak ada pemformatan yang dibawa. Jika Anda perlu kata-kata itu di tempat lain, tempelkan ke dalam dokumen, spreadsheet, atau penerjemah.
Bagaimana cara saya mengubah gambar menjadi PDF?
Itu adalah arah yang lain, dan memiliki halaman tersendiri di situs ini. Konverter JPG ke PDF mengambil foto atau pemindaian dan menulisnya ke dalam satu PDF, di browser Anda, tanpa ada yang diunggah. Gunakan ini ketika Anda memiliki gambar dan memerlukan dokumen. Gunakan halaman ini ketika Anda memiliki dokumen dan memerlukan kata-kata darinya.
Apakah konverter PDF ke teks benar-benar gratis?
Ya, gratis tanpa akun dan tanpa penghitung penggunaan. Tidak ada pendaftaran, tidak ada watermark pada teks, tidak ada kredit dan tidak ada tingkat berbayar yang menahan versi yang lebih baik. Ekstraksi berjalan di perangkat keras Anda sendiri, jadi tidak ada biaya server per file yang harus kami teruskan kepada Anda.
Bekerja dengan gambar? Ekstrak teks dari gambar membaca tangkapan layar, pemindaian dan foto dokumen. Menuju arah sebaliknya? Ubah gambar menjadi PDF dengan konverter JPG ke PDF.