LeanImg

كيف يمكنني استخراج النص من ملف PDF دون تحميله؟

يقدم ملف PDF الرقمي نصه بدقة ويجب التعرف على المسح. أيهما لديك، ماذا فعلت الأجهزة الستة المقاسة، حد 25 صفحة والتنزيل الذي تدفعه في كلتا الحالتين.

· Updated

يمكن أن ينتهي ملفان كلاهما بامتداد .pdf ويحتاجان إلى عمل مختلف تمامًا لاستخراج الكلمات. تم طباعة أحدهما إلى PDF بواسطة معالج كلمات ويحتوي بالفعل على الأحرف. الآخر هو صورة لورقة في غلاف PDF. صفحتنا لتحويل PDF إلى نص تفتح الملف في علامة تبويب المتصفح الخاصة بك، تتحقق من كل صفحة وتختار ما تحتاجه تلك الصفحة. لا يغادر مستندك القرص أبدًا.

تشارك محركان علامة التبويب. pdf.js، قارئ PDF من Mozilla، يحلل المستند ويسلم إما النص المخزن أو صورة مرسومة للصفحة. يتعرف Tesseract المترجم إلى WebAssembly على الصفحة عندما يتبين أنها صورة. يتم تقديم كلاهما من هذا النطاق ويتم تخزينهما مؤقتًا بعد تشغيلك الأول.

لماذا يكون أحد ملفات PDF دقيقًا والآخر معترفًا به؟

ملف PDF هو حاوية، و مواصفة ISO 32000-1 تعطيه مكانًا لتخزين مشغلات النص مع موضعها على الصفحة. البرنامج الذي ينشئ ملف PDF يكتب أحرفًا حقيقية هناك، لذا فإن استعادتها هو قراءة. لا يتم التخمين. هذه هي المكان الوحيد الذي ينتمي فيه مصطلح الدقة.

لا يحمل المسح أي أحرف على الإطلاق. تم تصوير كل صفحة والصورة تم تغليفها في PDF، لذا يتم رسم تلك الصفحات ودفعها عبر OCR واحدة تلو الأخرى. يرثون دقة ذلك المحرك وأنماط الفشل الخاصة به، والتي قمنا بقياسها على لقطات الشاشة في مقالة تحويل الصورة إلى نص. نفس المحرك، نفس النماذج.

كيف يقرر أن الصفحة هي مسح؟

عن طريق العد، صفحة بصفحة. يقرأ طبقة النص أولاً ويعد الأحرف فيها التي ليست فراغات. أكثر من 20 وتؤخذ الصفحة حرفيًا وتسمى دقيقة. عشرون أو أقل وتتم رسم الصفحة وإرسالها إلى OCR. صفحة رقمية أصلية تتجاوز هذا الخط بفارق كبير: الجهاز الكثيف الذي نختبره يحمل 426 حرفًا.

الخط موجود لالتقاط المسح الذي لا يزال يحمل كائن نصي عابر، رقم صفحة أو ختم رأس، والذي سيتم تسليمه كصفحة كاملة. إنه عتبة وليس اختبارًا، لذا لديه حافة. يمسح يحمل أكثر من 20 حرفًا من النص العابر يتجاوز الخط، وستحصل على رأس الرسالة المسمى دقيق بينما يبقى الجسم محجوزًا في الصورة. ملخص الصفحة هو المكان الذي يظهر فيه ذلك: مستند تعرف أنه تم مسحه يبلغ عن الصفحات المقروءة من طبقة النص هو الحالة التي يجب النظر إليها.

عند أي دقة يتم قراءة صفحة ممسوحة؟

200 DPI. يقيس ملف PDF صفحاته بوحدات 72 من البوصة، لذا فإن رسم واحدة بمقياس 1 يضع نص الجسم حول 10 بكسل ارتفاعًا، تحت حوالي 20 بكسل حيث تنخفض دقة التعرف. الرسم عند 200 DPI يضع ذلك النص بالقرب من 28 بكسل ويجعل صفحة بحجم US Letter 1700 × 2200، وهو معيار المسح الذي يتبعه هذا الأداة.

هناك سقف ثانٍ خلفه: 4096 بكسل على الجانب الأطول، يتم تطبيقه بعد مقياس DPI. صفحة عادية ليست قريبة منه. يتم تقليص صفحة أطول من حوالي 20 بوصة لتناسب وتقرأ بأقل من 200 DPI، بالنسبة إلى مدى تجاوزها. مجموعة مخططة أو ملصق هو ما يصل إلى ذلك، ولا يحذرك شيء على البطاقة.

ماذا أظهرت الجولات المقاسة؟

مرت ستة أجهزة عبر المحرك في 2026-08-12، على أجهزة سطح المكتب. تقارن التشابه المخرجات بالنص الذي كنا نعرفه في المستند، حرفًا بحرف.

جولات حقيقية، 2026-08-12. تم استبعاد المدد لأن هذه كانت قياسات سطح المكتب والهاتف أبطأ.
الجهازالصفحات المقروءةالطريقةالتشابه
ملف PDF رقمي أصلي1 من 1طبقة نص100.0%
صفحة ممسوحة1 من 1OCR100.0%
ملف PDF رقمي من ثلاث صفحات3 من 3طبقة نص100.0%
مستند من 28 صفحة25 من 28طبقة نصلم يتم تقييمه
ملف تالفلا شيءمرفوضلم يتم تقييمه
ملف محمي بكلمة مرورلا شيءمرفوضلم يتم تقييمه
ثلاث بطاقات نتائج PDF: digital.pdf المسمى طبقة نص دقيقة، scanned.pdf تحمل درجة ثقة 93% من تمرير OCR الخاص بها و multipage.pdf تلخص ثلاث صفحات مقروءة من طبقة النص
تسمي البطاقة الطريقة قبل أن تقرأ كلمة من المخرجات. يعود digital.pdf معلقًا "طبقة نص: دقيقة" دون درجة مرتبطة به. مرت scanned.pdf عبر OCR وتبلغ عن ثقة 93% لتلك الجولة. تقرأ multipage.pdf "3 صفحات: 3 مقروءة بدقة من طبقة النص، 0 عبر OCR."

عادت الأداة الممسوحة أيضًا بنسبة 100.0%، وتحتاج تلك الصفوف إلى نجمة. قمنا ببنائها عن طريق دفع صورة عبر محول JPG إلى PDF الخاص بهذا الموقع، لذا فهي نوع مصور واضح بدون عدسة وبدون انحراف. ماسح البنك الخاص بك هو الحالة الأكثر صعوبة. استغرق دفعة من أربعة ملفات مع المستند المكون من 25 صفحة 3.0 ثوانٍ من الساعة على سطح المكتب.

ماذا تقيس درجة الثقة فعليًا؟

تقيس تمرير OCR، وفقط على الصفحات التي تم تشغيل OCR عليها. تدخل صفحات طبقة النص في المتوسط عند 100 حسب التعريف، لذا فإن ملفًا يحتوي على مسح سيئ واحد مدفون في مجموعة من الصفحات الرقمية لا يزال يبلغ عن رقم مريح. في مستند مختلط، يخبرك هذا المتوسط بمدى موثوقية النص. سطر ملخص الصفحة هو ما يجيب على سؤال OCR. "3 صفحات: 3 مقروءة بدقة من طبقة النص، 0 عبر OCR" يعني أنه لم يتم التعرف على أي شيء. ملف PDF مقروء بالكامل من طبقة نصه لا يحمل درجة.

ماذا يحدث عند الصفحة 26؟

يحصل ملف PDF على 25 صفحة. يحمل الجهاز الكبير 28، وقراءة التشغيل الأولى 25 وطباعة إشعار على البطاقة تقول ذلك. لا شيء يفشل بهدوء. لأي شيء أطول، سترغب في تقسيمه في أي قارئ PDF لديك، ثم إرسال الباقي كجولة ثانية.

يتم رفض نوعين من الملفات بشكل قاطع. يتم رفض ملف PDF التالف بعبارة pdf.js الخاصة به، "بنية PDF غير صالحة."، والتي تصل باللغة الإنجليزية في كل منطقة لأن مصدرها من القارئ بدلاً من ترجماتنا. يتم رفض ملف PDF المحمي بكلمة مرور أيضًا، وهذه الصفحة لن تطلب منك كلمة المرور. قم بإزالة الحماية في القارئ الذي تستخدمه بالفعل، ثم قم بتشغيل النسخة.

هل من الآمن تشغيل كشف حساب مصرفي من خلال هذا؟

هذه هي الحالة التي تم بناء الأداة من أجلها. كشوف المرتبات، العقود والمسحات من الهوية هي المستندات التي يريد الناس استخراج النص منها، وهم آخر من تريد أن يجلس على جهاز غريب. لا يوجد نقطة تحميل في قاعدة الشيفرة هذه يمكن أن تستقبل واحدة. افتح علامة تبويب الشبكة أثناء التشغيل: تصل أجزاء المحرك من هذا النطاق ولا يحمل أي شيء مستندك بعيدًا.

تعمل خدمات PDF الكبيرة بالطريقة المعاكسة. يصل ملفك إلى أجهزتهم أولاً، وإجابتهم على سؤال الخصوصية هي وعد الاحتفاظ: يتم حذف النسخة بعد عدد من الساعات. اقتبسنا تلك العبارة في المقال الأول في هذه السلسلة. يخبرك بمدة جلوس كشف راتبك على قرص شخص آخر. سواء وصل إلى هناك هو سؤال منفصل. صفحتنا للخصوصية تسرد ما نجمعه.

متى يكون هذا الأداة غير مناسبة؟

الكتابة اليدوية. يقول مشروع Tesseract بوضوح: يمكنك توجيهه نحو الكتابة اليدوية ولن يعمل بشكل جيد، لأن المحرك تم بناؤه للأحرف المطبوعة. نموذج ممسوح مع تسميات مطبوعة وإجابات مكتوبة باليد يمنحك التسميات والضوضاء حيث كانت الإجابات. نادرًا ما يستحق التشغيل.

التخطيط هو الآخر. تسجل طبقة النص مكان كل مجموعة من الأحرف ولا شيء عن معنى أي منها، لذا يمكن أن تعود صفحة ذات عمودين أو كتلة من الحواشي في ترتيب لن تأخذه عينك أبدًا. تفقد الجداول الشبكة وتصل كمحتويات خلايا بالتسلسل. النثر المستقيم يكون دائمًا جيدًا تقريبًا. مستند معاد بناؤه مع التخطيط الأصلي ليس شيئًا تنتجه هذه الصفحة.

بالنسبة للنصف الممسوح، تتطابق ملاحظات جودة Tesseract مع ما أظهرته أجهزتنا: الأحرف الأكبر والأوضح تقرأ بشكل أفضل. إذا كنت تقوم بتصوير ورقة بدلاً من مسحها، فإن أداة استخراج الصورة مع قص إلى كتلة النص تتفوق على تغليف تلك الصورة في PDF أولاً.

لماذا لا يزال ملف PDF الرقمي يقوم بتنزيل محرك OCR؟

لأن هذا المسار لم يتم تقسيمه بعد. يقوم تشغيل PDF بسحب عامل pdf.js، 1,262,398 بايت في الإصدار 6.2.108 الذي نرسله، بالإضافة إلى محرك OCR ونموذج لغة واحد بحجم حوالي 6 MB. يتم تحميل نصف OCR حتى عندما يتبين أن كل صفحة رقمية أصلية ولا تحتاج إلى التعرف، لذا في ملف مثل ذلك يكون التنزيل مهدورًا. إنها قيود معروفة. بقية القارئ أكثر كسلاً: تصل خرائط الأحرف وكودك الصور فقط عندما يحتاج المستند إليها.

ماذا أفعل بالنص بعد ذلك؟

تحصل على نص عادي. انسخه باستخدام الزر، أو قم بتنزيل ملف .txt مع الصفحات مفصولة وموسومة. إذا كان مصدرها لقطة شاشة، فإن أداة الصورة إلى نص هي الصفحة لذلك، و الأجهزة الستة التي قمنا بتقييمها تغطي 515 حرفًا اخترعها OCR من صورة بدون كتابة فيها. في الاتجاه الآخر، يقوم محول JPG إلى PDF ببناء مستند من الصور و الضاغط يقوم بتقليل حجمها أولاً عندما تكون ثقيلة.

جربها على أسوأ ملف PDF لديك. ألقِ به على صفحة PDF إلى نص، ثم اقرأ سطر ملخص الصفحة قبل أن تقرأ النص.