LeanImg

تحويل PDF إلى نص — مستخرج نصوص مجاني عبر الإنترنت

اسحب النص من PDF رقمي أو ممسوح، مباشرة في متصفحك. مجاني، بدون تسجيل والـ PDF لا يغادر جهازك أبدًا.

جارٍ تحميل مستخرج النص...

هل تريد شكرنا؟ أخبر أصدقائك عن LeanImg!

كيفية تحويل PDF إلى نص

1

اختر PDF الخاص بك

اسحب الملف إلى الصندوق أو اختره من جهازك. تعمل PDFs الرقمية، PDFs الممسوحة والملفات التي تمزج بين الاثنين جميعها.

2

اختر لغة واستخرج

اختر لغة المستند، ثم ابدأ الاستخراج. يتم قراءة الصفحات التي تحتوي على طبقة نص على الفور. يتم التعرف على الصفحات التي تحتاج إلى OCR واحدة تلو الأخرى، مع عرض التقدم مع هبوط كل واحدة.

3

انسخ أو قم بتنزيل النص

اقرأ النتيجة، انسخها إلى الحافظة الخاصة بك أو احفظها كملف .txt مع تصنيف الصفحات.

كيف يعمل استخراج PDF إلى نص

PDF هو حاوية، وما يوجد بداخله يحدد كيفية خروج النص. يحمل ملف تم تصديره من معالج كلمات، متصفح أو تطبيق محاسبة طبقة نص. يتم تخزين الأحرف كأحرف، مع موقعها على الصفحة. قراءة تلك الطبقة تعطيك النص تمامًا كما يخزنه الملف. لا يتم تشغيل أي خطوة تعرف، لذلك لا يوجد شيء يمكن أن يكون خاطئًا.

PDF الممسوح هو شيء مختلف يحمل نفس امتداد الملف. أنتج ماسح ضوئي أو كاميرا هاتف صورة لكل صفحة، وتم لف الصورة في PDF. لا توجد أحرف في الملف، فقط بكسلات تبدو كأحرف للعين البشرية. استخراج الكلمات منها يحتاج إلى OCR، الذي يقوم بعرض الصفحة ومطابقة الأشكال ضد نموذج مدرب للغة التي تختارها.

يتحقق المستخرج من كل صفحة قبل أن يقرر. إذا كانت الصفحة تحتوي على طبقة نص قابلة للاستخدام، يتم قراءة تلك الطبقة وتكون النتيجة دقيقة. إذا لم يكن كذلك، يتم عرض الصفحة كصورة وإرسالها عبر نفس محرك OCR الذي يدعم مستخرج الصور. الملفات التي تمزج بين الاثنين تحصل على كلا العلاجين، صفحة واحدة في كل مرة، والملخص في النتيجة يوضح الطريقة التي استخدمتها كل صفحة. يتم قراءة كل ملف حتى 25 صفحة لكل PDF.

تظل بيانات البنك، الهويات والعقود على جهازك

المستندات التي يرغب الناس في استخراج النص منها هي تلك التي يجب أن يكونوا أقل استعدادًا لتحميلها. بيانات البنك، قسائم الرواتب، استمارات الضرائب، العقود الموقعة، الرسائل الطبية ونسخ جواز السفر أو بطاقة الهوية. كل واحد من هؤلاء هو ملف لن ترسله عبر البريد الإلكتروني إلى شخص غريب، وتسليمه إلى موقع وجدته في نتيجة بحث هو نفس الفعل مع خطوات أقل.

هذا المستخرج ليس لديه نقطة تحميل. يتم قراءة PDF الخاص بك من القرص إلى الصفحة، مفتوحًا بواسطة قارئ PDF يعمل في متصفحك ويتم تحويله إلى نص في الذاكرة. الطلبات التي تقوم بها الصفحة هي لآلتها الخاصة: القارئ نفسه وعندما تحتاج الصفحة إلى OCR، محرك التعرف ونموذج اللغة. يتم تقديم جميعها من هذا الموقع، وهي تسير فقط نحوك.

لا تحتاج إلى أخذ ذلك على الثقة. افتح علامة تبويب الشبكة في متصفحك قبل أن تبدأ التشغيل، ثم راقبها بينما يظهر النص. سترى الآلة تصل ولا شيء يحمل مستندك بعيدًا. هذا ادعاء يمكنك التحقق منه في أقل من دقيقة، وهو أكثر مما تقدمه سياسة الخصوصية.

ما لا يفعله هذا الأداة

تذهب هذه الصفحة في اتجاه واحد فقط. تقرأ PDF وتمنحك نصًا عاديًا. لا تكتب PDF. لا تعيد لك PDF قابل للبحث مع إضافة طبقة نص. لا تعيد بناء مستندك كملف معالج كلمات مع الحفاظ على التنسيق الأصلي. ما تحصل عليه هو الكلمات.

لا تدمج، تقسم، تدور، تضغط أو تحمي أي شيء بكلمة مرور أيضًا. هناك مواقع لكل ذلك، ومعظمها يحتاج إلى ملفك على خادمهم للقيام بالعمل. هذه هي التجارة التي تم بناء هذه الصفحة لتجنبها.

إذا كنت تريد الذهاب في الاتجاه الآخر وتحويل الصور أو المسحات إلى PDF واحد، فإن محول JPG إلى PDF على هذا الموقع يقوم بذلك. يعمل في المتصفح تمامًا كما تفعل هذه الصفحة. إذا كان مصدر بياناتك هو لقطة شاشة أو صورة بدلاً من PDF، فإن مستخرج الصور هو الصفحة التي تريدها.

لماذا LeanImg؟

يتم قراءة PDF على جهازك، صفحة بصفحة، ويظل النص هناك معه. استكشف جميع أدوات الصور المجانية لدينا للحفاظ على بقية سير عملك في المتصفح أيضًا.

لا شيء يتم تحميله

بيانات البنك، الهويات والعقود هي بالضبط الملفات التي لا يجب عليك إرسالها إلى خادم غريب. هذه الأداة ليس لديها خادم لإرسالها إليه.

دقيق حيث يمكن أن يكون

يتم قراءة ملفات PDF الرقمية من طبقة نصها حرفيًا. فقط الصفحات الممسوحة تمر عبر OCR، وتقول كل نتيجة أي طريقة تم استخدامها.

مجاني وغير محدود

لا تسجيل، لا أرصدة، لا علامات مائية ولا مستوى مدفوع. حتى 25 صفحة لكل PDF، وعدد غير محدود من ملفات PDF كما تحتاج.

كيف تبدو الأرقام

مرت أربع ملفات PDF عبر هذه الأداة مع نصها معروف مسبقًا. النتيجة هي مقارنة حرف بحرف بين الناتج وذلك النص. وُلدت ثلاثة من الملفات رقمية، تم تصديرها مباشرة من المتصفح، لذا كانت الأحرف موجودة بالفعل بداخلها. تم إنشاء الملف الممسوح عن طريق دفع لقطة شاشة عبر محول JPG إلى PDF الخاص بهذا الموقع، والذي يترك صورة لصفحة ولا يحمل أي أحرف على الإطلاق. الصف الأخير هو ملف مكون من 28 صفحة. تم بناؤه لتجاوز حد الصفحات، لذا لم يتم تقييم أي جزء منه للدقة.

قياسات من عمليات حقيقية في 2026-08-12، على أجهزة سطح المكتب. تم ترك المد durations عن عمد، لأن الهاتف أبطأ من الآلة التي تم تشغيلها عليها. الصف الممسوح هو التقاط نظيف صناعي؛ بالنسبة لتكاليف التدهور، انظر الصف 92.4% على صفحة الصورة إلى النص.
العنصرالصفحاتالطريقةالتشابه
PDF رقمي1 من 1طبقة نصية100.0%
PDF ممسوح ضوئيًا1 من 1OCR100.0%
PDF رقمي مكون من ثلاث صفحات3 من 3طبقة نصية100.0%
PDF كبير الحجم25 من 28طبقة نصيةلم يتم تقييمه

أنتجت طريقتان تلك الصفوف، ويحدد الملف أي منهما يعمل. يتم فحص كل صفحة أولاً بحثًا عن طبقة نصية، وعندما تكون الأحرف موجودة يتم قراءتها حرفيًا دون أي خطوة تعرف. هذه هي المكان الذي ينتمي فيه مصطلح الدقة، وليس في أي مكان آخر في هذه الصفحة. يتم عرض صفحة بدون طبقة نصية قابلة للاستخدام كصورة وتسلم إلى نفس محرك OCR الذي يقرأ لقطات الشاشة، لذا تحمل دقة ذلك المحرك وأنماط فشله. الملفات التي تمزج بين الاثنين تحصل على كلا المعالجتين، صفحة واحدة في كل مرة.

تخبرك النتيجة بما حدث. يتم تصنيف PDF الذي يتم قراءته بالكامل من طبقة نصه على أنه دقيق، ولا تحمل البطاقة أي درجة ثقة لذلك. أي مستند يحتوي على صفحة OCR يظهر درجة. يحمل مستند مكون من أكثر من صفحة أيضًا سطرًا يعد الصفحات التي تم قراءتها من طبقة النص مقابل الصفحات التي مرت عبر OCR. هذه الدرجة هي متوسط مرجح بالحروف عبر المستند بالكامل، وتدخل صفحات طبقة النص فيه عند 100. في ملف مختلط، اقرأه على أنه مقدار النص الذي يمكن الوثوق به، وليس على أنه مدى جودة أداء OCR. السطر الملخص لكل صفحة هو ما يخبرك بعدد الصفحات التي تم التعرف عليها على الإطلاق.

ما يتم تنزيله عند الاستخدام الأول

يعمل كلا المحركين على جهازك، لذا يجب أن يصلوا إلى هناك أولاً. فتح PDF يجلب عامل pdf.js، الذي يبلغ حوالي 1.3 ميغابايت. يأتي محرك OCR ونموذج لغة واحد معًا، حوالي 6 ميغابايت معًا، ويأتيان حتى عندما يتبين أن كل صفحة رقمية ولا يتم تشغيل أي تعرف على الإطلاق. هذه تنزيل ضائع على ملف رقمي. إنها قيود حالية وإصلاحها على القائمة.

يتم تقديم كل شيء من هذا الموقع ولا شيء من CDN طرف ثالث. يقوم متصفحك بتخزين كل ذلك في الذاكرة المؤقتة، لذا تبدأ PDF التالية في تلك اللغة بدون أي شيء لتحميله. تسحب المستندات التي تم بناؤها بخطوط غير عادية ملفًا صغيرًا آخر لخرائط الأحرف، وفقط تلك المستندات تفعل ذلك. لا شيء يسافر في الاتجاه الآخر. يتم قراءة PDF الخاص بك من القرص إلى الصفحة وفتحه في الذاكرة، ولا يحمل أي طلبه للخارج.

أين توجد الحدود

يحصل PDF واحد على 25 صفحة. العنصر الكبير يحمل 28 منها، وأخذ التشغيل أول 25 وقال ذلك على بطاقة النتيجة. لا يزال المستند الأطول يعطيك شيئًا، والطريقة هي تقسيم الملف في قارئ PDF وإرسال الصفحات المتبقية كتشغيل ثانٍ.

يتم رفض PDF المحمي بكلمة مرور. لا يمكن فتحه بدون كلمة مروره، وهذه الصفحة لن تطلب منك واحدة. يقول المستخرج ذلك بالضبط ويتوقف. افتح الملف في القارئ الذي تستخدمه بالفعل، واحفظ نسخة بدون كلمة المرور وقم بتشغيل تلك النسخة.

ترتيب القراءة هو الحد الأكثر هدوءًا. تسجل طبقة النص مكان كل مجموعة من الأحرف على الصفحة ولا شيء عن ما تعنيه أي منها، لذا يمكن أن تعود الأعمدة، والأشرطة الجانبية والحواشي السفلية بترتيب لن تأخذه عينك أبدًا. تفقد الجداول الشبكة وتصل كمحتويات خلاياها بالتسلسل. النثر المستقيم يكون جيدًا تقريبًا دائمًا. نموذج مليء أو صفحة ذات عمودين يستحق القراءة قبل الاعتماد عليه.

الكتابة اليدوية في المسح تقع خارج هذا المحرك. تم تدريبه على الأحرف المطبوعة، وتعود السطر المكتوب بخط اليد كضوضاء على شكل نص. المسح الذي يمزج بين الطباعة والكتابة اليدوية يعطيك الجزء المطبوع وهراء بدلاً من الكتابة.

حد آخر يستحق المعرفة: المسح الذي تم OCR له بالفعل بواسطة برامج أخرى يحمل طبقة نصية غير مرئية لتلك البرامج، وتقرأ هذه الأداة منه حرفيًا. النتيجة دقيقة بالنسبة للملف، وليس بالضرورة بالنسبة للورقة التي تم مسحها منها.

الأسئلة المتكررة

ما الفرق بين PDF الرقمي وPDF الممسوح ضوئيًا؟

تم إنتاج PDF الرقمي بواسطة برنامج، لذا يحمل الأحرف نفسها. PDF الممسوح ضوئيًا هو مجموعة من صور الصفحات التي تم إنتاجها بواسطة ماسح ضوئي أو كاميرا، لذا لا يحمل أي أحرف على الإطلاق. هذا الفرق يحدد كل شيء عن النتيجة. الملف الرقمي يعطيك نصًا دقيقًا. يجب التعرف على الملف الممسوح ضوئيًا، والتعرف يكون جيدًا جدًا على المسحات النظيفة وأقل جودة على المسحات المنحرفة أو الضبابية أو ذات الإضاءة السيئة. يمكنك عادةً معرفة أي نوع لديك من خلال فتح الملف في قارئ PDF ومحاولة تحديد سطر من النص باستخدام الماوس. إذا كانت التحديد يبرز الكلمات، فهناك طبقة نصية.

هل النص المستخرج دقيق لملفات PDF الرقمية؟

بالنسبة للصفحات التي تحتوي على طبقة نصية حقيقية، نعم. يتم قراءة الأحرف من الملف بدلاً من التعرف عليها من صورة، لذا لا يتم تشغيل OCR عليها ولا يوجد شيء يمكن أن يُساء فهمه. ترتيب القراءة هو الشيء الوحيد الذي قد يفاجئك، لأن طبقة النص تخزن مكان كل مجموعة من الأحرف بدلاً من ما تعنيه، لذا قد تظهر صفحة تحتوي على أعمدة أو شريط جانبي بترتيب لا يتطابق مع طريقة حركة عينك. الكلمات نفسها هي الكلمات الموجودة في الملف. الصفحات التي لا تحتوي على طبقة نصية تمر عبر OCR بدلاً من ذلك، وتحمل دقة التعرف المعتادة.

كم عدد الصفحات التي يمكنني استخراجها دفعة واحدة؟

حتى 25 صفحة لكل PDF. يتم قبول ملف أطول: يتم استخراج أول 25 صفحة وتخبرك إشعار النتيجة بعدد الصفحات التي تم استبعادها. الحد موجود لأن العمل يتم على الأجهزة الخاصة بك، وملف ممسوح ضوئيًا طويل يعني تمرير OCR لكل صفحة داخل علامة تبويب المتصفح الخاصة بك. إذا كنت بحاجة إلى الباقي، قم بتقسيم الملف في قارئ PDF وقم بتشغيل الصفحات المتبقية كملف ثانٍ.

هل يمكنني استخراج نص من PDF محمي بكلمة مرور؟

لا. لا يمكن فتح PDF مشفر بدون كلمة مروره، وهذه الصفحة لا تطلب منك واحدة أو تحاول التلاعب بالحماية. ستحصل على خطأ واضح بدلاً من نتيجة فارغة. افتح الملف في القارئ الذي تستخدمه عادةً، وحقق الهوية بالطريقة التي تفعلها عادةً، واحفظ نسخة بدون كلمة المرور وقم بتشغيل تلك النسخة هنا.

هل يتم تحميل PDF الخاص بي على خادم؟

لا. يتم قراءة الملف من القرص الخاص بك إلى الصفحة وفتحه بواسطة قارئ PDF يعمل في متصفحك. لا يوجد نقطة تحميل في هذا الموقع لاستقباله. هذه هي النقطة الرئيسية للوثائق التي يجلبها الناس فعليًا إلى أداة مثل هذه: بيانات البنك، قسائم الرواتب، نماذج الضرائب، العقود الموقعة ومسحات الهوية. راقب علامة الشبكة أثناء التشغيل وسترى القارئ ونموذج OCR يصلان، ولا شيء يغادر مع مستندك.

ما اللغات التي يمكنه قراءتها؟

يقرأ جانب OCR الإنجليزية، الإسبانية، الرومانية، العربية، اليونانية، التركية، الإندونيسية، الروسية واليابانية. اختر اللغة قبل أن تستخرج، لأن المحرك يطابق الأشكال مع النموذج الذي تختاره والنموذج الخاطئ يقرأ بشكل سيء. الصفحات التي تحتوي بالفعل على طبقة نصية تتجاهل الإعداد تمامًا، حيث يتم قراءة تلك الأحرف من الملف كما هي، بغض النظر عن النص الذي كتبت فيه.

هل يمكنني استخراج نص من عدة ملفات PDF دفعة واحدة؟

نعم. اختر دفعة ويتم العمل على الملفات بالتسلسل بدلاً من التوازي. تظهر كل نتيجة بمجرد انتهاء ملفها، لذا يمكنك البدء في القراءة بينما لا يزال الباقي قيد التشغيل. تظهر منطقة السحب الحد لعملية واحدة. يحافظ المعالجة التسلسلية على استخدام الذاكرة متوقعًا، وهو ما يهم أكثر على الهاتف.

هل يحتفظ بالجداول والتخطيط؟

لا. الناتج هو نص عادي، لذا يعود الجدول كمحتويات خلاياه بدلاً من شبكة، ولا يتم تمييز العناوين، والحواشي السفلية والتسميات كأي شيء. يمكن أن يختلف ترتيب القراءة أيضًا عن التخطيط المرئي، لأن الموضع هو ما يخزنه الملف والمعنى ليس كذلك. يأتي النثر المستقيم تقريبًا دائمًا بالترتيب الصحيح. صفحة تحتوي على أشرطة جانبية، أو عدة أعمدة أو نموذج مليء يستحق القراءة قبل الاعتماد عليه.

هل يمكنه قراءة الكتابة اليدوية في PDF الممسوح ضوئيًا؟

لا، ونفضل أن نقول ذلك هنا بدلاً من أن تكتشف ذلك مع ملف مهم. تم تدريب محرك OCR على الأحرف المطبوعة. الكتابة اليدوية، التوقيعات وحقول النموذج المكتوبة بخط اليد تقع خارج ما يمكنه القيام به، وما يعود منها هو ضوضاء على شكل نص. صفحة ممسوحة ضوئيًا تمزج بين الطباعة والكتابة اليدوية تعطيك الجزء المطبوع وهراء حيث الكتابة.

ما هو تنسيق النص المستخرج؟

نص عادي. انسخه إلى الحافظة الخاصة بك بزر واحد أو قم بتنزيله كملف .txt، مع فصل الصفحات وتسمية بحيث يمكنك العثور على مكانك في مستند طويل. لا يوجد ملف معالج كلمات، لا يوجد PDF قابل للبحث ولا يتم نقل أي تنسيق. إذا كنت بحاجة إلى الكلمات في مكان آخر، ألصقها في مستند، أو جدول بيانات أو مترجم.

كيف يمكنني تحويل الصور إلى PDF بدلاً من ذلك؟

هذا هو الاتجاه الآخر، وله صفحته الخاصة على هذا الموقع. يقوم محول JPG إلى PDF بأخذ الصور أو المسحات وكتابتها في PDF واحد، في متصفحك، دون تحميل أي شيء. استخدمه عندما يكون لديك صور وتحتاج إلى مستند. استخدم هذه الصفحة عندما يكون لديك مستند وتحتاج إلى الكلمات منه.

هل محول PDF إلى نص مجاني حقًا؟

نعم، مجاني بدون حساب وبدون عداد استخدام. لا يوجد تسجيل، لا علامة مائية على النص، لا أرصدة ولا مستوى مدفوع يعيق إصدارًا أفضل. تعمل عملية الاستخراج على الأجهزة الخاصة بك، لذا لا توجد تكلفة خادم لكل ملف لنمررها إليك.

هل تعمل مع الصور بدلاً من ذلك؟ استخرج النص من الصور يقرأ لقطات الشاشة، والمسحات وصور المستندات. هل تريد الذهاب في الاتجاه الآخر؟ قم بتحويل الصور إلى PDF باستخدام محول JPG إلى PDF.