LeanImg

كيف يمكنني استخراج النص من لقطة شاشة دون تحميلها؟

ما الذي تقرأه تقنية التعرف الضوئي على الحروف في المتصفح: قياس التشابه على ستة نماذج، و515 حرفًا اخترعتها من صورة لا تحتوي على نص، ونموذج التحميل الذي تدفع ثمنه مرة واحدة.

تأخذ معظم مواقع التعرف الضوئي على الحروف لقطة الشاشة الخاصة بك، وتنشرها على خادم وتقرأها هناك. هذا جيد لصورة قائمة مطعم. إنها قرار مختلف لبيان راتب، صفحة جواز سفر أو لقطة شاشة لمحادثة خاصة. أداتنا تحويل الصورة إلى نص تقوم بالتعرف داخل علامة تبويب المتصفح الخاصة بك، لذا يبقى الملف على القرص الخاص بك ويظهر النص بجانبه.

المحرك هو Tesseract، تم تجميعه إلى WebAssembly ومرفق مع الصفحة. يقوم التشغيل الأول بتنزيل نص برمجي للعامل، والنواة الخاصة بـ WebAssembly ونموذج لغة واحد. يحتفظ متصفحك بجميع الثلاثة. بعد ذلك، لا يوجد شيء آخر يجب تحميله.

هل يتم تحميل لقطة الشاشة الخاصة بي؟

لا. لا يوجد نقطة تحميل في قاعدة الشيفرة هذه يمكن أن تستقبل واحدة. الحركة الوحيدة في الشبكة التي تقوم بها الأداة هي نفس الأصل: 3 طلبات بإجمالي حوالي 6 ميغابايت للغة الإنجليزية، وكل واحدة منها مقدمة من هذا النطاق. يتم فك تشفير ملفك داخل الصفحة، ويتم تسليمه إلى المحرك كبيكسلات وتحويله إلى نص هناك. افتح علامة تبويب الشبكة أثناء التشغيل وسترى أجزاء النموذج تصل ولا شيء يحمل صورتك بعيدًا. صفحة الخصوصية الخاصة بنا تسرد الأشياء الوحيدة التي نجمعها، وهي مشاهدات الصفحة وعدد الأدوات المجهولة.

تعمل الشركات الأخرى بالعكس. يقوم كل من Smallpdf وiLovePDF بالتعرف على أجهزتهم الخاصة، لذا يجب أن تصل إليهم ملفك قبل حدوث أي شيء. إجابتهم على سؤال الخصوصية هي وعد بالاحتفاظ: يتم حذف النسخة بعد فترة. لقد اقتبسنا نص الاحتفاظ الخاص بهم في دليل تحويل JPG إلى PDF. يعد وعد الاحتفاظ بمعلومات حول المدة التي سيبقى فيها مسح جواز سفرك على قرص شخص آخر. لا يقول شيئًا عن ما إذا كان سيصل هناك. هنا لا يطرح هذا السؤال.

ما مدى دقته على لقطة شاشة حقيقية؟

قمنا بقياسه. مرت ستة نماذج مع نص معروف عبر المحرك في 2026-08-11، والنتيجة أدناه هي مقارنة حرف بحرف بين المخرجات والنص الذي كنا نعرف أنه في الصورة. النماذج اصطناعية: صفحات HTML تم عرضها في متصفح وتم التقاطها كلقطات شاشة حقيقية، مع نموذج مشوش تم تشويهه وتدويره في CSS ليبدو كأنه تم التقاطه بهاتف سيء.

تشغيلات حقيقية على أجهزة سطح المكتب، 2026-08-11. تم أخذ النتيجة اليابانية مع تطبيع المسافات. تم ترك المدد لأن الهاتف سيكون أبطأ.
نموذجاللغةالتشابهالثقة
لقطة شاشة نظيفةالإنجليزية100.0%95
فقرة كثيفةالإنجليزية100.0%95
لقطة مشوشة محاكيةالإنجليزية92.4%65
عينة روسيةالروسية100.0%96
عينة يابانيةاليابانية100.0%93
صورة بدون نص فيهاالإنجليزية515 حرفًا من نص مخترع32
ثلاث بطاقات نتائج في أداة تحويل الصورة إلى نص: clean-screenshot.png وdense-paragraph.png كلاهما عند 95% ثقة مع نص نظيف؛ degraded.png عند 65% مع كلمات مشوشة
النجاح والفشل في إطار واحد. تفتح اللقطة المشوشة في الأسفل مع "ea auaracer recognition" حيث تقول المصدر "التعرف الضوئي على الحروف".

عاد اثنان من النماذج الإنجليزية بنسبة 100.0%، حرف بحرف، كلاهما عند ثقة 95. النسخة المشوشة والمُدورة من نفس الفقرة حصلت على 92.4% وثقة 65. هذا يعني فقدان 7.6 نقطة من التشابه، والشكل أعلاه يظهر أين ذهبت: الكلمات الافتتاحية مشوشة بينما وسط الفقرة يبقى. ثقة 65 أيضًا تنبه تحذير الثقة المنخفضة على البطاقة، لذا يتم إخبارك قبل النسخ.

ماذا يحدث إذا لم يكن هناك نص في الصورة؟

هذه هي الجزء الذي تتجاوزه صفحات التعرف الضوئي الأخرى. قدمنا للمحرك صورة مظلمة للفراشات فوق جذع مغطى بالطحالب، ولا يوجد كتابة في أي مكان فيها. عادت 515 حرفًا من نص لم يكن موجودًا أبدًا. هذا ما تفعله محركات التعرف الضوئي على الحروف. تم بناؤها للعثور على أشكال الحروف، لذا يتم الإبلاغ عن الحبوب والملمس كحروف، ولا تقرر أي مرحلة في خط الأنابيب أن الصورة فارغة.

لا ندعي اكتشاف صورة فارغة، لأننا لا نستطيع. تحمل كل نتيجة درجة ثقتها، ويتم إطلاق تحذير عندما ينخفض المتوسط إلى أقل من 60. حصلت تلك الصورة على 32. تسجل لقطة الشاشة النظيفة 95. المسافة بين هذين الرقمين هي الإشارة، وهي مطبوعة على البطاقة قبل أن تلمس النص.

هل تقرأ الروسية واليابانية؟

تسع لغات: الإنجليزية، الإسبانية، الرومانية، العربية، اليونانية، التركية، الإندونيسية، الروسية واليابانية. اختر واحدة قبل أن تستخرج، لأن المحرك يطابق الأشكال مع النموذج الذي اخترته والنموذج الخاطئ يقرأ بشكل سيء. لا يوجد كشف تلقائي حتى الآن. عادت كلتا النماذج غير اللاتينية نظيفة، الروسية بنسبة 100.0% وثقة 96، واليابانية بنسبة 100.0% وثقة 93 بمجرد تطبيع المسافات، حيث يقوم المحرك بإدراج مسافات بين الأحرف اليابانية.

بطاقات نتائج لـ russian.png عند 96% ثقة وjapanese.png عند 93%، كلاهما يظهر نصًا مستخرجًا بشكل صحيح، فوق شريط دفعة يقرأ نص مستخرج من 6 صورة(صور)
النماذج الروسية واليابانية، تم قراءتها بشكل صحيح في نفس الدفعة مع النماذج الإنجليزية.

كل لغة هي ملف نموذج منفصل، tessdata_fast من مشروع Tesseract، يتم تقديمه من هذا النطاق مثل كل شيء آخر. إضافة واحدة تكلف بين حوالي 0.6 و2 ميغابايت في المرة الأولى التي تختارها، وجميع التسع معًا حوالي 11 ميغابايت. يحتفظ متصفحك بها، لذا فهي تكلفة لمرة واحدة لكل لغة وتبدأ التشغيل الثاني في أي لغة على الفور.

متى يجب ألا تستخدم هذا؟

الكتابة اليدوية. يقول مشروع Tesseract بوضوح: يمكنك توجيهها نحو الكتابة اليدوية، ولن تعمل بشكل جيد، لأن المحرك مصمم للنص المطبوع. النص الملتقط في مشهد هو الحالة الضعيفة الأخرى، لافتة المتجر وملصق الرف. يتعامل اختيار النص المدمج في هاتفك مع تلك الأمور بشكل أفضل، وستتفوق الخدمة المدربة على الكتابة اليدوية علينا في رسالة من جدتك. نفضل أن نقول ذلك بدلاً من إجراء التشغيل وتسليمك فقرة مشوشة.

بالنسبة لكل شيء آخر، تتطابق ملاحظات جودة Tesseract مع ما رأيناه في النماذج: الأحرف الأكبر والأكثر وضوحًا تُقرأ بشكل أفضل، والنص الداكن على خلفية فاتحة هو الحالة السهلة. قم بالتقاط صورة للمصدر حيث يمكنك. حيث لا يمكنك، قم بالتصوير مباشرة مع ضوء متساوٍ واملأ الإطار بالنص.

ماذا أفعل بالصورة بعد ذلك؟

الناتج هو نص عادي. انسخه باستخدام الزر، الذي يستخدم واجهة برمجة تطبيقات الحافظة في المتصفح. قم بتنزيل ملف .txt لكل صورة، أو قم بتنزيل الدفعة الكاملة كملف واحد. صورتك لم تتأثر بأي من ذلك. إذا كان يجب أن تصبح أصغر قبل أن ترسلها، فإن الضاغط يقوم بذلك في نفس التبويب والمعدل يغير أبعاد البكسل. قم بأي منهما بعد الاستخراج. تقليص لقطة شاشة أولاً يتخلص من البكسلات التي تتكون منها الأحرف.

سلسلتان تستحقان المعرفة. صورة HEIC من iPhone تدخل مباشرة، يتم فك تشفيرها بواسطة المتصفح قبل أن يراها المحرك، لذا لا يوجد خطوة تحويل تنسيق يجب القيام بها أولاً. وإذا كنت تريد فقط كتلة واحدة من النص من لقطة شاشة طويلة، قم بتشغيلها عبر القص أولاً، بحيث يكون الناتج هو الجزء الذي طلبته ولا شيء آخر. النموذج الآخر الذي يعمل محليًا في هذا الموقع هو النموذج الذي يحدد أي بكسلات هي الموضوع.

جربه على أسوأ لقطة شاشة لديك. اسحبها إلى أداة تحويل الصورة إلى نص، اختر اللغة، ثم اقرأ رقم الثقة قبل النص.

ماذا عن ملفات PDF؟

ينقسم ملف PDF إلى قسمين قبل أن ينطبق أي من هذا. يحمل ملف تم تصديره من معالج كلمات أو متصفح طبقة نص، لذا فإن الأحرف موجودة بالفعل هناك وسحبها يتطلب عدم وجود أي تعرف على الإطلاق. ملف جاء من ماسح ضوئي أو هاتف هو صورة ملفوفة في PDF، ويحتاج إلى نفس عملية التعرف الضوئي التي تحتاجها الصورة. صفحة PDF إلى نص الخاصة بنا تتحقق من كل صفحة وتختار، وكيف تقرر أي الصفحات تمت قراءتها بدقة وأيها تم التعرف عليه هو الشرح الأطول. في النماذج، عاد ملف رقمي وملف رقمي من ثلاث صفحات كلاهما بنسبة 100.0% مباشرة من طبقة النص، وعادت صفحة ممسوحة تم إنشاؤها باستخدام محول JPG إلى PDF الخاص بهذا الموقع بنسبة 100.0% عبر التعرف الضوئي.

ثلاث بطاقات نتائج PDF تظهر استخراج طبقة نص، استخراج OCR وملخص صفحة
digital.pdf يعود معنونًا "طبقة نص: دقيقة" مع الفقرة كما هي. scanned.pdf مرت عبر OCR، وتبلغ البطاقة عن ثقة 93% لتلك العملية. multipage.pdf تقرأ "3 صفحات: 3 تمت قراءتها بدقة من طبقة النص، 0 عبر OCR."

هناك حد أقصى يبلغ 25 صفحة لكل ملف. النموذج الكبير هو 28 صفحة، وعادت العملية بقراءة أول 25 وطبع إشعار بذلك. قم بتقسيم أي شيء أطول في قارئ PDF وأرسل الباقي كعملية ثانية. شيء آخر يستحق المعرفة قبل أن تبدأ: يسحب PDF حوالي 1.3 ميغابايت للقارئ بالإضافة إلى محرك التعرف الضوئي والنموذج، ولا يزال يتم تحميل ذلك التعرف الضوئي عندما يتبين أن كل صفحة رقمية ولا تحتاج إلى التعرف.

حالة الخصوصية هنا أقوى مما هي عليه بالنسبة للقطات الشاشة. بيانات الحسابات البنكية، بيانات الرواتب ونسخ الهوية هي الوثائق التي يرغب الناس في استخراج النص منها، وهم الأكثر رغبة في عدم تسليمها إلى خادم غريب. صفحة PDF تعمل بنفس طريقة أداة تحويل الصورة إلى نص، مع قراءة الملف من القرص الخاص بك إلى التبويب وعدم إرسال أي شيء إلى أي مكان. إذا كان مصدرها PDF، ابدأ هناك بدلاً من التقاط لقطة شاشة لكل صفحة.