Πώς μπορώ να εξάγω κείμενο από μια στιγμιότυπο οθόνης χωρίς να το ανεβάσω;
Τι διαβάζει πραγματικά το OCR του προγράμματος περιήγησης: μετρημένη ομοιότητα σε έξι δείγματα, οι 515 χαρακτήρες που εφηύρε από μια φωτογραφία χωρίς κείμενο και το μοντέλο που κατεβάζετε μία φορά.
Οι περισσότερες ιστοσελίδες OCR παίρνουν το στιγμιότυπό σας, το ανεβάζουν σε έναν διακομιστή και το διαβάζουν εκεί. Αυτό είναι εντάξει για μια φωτογραφία ενός μενού εστιατορίου. Είναι διαφορετική απόφαση για μια μισθοδοσία, μια σελίδα διαβατηρίου ή ένα στιγμιότυπο μιας ιδιωτικής συνομιλίας. Το εργαλείο εικόνας σε κείμενο μας εκτελεί την αναγνώριση μέσα στην καρτέλα του προγράμματος περιήγησης, έτσι το αρχείο παραμένει στον δίσκο σας και το κείμενο εμφανίζεται δίπλα του.
Η μηχανή είναι Tesseract, μεταγλωττισμένη σε WebAssembly και αποστέλλεται με τη σελίδα. Η πρώτη σας εκτέλεση κατεβάζει ένα σενάριο εργαζομένου, τον πυρήνα WebAssembly και ένα γλωσσικό μοντέλο. Ο περιηγητής σας αποθηκεύει και τα τρία. Μετά από αυτό, δεν υπάρχει τίποτα άλλο να κατεβάσετε.
Ανεβαίνει το στιγμιότυπό μου;
Όχι. Δεν υπάρχει σημείο ανέβασμα σε αυτή τη βάση κώδικα που θα μπορούσε να το δεχτεί. Η μόνη δικτυακή κίνηση που κάνει το εργαλείο είναι της ίδιας προέλευσης: 3 αιτήματα συνολικά περίπου 6 MB για τα Αγγλικά, το καθένα από αυτά εξυπηρετείται από αυτόν τον τομέα. Το αρχείο σας αποκωδικοποιείται μέσα στη σελίδα, παραδίδεται στη μηχανή ως πίξελ και μετατρέπεται σε κείμενο εκεί. Ανοίξτε την καρτέλα δικτύου κατά τη διάρκεια μιας εκτέλεσης και θα δείτε τα κομμάτια του μοντέλου να φτάνουν και τίποτα να μην μεταφέρει την εικόνα σας. Η σελίδα απορρήτου μας απαριθμεί τα μόνα πράγματα που συλλέγουμε, τα οποία είναι οι προβολές σελίδας και οι ανώνυμοι μετρητές εργαλείων.
Οι ανταγωνιστές λειτουργούν αντίστροφα. Smallpdf και iLovePDF κάνουν την αναγνώριση στους δικούς τους υπολογιστές, οπότε το αρχείο σας πρέπει να φτάσει σε αυτούς πριν συμβεί οτιδήποτε. Η απάντησή τους στο ερώτημα απορρήτου είναι μια υπόσχεση διατήρησης: το αντίγραφο διαγράφεται μετά από λίγο. Αναφέραμε τη διατύπωση της διατήρησης τους στον οδηγό JPG σε PDF. Μια υπόσχεση διατήρησης σας λέει πόσο καιρό η σάρωση του διαβατηρίου σας παραμένει στον δίσκο κάποιου άλλου. Δεν τίθεται τέτοιο ερώτημα εδώ.
Πόσο ακριβές είναι σε ένα πραγματικό στιγμιότυπο;
Το μετρήσαμε. Έξι δείγματα με γνωστό κείμενο πέρασαν από τη μηχανή στις 2026-08-11, και η βαθμολογία παρακάτω είναι μια σύγκριση χαρακτήρα προς χαρακτήρα της εξόδου με το κείμενο που γνωρίζαμε ότι ήταν στην εικόνα. Τα δείγματα είναι συνθετικά: σελίδες HTML που αποδόθηκαν σε έναν περιηγητή και καταγράφηκαν ως πραγματικά στιγμιότυπα, με το υποβαθμισμένο να είναι θολό και περιστραμμένο σε CSS ώστε να μιμείται μια κακή λήψη από τηλέφωνο.
| Δείγμα | Γλώσσα | Ομοιότητα | Εμπιστοσύνη |
|---|---|---|---|
| Καθαρό στιγμιότυπο | Αγγλικά | 100.0% | 95 |
| Πυκνή παράγραφος | Αγγλικά | 100.0% | 95 |
| Προσομοιωμένη υποβαθμισμένη λήψη | Αγγλικά | 92.4% | 65 |
| Ρωσικό δείγμα | Ρωσικά | 100.0% | 96 |
| Ιαπωνικό δείγμα | Ιαπωνικά | 100.0% | 93 |
| Φωτογραφία χωρίς κείμενο | Αγγλικά | 515 χαρακτήρες εφευρεθέντος κειμένου | 32 |

Δύο από τα αγγλικά δείγματα επέστρεψαν με 100.0%, χαρακτήρα προς χαρακτήρα, και τα δύο με εμπιστοσύνη 95. Η θολή και περιστραμμένη αντίγραφο του ίδιου παραγράφου προσγειώθηκε στο 92.4% και εμπιστοσύνη 65. Αυτό σημαίνει 7.6 σημεία ομοιότητας που χάθηκαν, και η παραπάνω βαθμολογία δείχνει πού πήγε: οι αρχικές λέξεις είναι παραμορφωμένες ενώ το μέσο της παραγράφου επιβιώνει. Η εμπιστοσύνη 65 ενεργοποιεί επίσης την προειδοποίηση χαμηλής εμπιστοσύνης στην κάρτα, οπότε σας ενημερώνει πριν αντιγράψετε.
Τι συμβαίνει αν δεν υπάρχει κείμενο στην εικόνα;
Αυτή είναι η μέρος που παραλείπουν άλλες σελίδες OCR. Δώσαμε στη μηχανή μια σκοτεινή φωτογραφία από πεταλούδες πάνω σε ένα βρύα ξύλο, και δεν υπάρχει καμία γραφή πουθενά σε αυτήν. Επέστρεψε 515 χαρακτήρες κειμένου που ποτέ δεν υπήρξαν. Αυτό κάνουν οι μηχανές OCR. Είναι κατασκευασμένες για να βρίσκουν σχήματα χαρακτήρων, οπότε η κόκκωση και η υφή αναφέρονται ως χαρακτήρες, και κανένα στάδιο της διαδικασίας δεν αποφασίζει ότι μια εικόνα είναι κενή.
Δεν ισχυριζόμαστε ότι ανιχνεύουμε μια κενή εικόνα, γιατί δεν μπορούμε. Κάθε αποτέλεσμα φέρει τη βαθμολογία εμπιστοσύνης του, και μια προειδοποίηση ενεργοποιείται όταν ο μέσος όρος πέφτει κάτω από το 60. Αυτή η φωτογραφία βαθμολογήθηκε 32. Ένα καθαρό στιγμιότυπο βαθμολογείται 95. Η απόσταση μεταξύ αυτών των δύο αριθμών είναι το σήμα, και εκτυπώνεται στην κάρτα πριν αγγίξετε το κείμενο.
Διαβάζει ρωσικά και ιαπωνικά;
Εννέα γλώσσες: Αγγλικά, Ισπανικά, Ρουμανικά, Αραβικά, Ελληνικά, Τουρκικά, Ινδονησιακά, Ρωσικά και Ιαπωνικά. Επιλέξτε μία πριν εξάγετε, γιατί η μηχανή ταιριάζει σχήματα με το μοντέλο που επιλέξατε και το λάθος μοντέλο διαβάζει άσχημα. Δεν υπάρχει αυτόματη ανίχνευση ακόμη. Και τα δύο μη Λατινικά δείγματα επέστρεψαν καθαρά, το ρωσικό με 100.0% και εμπιστοσύνη 96, το ιαπωνικό με 100.0% και εμπιστοσύνη 93 μόλις το διάστημα κανονικοποιηθεί, καθώς η μηχανή εισάγει κενά μεταξύ των ιαπωνικών χαρακτήρων.

Κάθε γλώσσα είναι ένα ξεχωριστό αρχείο μοντέλου, tessdata_fast από το έργο Tesseract, που εξυπηρετείται από αυτόν τον τομέα όπως όλα τα άλλα. Η προσθήκη ενός κοστίζει μεταξύ περίπου 0,6 και 2 MB την πρώτη φορά που το επιλέγετε, και όλα τα εννέα μαζί είναι περίπου 11 MB. Ο περιηγητής σας τα διατηρεί, οπότε είναι ένα κόστος μίας φοράς ανά γλώσσα και η δεύτερη εκτέλεση σε οποιαδήποτε γλώσσα ξεκινά αμέσως.
Πότε δεν πρέπει να το χρησιμοποιήσετε;
Χειρόγραφα. Το έργο Tesseract το λέει καθαρά: μπορείτε να το δείξετε σε χειρόγραφα, και δεν θα λειτουργήσει πολύ καλά, γιατί η μηχανή είναι σχεδιασμένη για εκτυπωμένο κείμενο. Το κείμενο που φωτογραφήθηκε σε μια σκηνή είναι η άλλη αδύναμη περίπτωση, η πινακίδα του καταστήματος και η ετικέτα του ραφιού. Η ενσωματωμένη επιλογή κειμένου του τηλεφώνου σας χειρίζεται καλύτερα αυτά, και μια υπηρεσία εκπαιδευμένη σε χειρόγραφα θα μας νικήσει σε ένα γράμμα από τη γιαγιά σας. Θα προτιμούσαμε να το πούμε αυτό παρά να κάνουμε την εκτέλεση και να σας δώσουμε μια παραμορφωμένη παράγραφο.
Για όλα τα άλλα, οι σημειώσεις ποιότητας Tesseract ταιριάζουν με αυτά που είδαμε στα δείγματα: μεγαλύτεροι και πιο καθαροί χαρακτήρες διαβάζονται καλύτερα, και το σκοτεινό κείμενο σε ανοιχτό φόντο είναι η εύκολη περίπτωση. Κάντε στιγμιότυπο της πηγής όπου μπορείτε. Όπου δεν μπορείτε, φωτογραφίστε ευθεία με ομοιόμορφο φως και γεμίστε το πλαίσιο με το κείμενο.
Τι να κάνω με την εικόνα μετά;
Η έξοδος είναι απλό κείμενο. Αντιγράψτε το με το κουμπί, το οποίο χρησιμοποιεί το Clipboard API του προγράμματος περιήγησης. Κατεβάστε ένα .txt ανά εικόνα, ή πάρτε ολόκληρη την παρτίδα ως ένα αρχείο. Η εικόνα σας δεν έχει επηρεαστεί από τίποτα από αυτά. Αν πρέπει να μικρύνει πριν την στείλετε, ο συμπιεστής το κάνει αυτό στην ίδια καρτέλα και ο αλλαγέας μεγέθους αλλάζει τις διαστάσεις σε πίξελ. Κάντε οποιοδήποτε από τα δύο μετά την εξαγωγή. Η μείωση ενός στιγμιότυπου πρώτα πετάει τους πίξελ από τους οποίους είναι φτιαγμένοι οι χαρακτήρες.
Δύο αλυσίδες που αξίζει να γνωρίζετε. Μια φωτογραφία HEIC από ένα iPhone μπαίνει κατευθείαν, αποκωδικοποιημένη από τον περιηγητή πριν η μηχανή την δει, οπότε δεν υπάρχει βήμα μετατροπής μορφής που πρέπει να κάνετε πρώτα. Και αν θέλετε μόνο ένα κομμάτι κειμένου από ένα μεγάλο στιγμιότυπο, περάστε το πρώτα από τον κοπτήρα, ώστε η έξοδος να είναι το μέρος που ζητήσατε και τίποτα άλλο. Το άλλο μοντέλο που εκτελείται τοπικά σε αυτόν τον ιστότοπο είναι αυτό που αποφασίζει ποιοι πίξελ είναι το θέμα.
Δοκιμάστε το στο χειρότερο στιγμιότυπο που έχετε. Ρίξτε το στο εργαλείο εικόνας σε κείμενο, επιλέξτε τη γλώσσα, και μετά διαβάστε τον αριθμό εμπιστοσύνης πριν το κείμενο.
Τι γίνεται με τα PDFs;
Ένα PDF χωρίζεται σε δύο πριν από οποιοδήποτε από αυτά να ισχύει. Ένα αρχείο που εξάγεται από έναν επεξεργαστή κειμένου ή έναν περιηγητή φέρει ένα επίπεδο κειμένου, οπότε οι χαρακτήρες είναι ήδη εκεί και η εξαγωγή τους δεν περιλαμβάνει καμία αναγνώριση. Ένα αρχείο που προήλθε από έναν σαρωτή ή ένα τηλέφωνο είναι μια εικόνα τυλιγμένη σε ένα PDF, και χρειάζεται την ίδια αναγνώριση OCR που χρειάζεται μια εικόνα. Η σελίδα PDF σε κείμενο ελέγχει κάθε σελίδα και επιλέγει, και πώς αποφασίζει ποιες σελίδες διαβάστηκαν ακριβώς και ποιες αναγνωρίστηκαν είναι η μεγαλύτερη περιγραφή. Στα δείγματα, ένα αρχείο ψηφιακής γέννησης και ένα τριών σελίδων ψηφιακό αρχείο επέστρεψαν και τα δύο με 100.0% κατευθείαν από το επίπεδο κειμένου, και μια σαρωμένη σελίδα που κατασκευάστηκε με τον δικό μας μετατροπέα JPG σε PDF επέστρεψε με 100.0% μέσω OCR.

Υπάρχει ένα ανώτατο όριο 25 σελίδων ανά αρχείο. Το υπερμεγέθες δείγμα είναι 28 σελίδες, και η εκτέλεση διάβασε τις πρώτες 25 και εκτύπωσε μια ειδοποίηση λέγοντας το. Χωρίστε οτιδήποτε μεγαλύτερο σε έναν αναγνώστη PDF και στείλτε το υπόλοιπο ως δεύτερη εκτέλεση. Ένα ακόμα πράγμα που αξίζει να γνωρίζετε πριν ξεκινήσετε: ένα PDF τραβά περίπου 1,3 MB για τον αναγνώστη πάνω από τη μηχανή OCR και το μοντέλο, και αυτή η λήψη OCR συμβαίνει ακόμα και όταν κάθε σελίδα αποδεικνύεται ψηφιακή και δεν χρειάζεται αναγνώριση.
Η περίπτωση απορρήτου είναι ισχυρότερη εδώ από ότι είναι για τα στιγμιότυπα. Οι τραπεζικές καταστάσεις, οι μισθοδοσίες και οι σαρώσεις μιας ταυτότητας είναι τα έγγραφα από τα οποία οι άνθρωποι θέλουν πιο πολύ να εξάγουν κείμενο, και είναι αυτά που θα θέλατε λιγότερο να παραδώσετε σε έναν ξένο διακομιστή. Η σελίδα PDF λειτουργεί όπως το εργαλείο εικόνας σε κείμενο, με το αρχείο να διαβάζεται από τον δίσκο σας στην καρτέλα και τίποτα να μην αποστέλλεται πουθενά. Αν η πηγή σας είναι ένα PDF, ξεκινήστε εκεί αντί να κάνετε στιγμιότυπα κάθε σελίδας.