LeanImg

Πώς μπορώ να εξάγω κείμενο από ένα PDF χωρίς να το ανεβάσω;

Ένα ψηφιακό PDF αποκαλύπτει το κείμενό του ακριβώς και μια σάρωση πρέπει να αναγνωριστεί. Ποιο από τα δύο έχετε, τι έκαναν τα έξι μετρημένα δείγματα, το όριο των 25 σελίδων και η λήψη που πληρώνετε είτε έτσι είτε αλλιώς.

· Updated

Δύο αρχεία μπορεί να τελειώνουν και τα δύο σε .pdf και να χρειάζονται εντελώς διαφορετική εργασία για να βγάλουν τις λέξεις. Το ένα εκτυπώθηκε σε PDF από έναν επεξεργαστή κειμένου και ήδη περιέχει τους χαρακτήρες. Το άλλο είναι μια φωτογραφία χαρτιού σε ένα περιτύλιγμα PDF. Η σελίδα μας για PDF σε κείμενο ανοίγει το αρχείο στην καρτέλα του προγράμματος περιήγησής σας, ελέγχει κάθε σελίδα και επιλέγει τι χρειάζεται αυτή η σελίδα. Το έγγραφό σας δεν φεύγει ποτέ από τον δίσκο.

Δύο μηχανές μοιράζονται την καρτέλα. pdf.js, ο αναγνώστης PDF της Mozilla, αναλύει το έγγραφο και παραδίδει είτε το αποθηκευμένο κείμενο είτε μια αποδομένη εικόνα της σελίδας. Το Tesseract που έχει μεταγλωττιστεί σε WebAssembly αναγνωρίζει μια σελίδα όταν αποδεικνύεται ότι είναι μια εικόνα. Και οι δύο εξυπηρετούνται από αυτό το domain και αποθηκεύονται στην cache μετά την πρώτη σας εκτέλεση.

Γιατί ένα PDF είναι ακριβές και ένα άλλο αναγνωρίζεται;

Ένα PDF είναι ένα δοχείο, και η προδιαγραφή ISO 32000-1 του δίνει ένα μέρος για να αποθηκεύει τους τελεστές κειμένου μαζί με τη θέση τους στη σελίδα. Το λογισμικό που δημιουργεί ένα PDF γράφει πραγματικούς χαρακτήρες εκεί, οπότε η ανάκτηση τους είναι μια ανάγνωση. Τίποτα δεν μαντεύεται. Αυτό είναι το μόνο μέρος όπου η λέξη ακριβές ανήκει.

Μια σάρωση δεν περιέχει καθόλου χαρακτήρες. Κάτι φωτογράφισε κάθε σελίδα και η εικόνα τυλίχθηκε σε ένα PDF, οπότε αυτές οι σελίδες αποδίδονται και περνούν από OCR μία προς μία. Κληρονομούν την ακρίβεια και τους τρόπους αποτυχίας της μηχανής, τους οποίους μετρήσαμε σε στιγμιότυπα στην αναφορά εικόνας σε κείμενο. Ίδια μηχανή, ίδια μοντέλα.

Πώς αποφασίζει ότι μια σελίδα είναι σάρωση;

Μετρώντας, σελίδα προς σελίδα. Διαβάζει πρώτα τη στρώση κειμένου και μετρά τους χαρακτήρες σε αυτήν που δεν είναι κενά. Περισσότεροι από 20 και η σελίδα λαμβάνεται κατά λέξη και χαρακτηρίζεται ακριβής. Είκοσι ή λιγότεροι και η σελίδα αποδίδεται και αποστέλλεται σε OCR. Μια σελίδα που είναι ψηφιακή καθαρίζει αυτή τη γραμμή με μεγάλη διαφορά: η πυκνή διάταξη που δοκιμάζουμε περιέχει 426 χαρακτήρες.

Η γραμμή υπάρχει για να πιάσει τη σάρωση που εξακολουθεί να έχει ένα απομονωμένο αντικείμενο κειμένου, έναν αριθμό σελίδας ή μια σφραγίδα κεφαλίδας, που διαφορετικά θα επιστρέφονταν ως ολόκληρη η σελίδα. Είναι ένα κατώφλι και όχι μια δοκιμή, οπότε έχει ένα όριο. Μια σάρωση που φέρει περισσότερους από 20 χαρακτήρες απομονωμένου κειμένου καθαρίζει τη γραμμή, και παίρνετε την κεφαλίδα χαρακτηρισμένη ακριβής ενώ το σώμα παραμένει κλειδωμένο στην εικόνα. Η περίληψη της σελίδας είναι όπου αυτό εμφανίζεται: ένα έγγραφο που ξέρετε ότι είναι σκαναρισμένο που αναφέρει σελίδες που διαβάστηκαν από τη στρώση κειμένου είναι η περίπτωση που πρέπει να εξετάσετε.

Σε ποια ανάλυση διαβάζεται μια σκαναρισμένη σελίδα;

200 DPI. Ένα PDF μετρά τις σελίδες του σε μονάδες του 72ου της ίντσας, οπότε η απόδοση μιας σελίδας σε κλίμακα 1 τοποθετεί το κείμενο γύρω από 10 pixels ύψος, κάτω από τα περίπου 20 pixels όπου η ακρίβεια αναγνώρισης μειώνεται. Η απόδοση σε 200 DPI τοποθετεί αυτό το κείμενο κοντά στα 28 pixels και κάνει μια σελίδα US Letter 1700x2200, που είναι η σύμβαση σάρωσης που ακολουθεί αυτό το εργαλείο.

Υπάρχει μια δεύτερη οροφή πίσω από αυτό: 4096 pixels στην πιο μεγάλη πλευρά, που εφαρμόζεται μετά την κλίμακα DPI. Μια κανονική σελίδα δεν είναι πουθενά κοντά σε αυτό. Μια σελίδα μεγαλύτερη από περίπου 20 ίντσες κλιμακώνεται πίσω για να χωρέσει και διαβάζεται σε λιγότερο από 200 DPI, ανάλογα με το πόσο υπερέβη. Ένα σχέδιο ή μια αφίσα είναι αυτό που χτυπά αυτό, και τίποτα στην κάρτα δεν σας προειδοποιεί.

Τι έδειξαν οι μετρημένες εκτελέσεις;

Έξι δείγματα πέρασαν από τη μηχανή στις 2026-08-12, σε υλικό υπολογιστή. Η ομοιότητα συγκρίνει την έξοδο με το κείμενο που γνωρίζαμε ότι ήταν στο έγγραφο, χαρακτήρα προς χαρακτήρα.

Πραγματικές εκτελέσεις, 2026-08-12. Οι διάρκειες παραλείπονται επειδή αυτές ήταν μετρήσεις υπολογιστή και ένα τηλέφωνο είναι πιο αργό.
ΔείγμαΣελίδες που διαβάστηκανΜέθοδοςΟμοιότητα
Ψηφιακό PDF1 από 1Στρώση κειμένου100,0%
Σκαναρισμένη σελίδα1 από 1OCR100,0%
Τριών σελίδων ψηφιακό PDF3 από 3Στρώση κειμένου100,0%
28-σελίδων έγγραφο25 από 28Στρώση κειμένουχωρίς βαθμολογία
Κατεστραμμένο αρχείοκανέναΑπορρίφθηκεχωρίς βαθμολογία
Αρχείο με προστασία κωδικού πρόσβασηςκανέναΑπορρίφθηκεχωρίς βαθμολογία
Τρεις κάρτες αποτελεσμάτων PDF: digital.pdf χαρακτηρισμένη Στρώση κειμένου ακριβής, scanned.pdf που φέρει σκορ εμπιστοσύνης 93% από την εκτέλεση OCR και multipage.pdf που συνοψίζει τρεις σελίδες που διαβάστηκαν από τη στρώση κειμένου.
Η κάρτα ονομάζει τη μέθοδο πριν διαβάσετε μια λέξη από την έξοδο. Το digital.pdf επιστρέφει χαρακτηρισμένο "Στρώση κειμένου: ακριβής" χωρίς σκορ να συνδέεται με αυτό. Το scanned.pdf πέρασε από OCR και αναφέρει 93% εμπιστοσύνη για αυτή την εκτέλεση. Το multipage.pdf διαβάζει "3 σελίδες: 3 διαβασμένες ακριβώς από τη στρώση κειμένου, 0 μέσω OCR."

Το σκαναρισμένο δείγμα επέστρεψε επίσης στο 100,0%, και αυτή η γραμμή χρειάζεται ένα αστερίσκο. Το κατασκευάσαμε σπρώχνοντας μια εικόνα μέσω του δικού μας μετατροπέα JPG σε PDF, οπότε είναι καθαρός αποδομένος τύπος χωρίς φακό και χωρίς κλίση. Ο σαρωτής της τράπεζάς σας είναι η πιο δύσκολη περίπτωση. Ένα πακέτο τεσσάρων αρχείων με το έγγραφο 25 σελίδων πήρε 3,0 δευτερόλεπτα χρόνου τοίχου σε υπολογιστή.

Τι μετράει πραγματικά το σκορ εμπιστοσύνης;

Μετράει την εκτέλεση OCR, και μόνο σε σελίδες όπου τρέχει το OCR. Οι σελίδες της στρώσης κειμένου εισέρχονται στο μέσο στο 100 κατά τον ορισμό, οπότε ένα αρχείο με μια κακή σάρωση θαμμένη σε μια στοίβα ψηφιακών σελίδων αναφέρει ακόμα έναν άνετο αριθμό. Σε ένα μικτό έγγραφο, αυτό το μέσο σας λέει πόσο από το κείμενο είναι αξιόπιστο. Η γραμμή περίληψης της σελίδας είναι αυτή που απαντά στην ερώτηση OCR. "3 σελίδες: 3 διαβασμένες ακριβώς από τη στρώση κειμένου, 0 μέσω OCR" σημαίνει ότι τίποτα δεν αναγνωρίστηκε. Ένα PDF που διαβάζεται εξ ολοκλήρου από τη στρώση κειμένου δεν φέρει σκορ.

Τι συμβαίνει στη σελίδα 26;

Ένα PDF έχει 25 σελίδες. Το υπερμεγέθες δείγμα περιέχει 28, και η εκτέλεση διάβασε τις πρώτες 25 και εκτύπωσε μια ειδοποίηση στην κάρτα λέγοντας το. Τίποτα δεν αποτυγχάνει ήσυχα. Για οτιδήποτε μεγαλύτερο θα θέλετε να το χωρίσετε σε όποιον αναγνώστη PDF έχετε, και στη συνέχεια να στείλετε το υπόλοιπο ως δεύτερη εκτέλεση.

Δύο τύποι αρχείων απορρίπτονται άμεσα. Ένα κατεστραμμένο PDF απορρίπτεται με τη δική του διατύπωση του pdf.js, "Μη έγκυρη δομή PDF.", που φτάνει στα Αγγλικά σε κάθε τοπική γλώσσα επειδή προέρχεται από τον αναγνώστη και όχι από τις μεταφράσεις μας. Ένα PDF με προστασία κωδικού πρόσβασης απορρίπτεται επίσης, και αυτή η σελίδα δεν θα σας ζητήσει τον κωδικό πρόσβασης. Αφαιρέστε την προστασία στον αναγνώστη που ήδη χρησιμοποιείτε, και στη συνέχεια εκτελέστε την αντίγραφο.

Είναι ασφαλές να περάσετε μια κατάσταση τραπέζης από εδώ;

Αυτή είναι η περίπτωση για την οποία κατασκευάστηκε το εργαλείο. Οι μισθοδοσίες, οι συμβάσεις και οι σαρώσεις μιας ταυτότητας είναι τα έγγραφα από τα οποία οι άνθρωποι θέλουν περισσότερο να εξάγουν κείμενο, και είναι τα τελευταία που θα θέλατε να βρίσκονται σε μηχάνημα ξένου. Δεν υπάρχει σημείο ανάρτησης σε αυτόν τον κωδικό που θα μπορούσε να λάβει ένα. Ανοίξτε την καρτέλα δικτύου κατά τη διάρκεια μιας εκτέλεσης: τα κομμάτια της μηχανής φτάνουν από αυτό το domain και τίποτα δεν μεταφέρει το έγγραφό σας μακριά.

Οι μεγάλες υπηρεσίες PDF λειτουργούν αντίστροφα. Το αρχείο σας φτάνει πρώτα στις μηχανές τους, και η απάντησή τους στην ερώτηση ιδιωτικότητας είναι μια υπόσχεση διατήρησης: το αντίγραφο διαγράφεται μετά από κάποιο αριθμό ωρών. Αναφέραμε αυτή τη διατύπωση στην πρώτη άρθρο αυτής της σειράς. Σας λέει πόσο καιρό η μισθοδοσία σας κάθεται στον δίσκο κάποιου άλλου. Εάν φτάσει εκεί είναι μια ξεχωριστή ερώτηση. Η σελίδα ιδιωτικότητας μας απαριθμεί τι συλλέγουμε.

Πότε είναι αυτό το λάθος εργαλείο;

Χειρόγραφα. Το έργο Tesseract το λέει καθαρά: μπορείτε να το δείξετε σε χειρόγραφα και δεν θα λειτουργήσει πολύ καλά, επειδή η μηχανή κατασκευάστηκε για εκτυπωμένους χαρακτήρες. Μια σκαναρισμένη φόρμα με πληκτρολογημένες ετικέτες και χειρόγραφες απαντήσεις σας δίνει τις ετικέτες και τον θόρυβο όπου ήταν οι απαντήσεις. Σπάνια αξίζει την εκτέλεση.

Η διάταξη είναι η άλλη περίπτωση. Μια στρώση κειμένου καταγράφει πού κάθε σειρά χαρακτήρων κάθεται και τίποτα για το τι σημαίνει οτιδήποτε από αυτά, οπότε μια σελίδα δύο στηλών ή ένα μπλοκ υποσημειώσεων μπορεί να επιστρέψει σε μια σειρά που το μάτι σας δεν θα έπαιρνε ποτέ. Οι πίνακες χάνουν το πλέγμα και φτάνουν ως περιεχόμενα κελιών στη σειρά. Η ευθεία πρόζα είναι σχεδόν πάντα εντάξει. Ένα ανακατασκευασμένο έγγραφο με την αρχική διάταξη δεν είναι κάτι που παράγει αυτή η σελίδα.

Για το σκαναρισμένο μισό, οι σημειώσεις ποιότητας Tesseract ταιριάζουν με αυτά που έδειξαν τα δείγματά μας: μεγαλύτεροι και πιο ευκρινείς χαρακτήρες διαβάζονται καλύτερα. Εάν φωτογραφίζετε χαρτί αντί να το σαρώσετε, ο εξαγωγέας εικόνας με κοπή μέχρι το μπλοκ κειμένου ξεπερνά το να τυλίξετε αυτή τη φωτογραφία σε PDF πρώτα.

Γιατί ένα ψηφιακό PDF κατεβάζει ακόμα μια μηχανή OCR;

Επειδή αυτός ο δρόμος δεν έχει χωριστεί ακόμα. Μια εκτέλεση PDF τραβάει τον εργάτη pdf.js, 1.262.398 bytes στην έκδοση 6.2.108 που αποστέλλουμε, συν τη μηχανή OCR και ένα γλωσσικό μοντέλο περίπου 6 MB. Αυτή η μισή OCR φορτώνει ακόμα και όταν κάθε σελίδα αποδεικνύεται ότι είναι ψηφιακή και δεν χρειάζεται αναγνώριση, οπότε σε ένα αρχείο όπως αυτό η λήψη είναι χαμένη. Είναι ένας γνωστός περιορισμός. Το υπόλοιπο του αναγνώστη είναι πιο τεμπέλικο: οι χάρτες χαρακτήρων και οι κωδικοί εικόνας φτάνουν μόνο όταν ένα έγγραφο τους χρειάζεται.

Τι να κάνω με το κείμενο μετά;

Παίρνετε απλό κείμενο. Αντιγράψτε το με το κουμπί, ή κατεβάστε ένα .txt με τις σελίδες διαχωρισμένες και χαρακτηρισμένες. Εάν η πηγή σας είναι ένα στιγμιότυπο, το εργαλείο εικόνας σε κείμενο είναι η σελίδα γι' αυτό, και τα έξι δείγματα στιγμιότυπων που βαθμολογήσαμε καλύπτουν τους 515 χαρακτήρες που εφηύρε το OCR από μια φωτογραφία χωρίς γραφή. Πηγαίνοντας προς την άλλη κατεύθυνση, ο μετατροπέας JPG σε PDF κατασκευάζει ένα έγγραφο από εικόνες και ο συμπιεστής τα μειώνει πρώτα όταν είναι βαριά.

Δοκιμάστε το στο χειρότερο PDF που έχετε. Ρίξτε το στην σελίδα PDF σε κείμενο, στη συνέχεια διαβάστε τη γραμμή περίληψης της σελίδας πριν διαβάσετε το κείμενο.