LeanImg

¿Cómo extraigo texto de un PDF sin subirlo?

Un PDF digital entrega su texto exactamente y un escaneo debe ser reconocido. Cual de los dos tienes, qué seis fijaciones medidas hicieron, el límite de 25 páginas y la descarga que pagas de cualquier manera.

· Updated

Dos archivos pueden terminar en .pdf y necesitar un trabajo completamente diferente para obtener las palabras. Uno fue impreso a PDF por un procesador de texto y ya contiene los caracteres. El otro es una fotografía de papel en un envoltorio PDF. Nuestra página de PDF a texto abre el archivo en la pestaña de tu navegador, revisa cada página y selecciona lo que esa página necesita. Tu documento nunca sale del disco.

Dos motores comparten la pestaña. pdf.js, el lector de PDF de Mozilla, analiza el documento y entrega ya sea el texto almacenado o una imagen renderizada de la página. Tesseract compilado a WebAssembly reconoce una página cuando resulta ser una imagen. Ambos se sirven desde este dominio y se almacenan en caché después de tu primera ejecución.

¿Por qué un PDF es exacto y otro es reconocido?

Un PDF es un contenedor, y la especificación ISO 32000-1 le da un lugar para almacenar operadores de texto junto con su posición en la página. El software que genera un PDF escribe caracteres reales allí, por lo que recuperarlos es una lectura. Nada se adivina. Ese es el único lugar donde la palabra exacto pertenece.

Un escaneo no contiene caracteres en absoluto. Algo fotografió cada página y la imagen fue envuelta en un PDF, por lo que esas páginas se renderizan y se envían a OCR una por una. Heredan la precisión de ese motor y sus modos de fallo, que medimos en capturas de pantalla en el artículo de imagen a texto. Mismo motor, mismos modelos.

¿Cómo decide que una página es un escaneo?

Contando, página por página. Lee primero la capa de texto y cuenta los caracteres en ella que no son espacios en blanco. Más de 20 y la página se toma textualmente y se etiqueta como exacta. Veinte o menos y la página se renderiza y se envía a OCR. Una página digital nace por un amplio margen: la fijación densa que probamos lleva 426 caracteres.

La línea está ahí para atrapar el escaneo que aún contiene un objeto de texto errante, un número de página o un sello de encabezado, que de otro modo se devolvería como toda la página. Es un umbral y no una prueba, por lo que tiene un margen. Un escaneo que lleva más de 20 caracteres de texto errante supera la línea, y obtienes el membrete etiquetado como exacto mientras el cuerpo permanece bloqueado en la imagen. El resumen de la página es donde eso aparece: un documento que sabes que está escaneado reportando páginas leídas desde la capa de texto es el caso a observar.

¿A qué resolución se lee una página escaneada?

200 DPI. Un PDF mide sus páginas en unidades de una 72ª de pulgada, por lo que renderizar una a escala 1 coloca el texto del cuerpo alrededor de 10 píxeles de altura, por debajo de los aproximadamente 20 píxeles donde la precisión del reconocimiento disminuye. Renderizar a 200 DPI coloca ese texto cerca de 28 píxeles y hace que una página de tamaño carta de EE. UU. sea de 1700 por 2200, que es la convención de escaneo que sigue esta herramienta.

Hay un segundo límite detrás de esto: 4096 píxeles en el lado más largo, aplicado después de la escala DPI. Una página ordinaria está muy lejos de eso. Una página más larga de aproximadamente 20 pulgadas se reduce para ajustarse y se lee a menos de 200 DPI, en proporción a cuánto se excedió. Un conjunto de planos o un cartel es lo que alcanza eso, y nada en la tarjeta te advierte.

¿Qué mostraron las ejecuciones medidas?

Seis fijaciones pasaron por el motor el 2026-08-12, en hardware de escritorio. La similitud compara la salida contra el texto que sabíamos que estaba en el documento, carácter por carácter.

Ejecuciones reales, 2026-08-12. Las duraciones se omiten porque estas fueron mediciones de escritorio y un teléfono es más lento.
FijaciónPáginas leídasMétodoSimilitud
PDF digital nacido1 de 1Capa de texto100.0%
Página escaneada1 de 1OCR100.0%
PDF digital de tres páginas3 de 3Capa de texto100.0%
Documento de 28 páginas25 de 28Capa de textono puntuado
Archivo corruptoningunoRechazadono puntuado
Archivo protegido por contraseñaningunoRechazadono puntuado
Tres tarjetas de resultado PDF: digital.pdf etiquetada como Capa de texto exacta, scanned.pdf con un puntaje de confianza del 93% de su pasada OCR y multipage.pdf resumiendo tres páginas leídas desde la capa de texto.
La tarjeta nombra el método antes de que leas una palabra de la salida. digital.pdf regresa etiquetada como "Capa de texto: exacta" sin puntaje adjunto. scanned.pdf pasó por OCR y reporta 93% de confianza para esa pasada. multipage.pdf lee "3 páginas: 3 leídas exactamente desde la capa de texto, 0 a través de OCR."

La fijación escaneada también regresó al 100.0%, y esa fila necesita un asterisco. La construimos empujando una imagen a través del propio convertidor JPG a PDF de este sitio, por lo que es texto renderizado nítido sin lente y sin sesgo. El escáner de tu banco es el caso más difícil. Un lote de cuatro archivos con el documento de 25 páginas tomó 3.0 segundos de reloj en un escritorio.

¿Qué mide realmente el puntaje de confianza?

Mide la pasada de OCR, y solo en páginas donde se ejecutó OCR. Las páginas de capa de texto entran en el promedio en 100 por definición, por lo que un archivo con un escaneo malo enterrado en una pila de páginas digitales aún reporta un número cómodo. En un documento mixto, ese promedio te dice cuánto del texto es confiable. La línea de resumen de la página es lo que responde a la pregunta de OCR. "3 páginas: 3 leídas exactamente desde la capa de texto, 0 a través de OCR" significa que nada fue reconocido. Un PDF leído completamente desde su capa de texto no lleva un puntaje.

¿Qué pasa en la página 26?

Un PDF tiene 25 páginas. La fijación sobredimensionada contiene 28, y la ejecución leyó las primeras 25 e imprimió un aviso en la tarjeta diciendo eso. Nada falla en silencio. Para cualquier cosa más larga querrás dividirla en cualquier lector de PDF que tengas, luego enviar el resto como una segunda ejecución.

Dos tipos de archivo son rechazados de plano. Un PDF corrupto es rechazado con la propia redacción de pdf.js, "Estructura PDF inválida.", que llega en inglés en cada localidad porque proviene del lector en lugar de nuestras traducciones. Un PDF protegido por contraseña también es rechazado, y esta página no te pedirá la contraseña. Elimina la protección en el lector que ya usas, luego ejecuta la copia.

¿Es seguro ejecutar un estado de cuenta bancario a través de esto?

Ese es el caso para el que se construyó la herramienta. Recibos de sueldo, contratos y escaneos de una identificación son los documentos de los que la gente más quiere extraer texto, y son los últimos que querrías tener en la máquina de un extraño. No hay un punto de carga en este código que pueda recibir uno. Abre la pestaña de red durante una ejecución: los fragmentos del motor llegan de este dominio y nada lleva tu documento.

Los grandes servicios de PDF funcionan al revés. Tu archivo llega primero a sus máquinas, y su respuesta a la pregunta de privacidad es una promesa de retención: la copia se elimina después de un cierto número de horas. Citamos esa redacción en el primer artículo de esta serie. Te dice cuánto tiempo tu recibo de sueldo permanece en el disco de otra persona. Si llega allí es una pregunta aparte. Nuestra página de privacidad enumera lo que recopilamos.

¿Cuándo es esta la herramienta equivocada?

Escritura a mano. El proyecto Tesseract lo dice claramente: puedes apuntarlo a la escritura a mano y no funcionará muy bien, porque el motor fue construido para caracteres impresos. Un formulario escaneado con etiquetas mecanografiadas y respuestas escritas a mano te entrega las etiquetas y ruido donde estaban las respuestas. Rara vez vale la pena la ejecución.

El diseño es el otro. Una capa de texto registra dónde se sienta cada grupo de caracteres y nada sobre lo que significa, por lo que una página de dos columnas o un bloque de notas al pie pueden regresar en un orden que tu ojo nunca tomaría. Las tablas pierden la cuadrícula y llegan como contenidos de celdas en secuencia. La prosa directa casi siempre está bien. Un documento reconstruido con el diseño original no es algo que esta página produzca.

Para la mitad escaneada, las notas de calidad de Tesseract coinciden con lo que mostraron nuestras fijaciones: caracteres más grandes y nítidos se leen mejor. Si estás fotografiando papel en lugar de escanearlo, el extractor de imágenes con un recorte hasta el bloque de texto supera envolver esa foto en un PDF primero.

¿Por qué un PDF digital aún descarga un motor OCR?

Porque ese camino aún no se ha dividido. Una ejecución de PDF extrae el trabajador de pdf.js, 1.262.398 bytes en la versión 6.2.108 que enviamos, más el motor OCR y un modelo de lenguaje de aproximadamente 6 MB. Esa mitad de OCR se carga incluso cuando cada página resulta ser digital nacida y nada necesita ser reconocido, por lo que en un archivo así la descarga es desperdiciada. Es una limitación conocida. El resto del lector es más perezoso: los mapas de caracteres y los códecs de imagen llegan solo cuando un documento los necesita.

¿Qué hago con el texto después?

Obtienes texto plano. Cópialo con el botón, o descarga un .txt con las páginas separadas y etiquetadas. Si tu fuente es una captura de pantalla, la herramienta de imagen a texto es la página para ello, y las seis fijaciones de captura de pantalla que puntuamos cubren los 515 caracteres que OCR inventó de una foto sin escritura. Yendo en la otra dirección, el convertidor JPG a PDF construye un documento a partir de imágenes y el compresor las reduce primero cuando son pesadas.

Pruébalo en el peor PDF que tengas. Suéltalo en la página de PDF a texto, luego lee la línea de resumen de la página antes de leer el texto.