PDF a Texto — Extractor de Texto en Línea Gratis
Extrae el texto de un PDF digital o escaneado, directamente en tu navegador. Gratis, sin registro y el PDF nunca sale de tu dispositivo.
¿Quieres agradecernos? ¡Dile a tus amigos sobre LeanImg!
Cómo Convertir un PDF a Texto
Elige tu PDF
Suelta el archivo en la caja o selecciónalo de tu dispositivo. PDFs digitales, PDFs escaneados y archivos que mezclan los dos funcionan.
Elige un idioma y extrae
Elige el idioma del documento, luego comienza la extracción. Las páginas con una capa de texto se leen de inmediato. Las páginas que necesitan OCR se reconocen una tras otra, con el progreso mostrado a medida que cada una aterriza.
Copia o descarga el texto
Lee el resultado, cópialo a tu portapapeles o guárdalo como un archivo .txt con las páginas etiquetadas.
Cómo funciona la extracción de PDF a texto
Un PDF es un contenedor, y lo que hay dentro decide cómo sale el texto. Un archivo exportado de un procesador de texto, un navegador o una aplicación de contabilidad lleva una capa de texto. Los caracteres se almacenan como caracteres, junto con su posición en la página. Leer esa capa te da el texto exactamente como lo almacena el archivo. No se ejecuta ningún paso de reconocimiento, así que no hay nada que pueda salir mal.
Un PDF escaneado es algo diferente que lleva la misma extensión de archivo. Un escáner o una cámara de teléfono produjeron una imagen de cada página, y la imagen se envolvió en un PDF. No hay caracteres en el archivo, solo píxeles que parecen caracteres para el ojo humano. Extraer palabras de él necesita OCR, que renderiza la página y compara formas con un modelo entrenado para el idioma que elijas.
El extractor revisa cada página antes de decidir. Si la página tiene una capa de texto utilizable, esa capa se lee y el resultado es exacto. Si no, la página se renderiza como una imagen y se envía a través del mismo motor OCR que impulsa el extractor de imágenes. Los archivos que mezclan los dos reciben ambos tratamientos, una página a la vez, y el resumen en el resultado dice qué método utilizó cada página. Cada archivo se lee hasta 25 páginas por PDF.
Los estados de cuenta bancarios, identificaciones y contratos permanecen en tu dispositivo
Los documentos de los que la gente más quiere extraer texto son los que menos deberían estar dispuestos a subir. Estados de cuenta bancarios, recibos de sueldo, formularios de impuestos, contratos firmados, cartas médicas y escaneos de un pasaporte o una tarjeta de identificación. Cada uno de esos es un archivo que no enviarías por correo a un extraño, y entregárselo a un sitio web que encontraste en un resultado de búsqueda es el mismo acto con menos pasos.
Este extractor no tiene un punto de subida. Tu PDF se lee desde el disco en la página, abierto por un lector de PDF que se ejecuta en tu navegador y convertido en texto en memoria. Las solicitudes que hace la página son para su propia maquinaria: el lector en sí y, cuando una página necesita OCR, el motor de reconocimiento y el modelo de idioma. Todos ellos se sirven desde este sitio, y solo viajan hacia ti.
No tienes que tomar eso como fe. Abre la pestaña de red de tu navegador antes de comenzar una ejecución, luego mírala mientras aparece el texto. Verás la maquinaria llegando y nada llevando tu documento. Esa es una afirmación que puedes verificar en menos de un minuto, lo cual es más de lo que te da una política de privacidad.
Lo que esta herramienta no hace
Esta página va en una sola dirección. Lee un PDF y te da texto plano. No escribe un PDF. No devuelve un PDF buscable con una capa de texto añadida. No reconstruye tu documento como un archivo de procesador de texto con el diseño original intacto. Lo que obtienes son las palabras.
Tampoco fusiona, divide, rota, comprime o protege con contraseña nada. Hay sitios para todo eso, y la mayoría de ellos necesitan tu archivo en su servidor para hacer el trabajo. Ese es el intercambio que esta página está diseñada para evitar.
Si quieres ir en la otra dirección y convertir fotos o escaneos en un solo PDF, el convertidor de JPG a PDF en este sitio lo hace. Funciona en el navegador exactamente de la misma manera que esta página. Si tu fuente es una captura de pantalla o una fotografía en lugar de un PDF, el extractor de imágenes es la página que deseas.
¿Por qué LeanImg?
El PDF se lee en tu dispositivo, página por página, y el texto se queda allí con él. Explora todas nuestras herramientas de imagen gratuitas para mantener el resto de tu flujo de trabajo en el navegador también.
Nada se Sube
Los estados de cuenta bancarios, identificaciones y contratos son exactamente los archivos que no deberías enviar al servidor de un extraño. Esta herramienta no tiene servidor al que enviarlos.
Exacto Donde Puede Ser
Los PDFs digitales se leen de su capa de texto textualmente. Solo las páginas escaneadas pasan por OCR, y cada resultado indica qué método se utilizó.
Gratis e Ilimitado
Sin registro, sin créditos, sin marcas de agua y sin nivel de pago. Hasta 25 páginas por PDF, tantos PDFs como necesites.
Cómo lucen los números
Cuatro PDFs pasaron por este extractor con su texto conocido de antemano. La puntuación es una comparación carácter por carácter de la salida contra ese texto. Tres de los archivos eran digitales, exportados directamente desde un navegador, por lo que los caracteres ya estaban dentro de ellos. El escaneado se hizo al pasar una captura de pantalla por el convertidor de JPG a PDF de este sitio, que deja una imagen de una página y ningún carácter en absoluto. La última fila es un archivo de 28 páginas. Se construyó para superar el límite de páginas, por lo que ninguna de ellas fue puntuado por precisión.
| Fixture | Páginas | Método | Similitud |
|---|---|---|---|
| PDF digital | 1 de 1 | Capa de texto | 100.0% |
| PDF escaneado | 1 de 1 | OCR | 100.0% |
| PDF digital de tres páginas | 3 de 3 | Capa de texto | 100.0% |
| PDF sobredimensionado | 25 de 28 | Capa de texto | No puntuado |
Dos métodos produjeron esas filas, y el archivo decide cuál se ejecuta. Cada página se verifica primero para una capa de texto, y cuando los caracteres están allí se leen textualmente sin ningún paso de reconocimiento. Ahí es donde pertenece la palabra exacta, y en ningún otro lugar de esta página. Una página sin capa de texto utilizable se renderiza como una imagen y se entrega al mismo motor de OCR que lee capturas de pantalla, por lo que lleva la precisión de ese motor y sus modos de fallo. Los archivos que mezclan los dos reciben ambos tratamientos, una página a la vez.
El resultado te dice cuál ocurrió. Un PDF leído completamente desde su capa de texto está etiquetado como exacto, y la tarjeta no lleva ninguna puntuación de confianza para ello. Cualquier documento con una página de OCR muestra una puntuación. Un documento de más de una página también lleva una línea contando las páginas leídas desde la capa de texto frente a las páginas que pasaron por OCR. Esa puntuación es un promedio ponderado por caracteres a través de todo el documento, y las páginas de la capa de texto entran en él a 100. En un archivo mixto, léelo como cuánto del texto es confiable, no como qué tan bien lo hizo OCR. La línea de resumen por página es lo que te dice cuántas páginas fueron reconocidas en absoluto.
Qué se descarga en el primer uso
Ambos motores se ejecutan en tu máquina, por lo que deben llegar allí primero. Abrir un PDF obtiene el trabajador pdf.js, que es de aproximadamente 1.3 MB. El motor de OCR y un modelo de lenguaje vienen con él, alrededor de 6 MB en total, y llegan incluso cuando cada página resulta ser digital y no se ejecuta ningún reconocimiento. Esa es una descarga desperdiciada en un archivo digital. Es una limitación actual y solucionarlo está en la lista.
Todo se sirve desde este sitio y nada de un CDN de terceros. Tu navegador almacena en caché todo, por lo que el siguiente PDF en ese idioma comienza sin nada que buscar. Los documentos construidos con fuentes inusuales extraen un archivo más pequeño para los mapas de caracteres, y solo esos documentos lo hacen. Nada viaja en la otra dirección. Tu PDF se lee desde el disco en la página y se abre en memoria, y ninguna solicitud lo lleva fuera.
Dónde están los límites
Un PDF obtiene 25 páginas. El fixture sobredimensionado contiene 28 de ellas, y la ejecución tomó las primeras 25 y lo dijo en la tarjeta de resultado. Un documento más largo aún te da algo, y la forma de proceder es dividir el archivo en un lector de PDF y enviar las páginas restantes como una segunda ejecución.
Un PDF protegido por contraseña es rechazado. No se puede abrir sin su contraseña, y esta página no te pedirá una. El extractor dice exactamente eso y se detiene. Abre el archivo en el lector que ya usas, guarda una copia con la contraseña eliminada y ejecuta esa copia.
El orden de lectura es el límite más silencioso. Una capa de texto registra dónde se encuentra cada grupo de caracteres en la página y nada sobre lo que significa, por lo que columnas, barras laterales y notas al pie pueden regresar en un orden que tu ojo nunca tomaría. Las tablas pierden la cuadrícula y llegan como el contenido de sus celdas en secuencia. La prosa directa casi siempre está bien. Un formulario lleno o una página de dos columnas vale la pena leer antes de confiar en ella.
La escritura a mano en un escaneo está fuera de este motor. Está entrenado en caracteres impresos, y una línea escrita a mano regresa como ruido con forma de texto. Un escaneo que mezcla impresión con escritura a mano te da la parte impresa y tonterías en lugar de la escritura.
Un límite más que vale la pena conocer: un escaneo que ya fue OCRizado por otro software lleva la capa de texto invisible de ese software, y esta herramienta lo lee textualmente. El resultado es exacto al archivo, no necesariamente al papel del que fue escaneado.
Preguntas Frecuentes
¿Cuál es la diferencia entre un PDF digital y un PDF escaneado?
Un PDF digital fue producido por software, por lo que contiene los caracteres en sí. Un PDF escaneado es un conjunto de imágenes de páginas producidas por un escáner o una cámara, por lo que no contiene caracteres en absoluto. Esa diferencia decide todo sobre el resultado. El archivo digital te da texto exacto. El archivo escaneado tiene que ser reconocido, y el reconocimiento es muy bueno en escaneos limpios y menos bueno en escaneos torcidos, borrosos o mal iluminados. Por lo general, puedes decir qué tipo tienes al abrir el archivo en un lector de PDF y tratar de seleccionar una línea de texto con el mouse. Si la selección resalta palabras, hay una capa de texto.
¿Es el texto extraído exacto para PDFs digitales?
Para páginas con una capa de texto real, sí. Los caracteres se leen del archivo en lugar de ser reconocidos de una imagen, por lo que no se ejecuta OCR sobre ellos y no hay nada que malinterpretar. El orden de lectura es lo único que aún puede sorprenderte, porque la capa de texto almacena dónde se encuentra cada grupo de caracteres en lugar de lo que significa, por lo que una página con columnas o barras laterales puede salir en un orden que no coincide con el movimiento de tu ojo. Las palabras en sí son las palabras en el archivo. Las páginas sin capa de texto pasan por OCR en su lugar, y esas tienen la precisión de reconocimiento habitual.
¿Cuántas páginas puedo extraer a la vez?
Hasta 25 páginas por PDF. Se acepta un archivo más largo: se extraen las primeras 25 páginas y un aviso en el resultado te dice cuántas páginas se dejaron fuera. El límite está ahí porque el trabajo se ejecuta en tu propio hardware, y un documento escaneado largo significa un paso de OCR por página dentro de la pestaña de tu navegador. Si necesitas el resto, divide el archivo en un lector de PDF y ejecuta las páginas restantes como un segundo archivo.
¿Puedo extraer texto de un PDF protegido por contraseña?
No. Un PDF encriptado no se puede abrir sin su contraseña, y esta página no te pide una ni intenta eludir la protección. Obtienes un error claro en lugar de un resultado en blanco. Abre el archivo en el lector que normalmente usas, autentica de la manera que normalmente lo haces, guarda una copia con la contraseña eliminada y ejecuta esa copia aquí.
¿Mi PDF se sube a un servidor?
No. El archivo se lee desde tu disco en la página y se abre con un lector de PDF que se ejecuta en tu navegador. No hay un punto de carga en este sitio para recibirlo. Ese es el objetivo principal para los documentos que la gente realmente trae a una herramienta como esta: estados de cuenta bancarios, recibos de sueldo, formularios de impuestos, contratos firmados y escaneos de una identificación. Observa la pestaña de red durante una ejecución y verás el lector y el modelo de OCR llegando, y nada saliendo con tu documento.
¿Qué idiomas puede leer?
El lado de OCR lee inglés, español, rumano, árabe, griego, turco, indonesio, ruso y japonés. Elige el idioma antes de extraer, porque el motor compara formas con el modelo que eliges y el modelo incorrecto lee mal. Las páginas que ya tienen una capa de texto ignoran completamente la configuración, ya que esos caracteres se leen del archivo tal como están, independientemente del guion en el que estén escritos.
¿Puedo extraer texto de varios PDFs a la vez?
Sí. Selecciona un lote y los archivos se procesan en secuencia en lugar de en paralelo. Cada resultado aparece tan pronto como su archivo está terminado, por lo que puedes comenzar a leer mientras el resto aún se está ejecutando. La zona de arrastre muestra el límite para una sola ejecución. El procesamiento secuencial mantiene el uso de memoria predecible, lo que es más importante en un teléfono.
¿Mantiene tablas y diseño?
No. La salida es texto plano, por lo que una tabla regresa como el contenido de sus celdas en lugar de una cuadrícula, y los encabezados, notas al pie y leyendas no se marcan como nada. El orden de lectura también puede diferir del diseño visual, porque la posición es lo que el archivo almacena y el significado no. La prosa directa casi siempre llega en el orden correcto. Una página con barras laterales, varias columnas o un formulario lleno es donde debes leer la salida antes de confiar en ella.
¿Puede leer escritura a mano en un PDF escaneado?
No, y preferiríamos decirlo aquí que dejar que lo descubras con un archivo que importa. El motor de OCR está entrenado en caracteres impresos. La escritura a mano, las firmas y los campos de formulario escritos a mano están fuera de lo que puede hacer, y lo que regresa de ellos es ruido con forma de texto. Una página escaneada que mezcla impresión con escritura a mano te da la parte impresa y tonterías donde está la escritura.
¿En qué formato está el texto extraído?
Texto plano. Cópialo en tu portapapeles con un botón o descárgalo como un archivo .txt, con las páginas separadas y etiquetadas para que puedas encontrar tu lugar en un documento largo. No hay archivo de procesador de texto, no hay PDF buscable y no se conserva ningún formato. Si necesitas las palabras en otro lugar, pégalas en un documento, una hoja de cálculo o un traductor.
¿Cómo convierto imágenes en un PDF en su lugar?
Esa es la otra dirección, y tiene su propia página en este sitio. El convertidor de JPG a PDF toma fotos o escaneos y los escribe en un solo PDF, en tu navegador, sin nada subido. Úsalo cuando tengas imágenes y necesites un documento. Usa esta página cuando tengas un documento y necesites las palabras de él.
¿Es realmente gratuito el convertidor de PDF a texto?
Sí, gratuito sin cuenta y sin contador de uso. No hay registro, no hay marca de agua en el texto, no hay créditos y no hay nivel de pago que retenga una mejor versión. La extracción se ejecuta en tu propio hardware, por lo que no hay costo por archivo en el servidor que debamos pasar a ti.
¿Trabajando con imágenes en su lugar? Extraer texto de imágenes lee capturas de pantalla, escaneos y fotos de documentos. ¿Yendo en la otra dirección? Convierte imágenes en un PDF con el convertidor de JPG a PDF.