LeanImg

¿Cómo extraigo texto de una captura de pantalla sin subirla?

Lo que realmente lee el OCR del navegador: similitud medida en seis pruebas, los 515 caracteres que inventó de una foto sin texto y el modelo de descarga por el que pagas una vez.

La mayoría de los sitios de OCR toman tu captura de pantalla, la publican en un servidor y la leen allí. Eso está bien para una foto de un menú de restaurante. Es una decisión diferente para un recibo de sueldo, una página de pasaporte o una captura de pantalla de un chat privado. Nuestra herramienta de imagen a texto realiza el reconocimiento dentro de la pestaña de tu navegador, por lo que el archivo permanece en tu disco y el texto aparece junto a él.

El motor es Tesseract, compilado a WebAssembly y enviado con la página. Tu primera ejecución descarga un script de trabajador, el núcleo de WebAssembly y un modelo de idioma. Tu navegador almacena en caché los tres. Después de eso, no queda nada por obtener.

¿Se sube mi captura de pantalla?

No. No hay un punto final de carga en esta base de código que pueda recibir una. El único tráfico de red que hace la herramienta es de mismo origen: 3 solicitudes que totalizan alrededor de 6 MB para inglés, cada una de ellas servida desde este dominio. Tu archivo se decodifica dentro de la página, se entrega al motor como píxeles y se convierte en texto allí. Abre la pestaña de red durante una ejecución y verás los fragmentos del modelo llegando y nada llevando tu imagen. Nuestra página de privacidad enumera las únicas cosas que recopilamos, que son vistas de página y conteos anónimos de herramientas.

Los competidores funcionan al revés. Smallpdf y iLovePDF realizan el reconocimiento en sus propias máquinas, por lo que tu archivo tiene que llegar a ellos antes de que ocurra algo. Su respuesta a la pregunta de privacidad es una promesa de retención: la copia se elimina después de un tiempo. Citamos su redacción de retención en la guía de JPG a PDF. Una promesa de retención te dice cuánto tiempo permanece el escaneo de tu pasaporte en el disco de otra persona. No dice nada sobre si llega allí. Aquí esa pregunta no surge.

¿Qué tan preciso es en una captura de pantalla real?

Lo medimos. Seis pruebas con texto conocido pasaron por el motor el 2026-08-11, y la puntuación a continuación es una comparación carácter por carácter de la salida contra el texto que sabíamos que estaba en la imagen. Las pruebas son sintéticas: páginas HTML renderizadas en un navegador y capturadas como capturas de pantalla reales, con la degradada desenfocada y rotada en CSS para imitar una mala captura de teléfono.

Ejecuciones reales en hardware de escritorio, 2026-08-11. La puntuación japonesa se toma con el espaciado normalizado. Las duraciones se omiten porque un teléfono será más lento.
PruebaIdiomaSimilitudConfianza
Captura de pantalla limpiaInglés100.0%95
Párrafo densoInglés100.0%95
Captura degradada simuladaInglés92.4%65
Muestra rusaRuso100.0%96
Muestra japonesaJaponés100.0%93
Foto sin texto en ellaInglés515 caracteres de texto inventado32
Tres tarjetas de resultado en la herramienta de imagen a texto: clean-screenshot.png y dense-paragraph.png ambas con 95% de confianza con texto limpio; degraded.png a 65% con palabras confusas
Éxito y fracaso en un solo marco. La captura degradada en la parte inferior se abre con "ea auaracer recognition" donde la fuente dice "Reconocimiento óptico de caracteres".

Dos de las pruebas en inglés volvieron con 100.0%, carácter por carácter, ambas con confianza 95. La copia desenfocada y rotada del mismo párrafo llegó a 92.4% y confianza 65. Eso son 7.6 puntos de similitud perdidos, y la figura anterior muestra dónde fue: las palabras de apertura están distorsionadas mientras que el medio del párrafo sobrevive. La confianza 65 también activa la advertencia de baja confianza en la tarjeta, por lo que se te informa antes de copiar.

¿Qué pasa si no hay texto en la imagen?

Esta es la parte que otras páginas de OCR omiten. Le entregamos al motor una fotografía oscura de mariposas sobre un tronco musgoso, y no hay escritura en ninguna parte. Devolvió 515 caracteres de texto que nunca existieron. Eso es lo que hacen los motores de OCR. Están diseñados para encontrar formas de caracteres, por lo que el grano y la textura se informan como caracteres, y ninguna etapa en la cadena decide que una imagen está en blanco.

No afirmamos detectar una imagen vacía, porque no podemos. Cada resultado lleva su puntuación de confianza, y se activa una advertencia cuando el promedio cae por debajo de 60. Esa foto obtuvo 32. Una captura de pantalla limpia obtiene 95. La distancia entre esos dos números es la señal, y está impresa en la tarjeta antes de que toques el texto.

¿Lee ruso y japonés?

Nueve idiomas: inglés, español, rumano, árabe, griego, turco, indonesio, ruso y japonés. Elige uno antes de extraer, porque el motor compara formas con el modelo que elegiste y el modelo incorrecto lee mal. No hay detección automática aún. Ambas pruebas no latinas volvieron limpias, ruso con 100.0% y confianza 96, japonés con 100.0% y confianza 93 una vez que el espaciado está normalizado, ya que el motor inserta espacios entre los caracteres japoneses.

Tarjetas de resultado para russian.png con 96% de confianza y japanese.png con 93%, ambas mostrando texto extraído correctamente, sobre una barra de lote que dice Texto extraído de 6 imagen(es)
Pruebas rusas y japonesas, leídas correctamente en el mismo lote que las inglesas.

Cada idioma es un archivo de modelo separado, tessdata_fast del proyecto Tesseract, servido desde este dominio como todo lo demás. Agregar uno cuesta entre aproximadamente 0.6 y 2 MB la primera vez que lo seleccionas, y los nueve juntos son aproximadamente 11 MB. Tu navegador los mantiene, por lo que es un costo único por idioma y la segunda ejecución en cualquier idioma comienza inmediatamente.

¿Cuándo no deberías usar esto?

Escritura a mano. El proyecto Tesseract lo dice claramente: puedes apuntarlo a la escritura a mano, y no funcionará muy bien, porque el motor está diseñado para texto impreso. El texto fotografiado en una escena es el otro caso débil, el letrero de la tienda y la etiqueta del estante. La selección de texto incorporada de tu teléfono maneja esos mejor, y un servicio entrenado en escritura a mano nos superará en una carta de tu abuela. Preferiríamos decir eso que tomar la ejecución y entregarte un párrafo confuso.

Para todo lo demás, las notas de calidad de Tesseract coinciden con lo que vimos en las pruebas: caracteres más grandes y nítidos se leen mejor, y texto oscuro sobre un fondo claro es el caso fácil. Captura la fuente donde puedas. Donde no puedas, dispara directamente con luz uniforme y llena el marco con el texto.

¿Qué hago con la imagen después?

La salida es texto plano. Cópialo con el botón, que utiliza la API del portapapeles del navegador. Descarga un .txt por imagen, o lleva todo el lote como un solo archivo. Tu imagen no se toca en nada de esto. Si tiene que hacerse más pequeña antes de enviarla, el compresor lo hace en la misma pestaña y el redimensionador cambia las dimensiones en píxeles. Haz cualquiera de los dos después de la extracción. Reducir una captura de pantalla primero desecha los píxeles de los que están hechos los caracteres.

Dos cadenas que vale la pena conocer. Una foto HEIC de un iPhone entra directamente, decodificada por el navegador antes de que el motor la vea, por lo que no hay un paso de conversión de formato que hacer primero. Y si solo quieres un bloque de texto de una larga captura de pantalla, pásalo primero por el recortador, para que la salida sea la parte que pediste y nada más. El otro modelo que se ejecuta localmente en este sitio es el que decide qué píxeles son el sujeto.

Pruébalo en la peor captura de pantalla que tengas. Suéltalo en la herramienta de imagen a texto, elige el idioma, luego lee el número de confianza antes del texto.

¿Qué pasa con los PDFs?

Un PDF se divide en dos antes de que se aplique cualquiera de esto. Un archivo exportado de un procesador de texto o un navegador lleva una capa de texto, por lo que los caracteres ya están allí y sacarlos no implica ningún reconocimiento. Un archivo que salió de un escáner o un teléfono es una imagen envuelta en un PDF, y necesita el mismo paso de OCR que una imagen. Nuestra página de PDF a texto revisa cada página y selecciona, y cómo decide qué páginas fueron leídas exactamente y cuáles fueron reconocidas es la descripción más larga. En las pruebas, un archivo digital nativo y un archivo digital de tres páginas volvieron con 100.0% directamente de la capa de texto, y una página escaneada construida con el propio convertidor de JPG a PDF de este sitio volvió con 100.0% a través de OCR.

Tres tarjetas de resultado de PDF que muestran una extracción de capa de texto, una extracción de OCR y un resumen de página
digital.pdf vuelve etiquetado como "Capa de texto: exacta" con el párrafo tal cual. scanned.pdf pasó por OCR, y la tarjeta informa una confianza de 93% para ese paso. multipage.pdf lee "3 páginas: 3 leídas exactamente de la capa de texto, 0 a través de OCR."

Hay un límite de 25 páginas por archivo. La prueba de sobre tamaño es de 28 páginas, y la ejecución leyó las primeras 25 e imprimió un aviso diciendo eso. Divide cualquier cosa más larga en un lector de PDF y envía el resto como una segunda ejecución. Una cosa más que vale la pena saber antes de comenzar: un PDF consume alrededor de 1.3 MB para el lector además del motor de OCR y el modelo, y esa descarga de OCR aún ocurre cuando cada página resulta ser digital y no necesita reconocimiento.

El caso de privacidad es más fuerte aquí que para las capturas de pantalla. Los estados de cuenta bancarios, recibos de sueldo y escaneos de una identificación son los documentos de los que la gente más quiere extraer texto, y son los que menos querrías entregar al servidor de un extraño. La página de PDF funciona de la misma manera que la herramienta de imagen a texto, con el archivo leído de tu disco en la pestaña y nada enviado a ninguna parte. Si tu fuente es un PDF, comienza allí en lugar de capturar cada página.