Extraer texto · OCR

Extraer el texto de una imagen o un PDF

Convierte una foto, una captura de pantalla o un escaneado en texto que puedes copiar y editar. Funciona en español y en inglés.

Suelta aquí una imagen o un PDF foto, captura de pantalla o documento escaneado Seleccionar archivo
archivo
Solo para PDF. Se lee una página cada vez.
Procesando…
Texto extraído
⚠️Algo ha fallado.
100 % privado. El reconocimiento se ejecuta dentro de tu navegador: ni la imagen ni el texto salen de tu dispositivo.

La primera vez se descarga el motor de lectura (unos 6 MB) y se guarda para las siguientes.

Cómo extraer el texto paso a paso

1

Suelta el archivo

Una foto, una captura o un PDF escaneado. También puedes hacer la foto con el móvil en ese momento.

2

Espera el reconocimiento

La primera vez se descarga el motor de lectura; después es mucho más rápido.

3

Copia el texto

Revísalo, cópialo de un clic o descárgalo como archivo de texto.

Qué es el OCR y cuándo lo necesitas

OCR son las siglas de reconocimiento óptico de caracteres: mirar una imagen y averiguar qué letras hay dibujadas en ella. Se necesita siempre que el texto que ves no es texto de verdad para el ordenador: una foto de un cartel, una captura de pantalla de la que quieres copiar dos líneas, un contrato escaneado del que hay que sacar una cláusula, un recibo antiguo.

Un detalle importante con los PDF: si el documento se generó en un ordenador, el texto ya está dentro y esta herramienta lo extrae directamente, sin reconocimiento y sin errores. Solo cuando la página es una imagen —un escaneado, una foto insertada— entra en juego el reconocimiento. La herramienta distingue los dos casos sola y te dice cuál ha aplicado.

Qué se puede esperar de la calidad

Conviene ser realista. Con un escaneado limpio, recto y de buena resolución, el reconocimiento acierta la enorme mayoría de las palabras y el resultado apenas necesita retoques. Con una foto hecha a mano, torcida, con sombras o con el papel arrugado, los errores se multiplican. Y con texto manuscrito el resultado es malo: esta tecnología está pensada para letra impresa, no para caligrafía.

Tres cosas ayudan muchísimo: que la foto esté recta, que haya luz uniforme sin sombras duras y que el texto ocupe buena parte del encuadre. Merece la pena repetir la foto antes que pelearse con el resultado.

El motor se descarga una vez

El reconocimiento lo hace un motor de código abierto que se descarga a tu navegador la primera vez que lo usas, junto con el diccionario del idioma que elijas. Son unos seis megas en total, y después quedan guardados en la caché: a partir de la segunda vez arranca casi al instante. Elegir bien el idioma importa más de lo que parece, porque el diccionario es lo que permite al motor decidir entre una «l» y una «i» cuando la imagen no es clara.

Nada sale de tu dispositivo

A diferencia de los servicios de OCR en la nube, aquí ni la imagen ni el texto reconocido se envían a ninguna parte. Todo ocurre en tu navegador, que es la única forma sensata de pasar por OCR un documento con datos personales.

Preguntas frecuentes

¿Reconoce texto escrito a mano?
Muy mal. Esta tecnología está diseñada para letra impresa. Con caligrafía los resultados no son utilizables, por muy buena que sea la foto.
¿Funciona con PDF?
Sí. Si el PDF ya tiene texto dentro (los generados por ordenador), se extrae directamente y sin errores. Si es un escaneado, se aplica el reconocimiento a la página que elijas.
¿Por qué tarda la primera vez?
Porque hay que descargar el motor de lectura y el diccionario del idioma, unos seis megas en total. Después quedan guardados en tu navegador y las siguientes lecturas son mucho más rápidas.
¿Qué idiomas soporta?
Español e inglés, por separado o mezclados. Elegir el idioma correcto mejora bastante la precisión, porque el motor usa el diccionario para desambiguar letras parecidas.
¿Cómo consigo mejores resultados?
Foto recta, luz uniforme sin sombras, sin reflejos y con el texto ocupando buena parte del encuadre. Un escaneado a 300 ppp es lo ideal.
¿Se sube mi documento a algún servidor?
No. El reconocimiento se ejecuta dentro de tu navegador, así que ni la imagen ni el texto salen de tu dispositivo.