Suelta aquí imágenes o un PDF
o haz clic para elegir — puedes seleccionar varios a la vezo pega con Ctrl+V
Idioma
Añade una imagen o un PDF para empezar a leer

Extraer texto de imagen y PDF

Saca el texto de capturas de pantalla, fotos y PDF escaneados. El reconocimiento ocurre en tu navegador, no se sube nada. Varios archivos a la vez.

Qué hace esta herramienta

Lee bien el texto impreso

La precisión depende de la nitidez, el idioma, el diseño y la iluminación. Revisa el texto extraído con el original, en especial nombres, fechas y cifras.

Nueve idiomas

Inglés, chino (simplificado y tradicional), japonés, coreano, alemán, francés, español e italiano. Las opciones que no son inglés cargan también el inglés, porque los documentos reales están llenos de números de pedido, correos e importes en caracteres latinos.

PDF escaneados, página a página

El PDF se abre y cada página se lee por turno, así que no tienes que exportar las páginas como imágenes antes.

Varios archivos a la vez

Suelta una carpeta entera de capturas y se ponen en cola. Si una falla, las demás siguen — un archivo defectuoso no detiene el lote.

Copiar o descargar

Lleva el resultado directamente al portapapeles o descárgalo como archivo.txt. Con varios archivos, cada resultado va etiquetado para que no se mezclen.

Cómo extraer el texto de una imagen

1

Añade tus archivos

Arrastra imágenes o un PDF, o haz clic para elegirlos. Funcionan JPG, PNG, WebP, GIF, BMP y PDF, hasta 50 MB cada uno.

2

Elige el idioma

El del texto de la imagen, no el de esta página. Este ajuste influye en la precisión más que ningún otro.

3

Copia o descarga el texto

Los resultados aparecen según van terminando los archivos. Copia todo al portapapeles o guárdalo como.txt.

Ejemplos reales

Extraer texto de imagen y PDF · Ejemplo 1

Estos archivos se han procesado con esta herramienta o con su mismo código. Compara los originales, los ajustes y los resultados descargables.

Para obtener mejores resultados

Ajusta primero el idioma

Es con diferencia el factor que más pesa. Leer texto en chino con el modelo de inglés dará un galimatías por muy nítida que sea la imagen.

Recorta hasta dejar solo el texto

Las fotos de páginas suelen incluir la mesa, una mano, parte de la habitación. Dejando solo el papel, el motor tiene menos con lo que confundirse.

Mejor luz uniforme que luz intensa

Una sombra cruzando media página perjudica más que una foto algo oscura en conjunto. Muévete para que la luz sea uniforme en lugar de más fuerte.

Mantén las líneas horizontales

El texto inclinado se lee bastante peor. Enderezar la foto antes de subirla merece esos segundos.

Usa el archivo original

Una captura de una captura, o una foto reenviada por varias aplicaciones de mensajería, se ha comprimido cada vez. El original siempre es más nítido.

Texto impreso sí, manuscrito no

Esto funciona con texto impreso y compuesto. La escritura a mano es un problema realmente distinto y el resultado te decepcionará.

Ejemplos reales

Extraer texto de imagen y PDF · Más ejemplos

Estos archivos se han procesado con esta herramienta o con su mismo código. Compara los originales, los ajustes y los resultados descargables.

Preguntas sobre extraer texto

Sí. OCR — reconocimiento óptico de caracteres — es el nombre general de leer texto impreso a partir de una imagen, y es exactamente lo que ocurre aquí. La diferencia con la mayoría de webs de OCR está en dónde se ejecuta: el motor se descarga a tu navegador en lugar de subir tu archivo al servidor de alguien.
La precisión depende de la nitidez, el idioma, el diseño y la iluminación. Revisa el texto extraído con el original, en especial nombres, fechas y cifras.
No, y conviene decirlo claro. El motor está hecho para texto impreso y compuesto. El reconocimiento de escritura a mano es otro problema que necesita otros modelos, e intentarlo aquí solo te hará perder el tiempo.
No. El texto de dentro de la tabla se leerá, pero la estructura de filas y columnas no se conserva: obtienes las palabras, no una cuadrícula. El motor no detecta en absoluto la estructura de las tablas, así que no hay forma de exportar un Excel aprovechable.
El contenido de los archivos seleccionados se procesa en el navegador y no se envía a un servicio de carga de la aplicación. El sitio, las fuentes y las bibliotecas de procesamiento pueden necesitar solicitudes de red.
Abre la página con conexión. El procesamiento puede continuar en la pestaña cargada, pero recargar, cargar recursos externos o descargar modelos requiere Internet.
El del texto de la imagen, no el de esta página. Si te equivocas, el resultado será un galimatías incluso con una imagen nítida. Las opciones que no son inglés cargan también el inglés, de modo que los documentos mixtos con números de pedido y correos se leen correctamente.
Sí. Cada página se renderiza y se lee por turno, y los resultados aparecen página a página. Los documentos muy largos se limitan a las primeras 100 páginas, y se te avisa en lugar de dejarte con la duda.
Verás «No se ha encontrado texto» en lugar de un error, porque una imagen sin texto legible es un resultado normal. Suele significar que la imagen está borrosa, la letra es demasiado pequeña o el idioma elegido no es el correcto.
Porque no debería llevarlos. Los motores de reconocimiento tratan cada carácter chino como una palabra aparte y ponen espacios entre todos ellos, lo que deja un resultado incómodo. Aquí se eliminan, pero los espacios entre caracteres chinos y latinos se conservan, porque esos son reales.
Sí. Suelta tantas imágenes como quieras y se pondrán en cola, con los resultados apareciendo según terminan. Si un archivo falla los demás continúan, y puedes detenerlo en cualquier momento sin perder lo ya leído.