OCR PDF

Hace que un PDF sea buscable y copiable.

Cómo funciona:

  • Extraer texto: Usa Tesseract OCR para reconocer texto en imágenes escaneadas o PDF.
  • Salida buscable: Crea un nuevo PDF con una capa de texto invisible, haciendo tu documento totalmente buscable y conservando la apariencia original.
  • Filtrado de caracteres: Usa listas blancas para filtrar caracteres no deseados y mejorar la precisión para tipos específicos de documentos (facturas, formularios, etc.).
  • Soporte multilingüe: Selecciona varios idiomas para documentos que contengan contenido en idiomas mixtos.

Haz clic para seleccionar un archivo o arrastra y suelta

Tus archivos nunca salen de tu dispositivo.

Cómo funciona

1

Seleccionar archivo

Haz clic o arrastra tu archivo aquí

2

Procesar

Haz clic en el botón de procesar

3

Descargar

Guarda tu archivo procesado al instante

Herramientas PDF relacionadas

Fusionar PDF

Fusiona PDF gratis en línea

Comprimir PDF

Comprime PDF gratis en línea

Dividir PDF

Divide PDF gratis en línea

Editar PDF

Edita PDF gratis en línea

Rotar PDF

Gira PDF gratis en línea

Preguntas frecuentes

¿Cómo sé si mi PDF necesita OCR?

Abre el archivo en cualquier visor e intenta seleccionar una línea de texto. Si no se resalta nada o la búsqueda no encuentra coincidencias, las páginas son solo imágenes (un escaneo o una foto) y el OCR es lo que añade el texto que falta. Un PDF que ya tiene texto seleccionable no necesita esta herramienta.

¿Qué idiomas puede reconocer?

Hay más de 100 paquetes de idioma de Tesseract, del inglés y el español al árabe, el hindi, el japonés y el chino. Marca todos los idiomas que aparezcan en el documento; los paquetes se cargan juntos para que las páginas en varios idiomas se reconozcan en una sola pasada.

¿El OCR cambia el aspecto de mi documento?

No. Las páginas originales se copian sin cambios y encima se añade una capa de texto invisible, colocada palabra por palabra para coincidir con el escaneo. Ves la misma imagen que antes, pero ahora puedes buscar, seleccionar y copiar el texto.

¿Qué resolución debo usar?

Alta (288 DPI) es la opción predeterminada y sirve para documentos de oficina habituales. Baja a Estándar (192 DPI) cuando importe la velocidad o el archivo sea largo, y usa Ultra (384 DPI) para letra pequeña, notas al pie o escaneos de mala calidad. Los ajustes más altos tardan bastante más, porque cada página se renderiza a ese tamaño antes del reconocimiento.

¿Qué hace la lista blanca de caracteres?

Limita el resultado a un conjunto fijo de caracteres, lo que reduce errores como leer una l minúscula como un 1. El preajuste Factura solo permite dígitos y los símbolos $ . , / - # :, Solo números va bien para números de serie o lecturas de contador, y Personalizado te permite escribir tu propio conjunto.

¿Puede leer escritura a mano?

No de forma fiable. Tesseract está entrenado con texto impreso, así que las mayúsculas de imprenta bien hechas a veces funcionan, pero la letra cursiva produce sobre todo ruido. Los resultados son mejores con páginas impresas limpias y bien iluminadas; la opción Binarizar ayuda con escaneos desvaídos o de poco contraste, y Enderezar PDF endereza primero los torcidos.

¿Puedo obtener solo el texto reconocido en lugar de un PDF?

Sí. Cuando termina el OCR, el texto extraído aparece en un cuadro donde puedes revisarlo, copiarlo al portapapeles o descargarlo como ocr-text.txt. La descarga del PDF con búsqueda es aparte, así que puedes quedarte con uno, con otro o con ambos.

¿El OCR sube mis escaneos a un servidor?

No. Tesseract se ejecuta como WebAssembly en tu navegador; lo único que se descarga es el motor de OCR y los paquetes de idioma que elegiste, la primera vez que se necesitan. Las páginas escaneadas y el texto reconocido se quedan en tu dispositivo.