Hace que un PDF sea buscable y copiable.
Cómo funciona:
Haz clic para seleccionar un archivo o arrastra y suelta
Tus archivos nunca salen de tu dispositivo.
Seleccionado: Ninguno
Solo se reconocerán estos caracteres. Deja vacío para todos los caracteres.
Solo se reconocerán estos caracteres. Deja vacío para todos los caracteres.
Inicializando...
Tu PDF buscable está listo. También puedes copiar o descargar el texto extraído a continuación.
Procesando...
Haz clic o arrastra tu archivo aquí
Haz clic en el botón de procesar
Guarda tu archivo procesado al instante
Abre el archivo en cualquier visor e intenta seleccionar una línea de texto. Si no se resalta nada o la búsqueda no encuentra coincidencias, las páginas son solo imágenes (un escaneo o una foto) y el OCR es lo que añade el texto que falta. Un PDF que ya tiene texto seleccionable no necesita esta herramienta.
Hay más de 100 paquetes de idioma de Tesseract, del inglés y el español al árabe, el hindi, el japonés y el chino. Marca todos los idiomas que aparezcan en el documento; los paquetes se cargan juntos para que las páginas en varios idiomas se reconozcan en una sola pasada.
No. Las páginas originales se copian sin cambios y encima se añade una capa de texto invisible, colocada palabra por palabra para coincidir con el escaneo. Ves la misma imagen que antes, pero ahora puedes buscar, seleccionar y copiar el texto.
Alta (288 DPI) es la opción predeterminada y sirve para documentos de oficina habituales. Baja a Estándar (192 DPI) cuando importe la velocidad o el archivo sea largo, y usa Ultra (384 DPI) para letra pequeña, notas al pie o escaneos de mala calidad. Los ajustes más altos tardan bastante más, porque cada página se renderiza a ese tamaño antes del reconocimiento.
Limita el resultado a un conjunto fijo de caracteres, lo que reduce errores como leer una l minúscula como un 1. El preajuste Factura solo permite dígitos y los símbolos $ . , / - # :, Solo números va bien para números de serie o lecturas de contador, y Personalizado te permite escribir tu propio conjunto.
No de forma fiable. Tesseract está entrenado con texto impreso, así que las mayúsculas de imprenta bien hechas a veces funcionan, pero la letra cursiva produce sobre todo ruido. Los resultados son mejores con páginas impresas limpias y bien iluminadas; la opción Binarizar ayuda con escaneos desvaídos o de poco contraste, y Enderezar PDF endereza primero los torcidos.
Sí. Cuando termina el OCR, el texto extraído aparece en un cuadro donde puedes revisarlo, copiarlo al portapapeles o descargarlo como ocr-text.txt. La descarga del PDF con búsqueda es aparte, así que puedes quedarte con uno, con otro o con ambos.
No. Tesseract se ejecuta como WebAssembly en tu navegador; lo único que se descarga es el motor de OCR y los paquetes de idioma que elegiste, la primera vez que se necesitan. Las páginas escaneadas y el texto reconocido se quedan en tu dispositivo.