Rendi un PDF ricercabile e copiabile.
Come funziona:
Clicca per selezionare un file oppure trascina e rilascia
I tuoi file non lasciano mai il tuo dispositivo.
Selezionato: Nessuna
Verranno riconosciuti solo questi caratteri. Lascia vuoto per tutti i caratteri.
Verranno riconosciuti solo questi caratteri. Lascia vuoto per tutti i caratteri.
Inizializzazione...
Il tuo PDF ricercabile è pronto. Puoi anche copiare o scaricare il testo estratto qui sotto.
Elaborazione...
Clicca o trascina il tuo file qui
Clicca il pulsante di elaborazione
Salva il tuo file elaborato istantaneamente
Apri il file in un visualizzatore qualsiasi e prova a selezionare una riga di testo. Se non si evidenzia nulla o la ricerca non trova risultati, le pagine sono solo immagini (una scansione o una foto) ed è l’OCR ad aggiungere il testo mancante. Un PDF con testo già selezionabile non ha bisogno di questo strumento.
Sono disponibili oltre 100 pacchetti lingua di Tesseract, dall’inglese e lo spagnolo all’arabo, l’hindi, il giapponese e il cinese. Seleziona tutte le lingue presenti nel documento; i pacchetti vengono caricati insieme, così le pagine multilingue vengono riconosciute in un unico passaggio.
No. Le pagine originali vengono copiate senza modifiche e sopra viene aggiunto un livello di testo invisibile, posizionato parola per parola in corrispondenza della scansione. Vedi la stessa immagine di prima, ma ora puoi cercare, selezionare e copiare il testo.
Alta (288 DPI) è l’impostazione predefinita e va bene per i normali documenti d’ufficio. Scendi a Standard (192 DPI) quando conta la velocità o il file è lungo, e usa Ultra (384 DPI) per caratteri piccoli, note a piè di pagina o scansioni di scarsa qualità. Le impostazioni più alte richiedono molto più tempo, perché ogni pagina viene renderizzata a quella dimensione prima del riconoscimento.
Limita l’output a un insieme fisso di caratteri, riducendo errori come una l minuscola letta come 1. Il preset Fattura consente solo cifre e i simboli $ . , / - # :, Solo numeri è adatto a numeri di serie o letture di contatori, e Personalizzato ti permette di digitare il tuo insieme.
Non in modo affidabile. Tesseract è addestrato su testo stampato, quindi lo stampatello ordinato a volte funziona, ma il corsivo produce soprattutto rumore. I risultati migliori si ottengono con pagine stampate pulite e ben illuminate; l’opzione Binarizza aiuta con scansioni sbiadite o poco contrastate, e Raddrizza PDF raddrizza prima quelle inclinate.
Sì. Al termine dell’OCR, il testo estratto compare in un riquadro dove puoi rivederlo, copiarlo negli appunti o scaricarlo come ocr-text.txt. Il download del PDF ricercabile è separato, quindi puoi prendere l’uno, l’altro o entrambi.
No. Tesseract gira come WebAssembly nel tuo browser; gli unici download sono il motore OCR e i pacchetti lingua che hai scelto, scaricati la prima volta che servono. Le pagine scansionate e il testo riconosciuto restano sul tuo dispositivo.