OCR PDF

Rendi un PDF ricercabile e copiabile.

Come funziona:

  • Estrai testo: Usa Tesseract OCR per riconoscere il testo da immagini scansionate o PDF.
  • Output ricercabile: Crea un nuovo PDF con un livello di testo invisibile, rendendo il documento completamente ricercabile preservando l'aspetto originale.
  • Filtraggio caratteri: Usa le whitelist per filtrare i caratteri indesiderati e migliorare la precisione per tipi specifici di documenti (fatture, moduli, ecc.).
  • Supporto multilingua: Seleziona più lingue per documenti contenenti contenuto in lingue miste.

Clicca per selezionare un file oppure trascina e rilascia

I tuoi file non lasciano mai il tuo dispositivo.

Come funziona

1

Seleziona file

Clicca o trascina il tuo file qui

2

Elabora

Clicca il pulsante di elaborazione

3

Scarica

Salva il tuo file elaborato istantaneamente

Strumenti PDF correlati

Unisci PDF

Unisci PDF gratis online

Comprimi PDF

Comprimi PDF gratis online

Dividi PDF

Dividi PDF gratis online

Modifica PDF

Modifica PDF gratis online

Ruota PDF

Ruota PDF gratis online

Domande frequenti

Come capisco se il mio PDF ha bisogno dell’OCR?

Apri il file in un visualizzatore qualsiasi e prova a selezionare una riga di testo. Se non si evidenzia nulla o la ricerca non trova risultati, le pagine sono solo immagini (una scansione o una foto) ed è l’OCR ad aggiungere il testo mancante. Un PDF con testo già selezionabile non ha bisogno di questo strumento.

Quali lingue può riconoscere?

Sono disponibili oltre 100 pacchetti lingua di Tesseract, dall’inglese e lo spagnolo all’arabo, l’hindi, il giapponese e il cinese. Seleziona tutte le lingue presenti nel documento; i pacchetti vengono caricati insieme, così le pagine multilingue vengono riconosciute in un unico passaggio.

L’OCR cambia l’aspetto del mio documento?

No. Le pagine originali vengono copiate senza modifiche e sopra viene aggiunto un livello di testo invisibile, posizionato parola per parola in corrispondenza della scansione. Vedi la stessa immagine di prima, ma ora puoi cercare, selezionare e copiare il testo.

Quale risoluzione dovrei usare?

Alta (288 DPI) è l’impostazione predefinita e va bene per i normali documenti d’ufficio. Scendi a Standard (192 DPI) quando conta la velocità o il file è lungo, e usa Ultra (384 DPI) per caratteri piccoli, note a piè di pagina o scansioni di scarsa qualità. Le impostazioni più alte richiedono molto più tempo, perché ogni pagina viene renderizzata a quella dimensione prima del riconoscimento.

A cosa serve la whitelist dei caratteri?

Limita l’output a un insieme fisso di caratteri, riducendo errori come una l minuscola letta come 1. Il preset Fattura consente solo cifre e i simboli $ . , / - # :, Solo numeri è adatto a numeri di serie o letture di contatori, e Personalizzato ti permette di digitare il tuo insieme.

Può leggere la scrittura a mano?

Non in modo affidabile. Tesseract è addestrato su testo stampato, quindi lo stampatello ordinato a volte funziona, ma il corsivo produce soprattutto rumore. I risultati migliori si ottengono con pagine stampate pulite e ben illuminate; l’opzione Binarizza aiuta con scansioni sbiadite o poco contrastate, e Raddrizza PDF raddrizza prima quelle inclinate.

Posso ottenere solo il testo riconosciuto invece di un PDF?

Sì. Al termine dell’OCR, il testo estratto compare in un riquadro dove puoi rivederlo, copiarlo negli appunti o scaricarlo come ocr-text.txt. Il download del PDF ricercabile è separato, quindi puoi prendere l’uno, l’altro o entrambi.

L’OCR carica le mie scansioni su un server?

No. Tesseract gira come WebAssembly nel tuo browser; gli unici download sono il motore OCR e i pacchetti lingua che hai scelto, scaricati la prima volta che servono. Le pagine scansionate e il testo riconosciuto restano sul tuo dispositivo.