OCR PDF

Rendre un PDF consultable et copiable.

Comment ça marche :

  • Extraire le texte : Utilise Tesseract OCR pour reconnaître le texte des images numérisées ou des PDF.
  • Sortie interrogeable : Crée un nouveau PDF avec une couche de texte invisible, rendant votre document entièrement consultable tout en préservant son apparence d'origine.
  • Filtrage des caractères : Utilisez les listes blanches pour filtrer les caractères indésirables et améliorer la précision pour des types de documents spécifiques (factures, formulaires, etc.).
  • Prise en charge multilingue : Sélectionnez plusieurs langues pour les documents contenant un contenu multilingue.

Cliquez pour sélectionner un fichier ou glissez-déposez

Vos fichiers restent sur votre appareil.

Comment ça marche

1

Choisir un fichier

Cliquez ou glissez votre fichier ici

2

Traiter

Cliquez sur le bouton de traitement

3

Télécharger

Enregistrez votre fichier traité instantanément

Outils PDF associés

Fusionner des PDF

Outil gratuit pour fusionner des PDF

Compresser un PDF

Outil gratuit pour compresser un PDF

Scinder un PDF

Outil gratuit pour scinder un PDF

Modifier un PDF

Outil gratuit pour modifier un PDF

Faire pivoter un PDF

Outil gratuit pour faire pivoter un PDF

Questions fréquemment posées

Comment savoir si mon PDF a besoin de l’OCR ?

Ouvrez le fichier dans n’importe quelle visionneuse et essayez de sélectionner une ligne de texte. Si rien ne se surligne ou si la recherche ne trouve rien, les pages ne sont que des images (une numérisation ou une photo) et c’est l’OCR qui ajoute le texte manquant. Un PDF dont le texte est déjà sélectionnable n’a pas besoin de cet outil.

Quelles langues peut-il reconnaître ?

Plus de 100 packs de langues Tesseract sont proposés, de l’anglais et l’espagnol à l’arabe, l’hindi, le japonais et le chinois. Cochez toutes les langues présentes dans le document ; les packs sont chargés ensemble, de sorte que les pages multilingues sont reconnues en une seule passe.

L’OCR modifie-t-il l’apparence de mon document ?

Non. Les pages d’origine sont copiées sans modification et une couche de texte invisible est ajoutée par-dessus, placée mot par mot pour correspondre à la numérisation. Vous voyez la même image qu’avant, mais vous pouvez désormais rechercher, sélectionner et copier le texte.

Quelle résolution dois-je utiliser ?

Élevée (288 DPI) est le réglage par défaut et convient aux documents de bureau courants. Passez à Standard (192 DPI) si la vitesse compte ou si le fichier est long, et utilisez Ultra (384 DPI) pour les petits caractères, les notes de bas de page ou les numérisations de mauvaise qualité. Les réglages plus élevés prennent nettement plus de temps, car chaque page est rendue à cette taille avant la reconnaissance.

À quoi sert la liste blanche de caractères ?

Il limite le résultat à un ensemble fixe de caractères, ce qui réduit les erreurs comme un l minuscule lu comme un 1. Le préréglage Facture n’autorise que les chiffres et les symboles $ . , / - # :, Chiffres uniquement convient aux numéros de série ou aux relevés de compteur, et Personnalisé vous permet de saisir votre propre ensemble.

Peut-il lire l’écriture manuscrite ?

Pas de façon fiable. Tesseract est entraîné sur du texte imprimé : des majuscules d’imprimerie soignées fonctionnent parfois, mais l’écriture cursive produit surtout du bruit. Les résultats sont meilleurs sur des pages imprimées propres et bien éclairées ; l’option Binariser aide pour les numérisations pâlies ou peu contrastées, et Redresser un PDF remet d’abord droites les pages inclinées.

Puis-je obtenir uniquement le texte reconnu au lieu d’un PDF ?

Oui. Une fois l’OCR terminé, le texte extrait apparaît dans un champ où vous pouvez le relire, le copier dans le presse-papiers ou le télécharger sous le nom ocr-text.txt. Le téléchargement du PDF consultable est séparé : vous pouvez prendre l’un, l’autre ou les deux.

L’OCR envoie-t-il mes numérisations sur un serveur ?

Non. Tesseract tourne en WebAssembly dans votre navigateur ; les seuls téléchargements sont le moteur OCR et les packs de langues que vous avez choisis, récupérés la première fois qu’ils sont nécessaires. Les pages numérisées et le texte reconnu restent sur votre appareil.