Rendre un PDF consultable et copiable.
Comment ça marche :
Cliquez pour sélectionner un fichier ou glissez-déposez
Vos fichiers restent sur votre appareil.
Sélectionné : Aucune
Seuls ces caractères seront reconnus. Laissez vide pour tous les caractères.
Seuls ces caractères seront reconnus. Laissez vide pour tous les caractères.
Initialisation…
Votre PDF interrogeable est prêt. Vous pouvez aussi copier ou télécharger le texte extrait ci-dessous.
Traitement en cours...
Cliquez ou glissez votre fichier ici
Cliquez sur le bouton de traitement
Enregistrez votre fichier traité instantanément
Ouvrez le fichier dans n’importe quelle visionneuse et essayez de sélectionner une ligne de texte. Si rien ne se surligne ou si la recherche ne trouve rien, les pages ne sont que des images (une numérisation ou une photo) et c’est l’OCR qui ajoute le texte manquant. Un PDF dont le texte est déjà sélectionnable n’a pas besoin de cet outil.
Plus de 100 packs de langues Tesseract sont proposés, de l’anglais et l’espagnol à l’arabe, l’hindi, le japonais et le chinois. Cochez toutes les langues présentes dans le document ; les packs sont chargés ensemble, de sorte que les pages multilingues sont reconnues en une seule passe.
Non. Les pages d’origine sont copiées sans modification et une couche de texte invisible est ajoutée par-dessus, placée mot par mot pour correspondre à la numérisation. Vous voyez la même image qu’avant, mais vous pouvez désormais rechercher, sélectionner et copier le texte.
Élevée (288 DPI) est le réglage par défaut et convient aux documents de bureau courants. Passez à Standard (192 DPI) si la vitesse compte ou si le fichier est long, et utilisez Ultra (384 DPI) pour les petits caractères, les notes de bas de page ou les numérisations de mauvaise qualité. Les réglages plus élevés prennent nettement plus de temps, car chaque page est rendue à cette taille avant la reconnaissance.
Il limite le résultat à un ensemble fixe de caractères, ce qui réduit les erreurs comme un l minuscule lu comme un 1. Le préréglage Facture n’autorise que les chiffres et les symboles $ . , / - # :, Chiffres uniquement convient aux numéros de série ou aux relevés de compteur, et Personnalisé vous permet de saisir votre propre ensemble.
Pas de façon fiable. Tesseract est entraîné sur du texte imprimé : des majuscules d’imprimerie soignées fonctionnent parfois, mais l’écriture cursive produit surtout du bruit. Les résultats sont meilleurs sur des pages imprimées propres et bien éclairées ; l’option Binariser aide pour les numérisations pâlies ou peu contrastées, et Redresser un PDF remet d’abord droites les pages inclinées.
Oui. Une fois l’OCR terminé, le texte extrait apparaît dans un champ où vous pouvez le relire, le copier dans le presse-papiers ou le télécharger sous le nom ocr-text.txt. Le téléchargement du PDF consultable est séparé : vous pouvez prendre l’un, l’autre ou les deux.
Non. Tesseract tourne en WebAssembly dans votre navigateur ; les seuls téléchargements sont le moteur OCR et les packs de langues que vous avez choisis, récupérés la première fois qu’ils sont nécessaires. Les pages numérisées et le texte reconnu restent sur votre appareil.