Maak een PDF doorzoekbaar en kopieerbaar.
Hoe het werkt:
Klik om een bestand te selecteren of sleep er een hierheen
Jouw bestanden blijven op jouw apparaat.
Geselecteerd: Geen
Alleen deze tekens worden herkend. Laat leeg voor alle tekens.
Alleen deze tekens worden herkend. Laat leeg voor alle tekens.
Initialiseren...
Je doorzoekbare PDF is klaar. Je kunt de geëxtraheerde tekst hieronder ook kopiëren of downloaden.
Verwerken…
Klik of sleep je bestand hierheen
Klik op de verwerkingsknop
Sla je verwerkte bestand direct op
Open het bestand in een willekeurige viewer en probeer een regel tekst te selecteren. Wordt er niets gemarkeerd of vindt zoeken niets, dan zijn de pagina's gewoon afbeeldingen (een scan of een foto) en voegt OCR de ontbrekende tekst toe. Een pdf met tekst die je al kunt selecteren, heeft deze tool niet nodig.
Er zijn meer dan 100 taalpakketten van Tesseract beschikbaar, van Engels en Spaans tot Arabisch, Hindi, Japans en Chinees. Vink elke taal aan die in het document voorkomt; de pakketten worden samen geladen, zodat pagina's met meerdere talen in één keer herkend worden.
Nee. De oorspronkelijke pagina's worden ongewijzigd overgenomen en er komt een onzichtbare tekstlaag bovenop, woord per woord op de scan afgestemd. Je ziet hetzelfde beeld als voorheen, maar nu kun je de tekst doorzoeken, selecteren en kopiëren.
Hoog (288 DPI) is de standaard en volstaat voor gewone kantoordocumenten. Kies Standaard (192 DPI) als snelheid telt of het bestand lang is, en Ultra (384 DPI) voor kleine letters, voetnoten of slechte scans. Hogere instellingen duren merkbaar langer, omdat elke pagina eerst op dat formaat wordt weergegeven voordat de herkenning start.
Het beperkt het resultaat tot een vaste set tekens, waardoor je minder fouten krijgt zoals een kleine l die als 1 wordt gelezen. De voorinstelling Factuur laat alleen cijfers en de tekens $ . , / - # : toe, Alleen cijfers is geschikt voor serienummers of meterstanden, en met Eigen typ je zelf een set in.
Niet betrouwbaar. Tesseract is getraind op gedrukte tekst, dus nette blokletters werken soms, maar schuinschrift levert meestal onzin op. De resultaten zijn het best bij schone, goed belichte gedrukte pagina's; de optie Binariseren helpt bij vervaagde scans of scans met weinig contrast, en Pdf rechttrekken zet scheve pagina's eerst recht.
Ja. Als OCR klaar is, verschijnt de herkende tekst in een vak waar je hem kunt nalezen, naar het klembord kunt kopiëren of als ocr-text.txt kunt downloaden. De doorzoekbare pdf download je apart, dus je kunt het ene, het andere of allebei nemen.
Nee. Tesseract draait als WebAssembly in je browser; het enige wat gedownload wordt, zijn de OCR-engine en de taalpakketten die je koos, de eerste keer dat ze nodig zijn. De gescande pagina's en de herkende tekst blijven op je toestel.