OCR: tekst herkennen in pdf

Maak een PDF doorzoekbaar en kopieerbaar.

Hoe het werkt:

  • Tekst extraheren: Gebruikt Tesseract OCR om tekst te herkennen uit gescande afbeeldingen of PDF's.
  • Doorzoekbare uitvoer: Maakt een nieuwe PDF met een onzichtbare tekstlaag, waardoor je document volledig doorzoekbaar wordt met behoud van het oorspronkelijke uiterlijk.
  • Tekens filteren: Gebruik whitelists om ongewenste tekens uit te filteren en de nauwkeurigheid te verbeteren voor specifieke documenttypes (facturen, formulieren, enz.).
  • Meertalige ondersteuning: Selecteer meerdere talen voor documenten met inhoud in gemengde talen.

Klik om een bestand te selecteren of sleep er een hierheen

Jouw bestanden blijven op jouw apparaat.

Hoe het werkt

1

Bestand kiezen

Klik of sleep je bestand hierheen

2

Verwerken

Klik op de verwerkingsknop

3

Downloaden

Sla je verwerkte bestand direct op

Gerelateerde PDF-tools

Pdf samenvoegen

Gratis pdf’s samenvoegen

Pdf verkleinen

Gratis pdf’s verkleinen

Pdf splitsen

Gratis pdf’s splitsen

Pdf bewerken

Gratis pdf’s bewerken

Pdf draaien

Gratis pdf’s draaien

Veelgestelde vragen

Hoe weet ik of mijn pdf OCR nodig heeft?

Open het bestand in een willekeurige viewer en probeer een regel tekst te selecteren. Wordt er niets gemarkeerd of vindt zoeken niets, dan zijn de pagina's gewoon afbeeldingen (een scan of een foto) en voegt OCR de ontbrekende tekst toe. Een pdf met tekst die je al kunt selecteren, heeft deze tool niet nodig.

Welke talen kan het herkennen?

Er zijn meer dan 100 taalpakketten van Tesseract beschikbaar, van Engels en Spaans tot Arabisch, Hindi, Japans en Chinees. Vink elke taal aan die in het document voorkomt; de pakketten worden samen geladen, zodat pagina's met meerdere talen in één keer herkend worden.

Verandert OCR hoe mijn document eruitziet?

Nee. De oorspronkelijke pagina's worden ongewijzigd overgenomen en er komt een onzichtbare tekstlaag bovenop, woord per woord op de scan afgestemd. Je ziet hetzelfde beeld als voorheen, maar nu kun je de tekst doorzoeken, selecteren en kopiëren.

Welke resolutie moet ik gebruiken?

Hoog (288 DPI) is de standaard en volstaat voor gewone kantoordocumenten. Kies Standaard (192 DPI) als snelheid telt of het bestand lang is, en Ultra (384 DPI) voor kleine letters, voetnoten of slechte scans. Hogere instellingen duren merkbaar langer, omdat elke pagina eerst op dat formaat wordt weergegeven voordat de herkenning start.

Wat doet de toegestane tekenlijst?

Het beperkt het resultaat tot een vaste set tekens, waardoor je minder fouten krijgt zoals een kleine l die als 1 wordt gelezen. De voorinstelling Factuur laat alleen cijfers en de tekens $ . , / - # : toe, Alleen cijfers is geschikt voor serienummers of meterstanden, en met Eigen typ je zelf een set in.

Kan het handschrift lezen?

Niet betrouwbaar. Tesseract is getraind op gedrukte tekst, dus nette blokletters werken soms, maar schuinschrift levert meestal onzin op. De resultaten zijn het best bij schone, goed belichte gedrukte pagina's; de optie Binariseren helpt bij vervaagde scans of scans met weinig contrast, en Pdf rechttrekken zet scheve pagina's eerst recht.

Kan ik alleen de herkende tekst krijgen in plaats van een pdf?

Ja. Als OCR klaar is, verschijnt de herkende tekst in een vak waar je hem kunt nalezen, naar het klembord kunt kopiëren of als ocr-text.txt kunt downloaden. De doorzoekbare pdf download je apart, dus je kunt het ene, het andere of allebei nemen.

Uploadt OCR mijn scans naar een server?

Nee. Tesseract draait als WebAssembly in je browser; het enige wat gedownload wordt, zijn de OCR-engine en de taalpakketten die je koos, de eerste keer dat ze nodig zijn. De gescande pagina's en de herkende tekst blijven op je toestel.