OCR PDF

Eine PDF durchsuchbar und kopierbar machen.

So funktioniert es:

  • Text extrahieren: Verwendet Tesseract OCR, um Text aus gescannten Bildern oder PDFs zu erkennen.
  • Durchsuchbare Ausgabe: Erstellt eine neue PDF mit einer unsichtbaren Textebene, sodass Ihr Dokument vollständig durchsuchbar wird, während das ursprüngliche Erscheinungsbild erhalten bleibt.
  • Zeichenfilterung: Verwenden Sie Whitelists, um unerwünschte Zeichen herauszufiltern und die Genauigkeit für bestimmte Dokumenttypen zu verbessern (Rechnungen, Formulare usw.).
  • Mehrsprachige Unterstützung: Wählen Sie mehrere Sprachen für Dokumente mit gemischten Sprachinhalten aus.

Klick hier, um eine Datei auszuwählen oder per Drag & Drop reinziehen

Deine Dateien verlassen nie dein Gerät.

So funktioniert's

1

Datei auswählen

Klicken oder Datei hierher ziehen

2

Verarbeiten

Klicken Sie auf die Verarbeitungsschaltfläche

3

Herunterladen

Speichern Sie Ihre verarbeitete Datei sofort

Verwandte PDF-Tools

PDF zusammenführen

PDFs kostenlos online zusammenführen

PDF komprimieren

PDF kostenlos online komprimieren

PDF teilen

PDF kostenlos online teilen

PDF bearbeiten

PDF kostenlos online bearbeiten

PDF drehen

PDF kostenlos online drehen

Häufig gestellte Fragen

Woran erkenne ich, ob mein PDF OCR braucht?

Öffnen Sie die Datei in einem beliebigen Viewer und versuchen Sie, eine Textzeile zu markieren. Wird nichts hervorgehoben oder findet die Suche nichts, bestehen die Seiten nur aus Bildern (ein Scan oder ein Foto), und OCR fügt den fehlenden Text hinzu. Ein PDF mit bereits markierbarem Text braucht dieses Tool nicht.

Welche Sprachen kann es erkennen?

Über 100 Tesseract-Sprachpakete stehen zur Auswahl, von Englisch und Spanisch bis Arabisch, Hindi, Japanisch und Chinesisch. Haken Sie jede Sprache an, die im Dokument vorkommt; die Pakete werden gemeinsam geladen, sodass mehrsprachige Seiten in einem Durchgang erkannt werden.

Verändert OCR das Aussehen meines Dokuments?

Nein. Die Originalseiten werden unverändert übernommen und darüber wird eine unsichtbare Textebene gelegt, Wort für Wort passend zum Scan positioniert. Sie sehen dasselbe Bild wie vorher, können den Text nun aber durchsuchen, markieren und kopieren.

Welche Auflösung sollte ich verwenden?

Hoch (288 DPI) ist die Standardeinstellung und eignet sich für typische Bürodokumente. Wechseln Sie zu Standard (192 DPI), wenn es auf Tempo ankommt oder die Datei lang ist, und nutzen Sie Ultra (384 DPI) für Kleingedrucktes, Fußnoten oder schlechte Scans. Höhere Einstellungen dauern spürbar länger, da jede Seite vor der Erkennung in dieser Größe gerendert wird.

Was bewirkt die Zeichen-Whitelist?

Sie beschränkt die Ausgabe auf einen festen Zeichensatz und reduziert so Fehler, etwa wenn ein kleines l als 1 gelesen wird. Die Vorlage „Rechnung“ erlaubt nur Ziffern und die Zeichen $ . , / - # :, „Nur Zahlen“ eignet sich für Seriennummern oder Zählerstände, und unter „Benutzerdefiniert“ geben Sie Ihren eigenen Zeichensatz ein.

Kann es Handschrift lesen?

Nicht zuverlässig. Tesseract ist auf gedruckten Text trainiert: Saubere Druckbuchstaben funktionieren manchmal, Schreibschrift ergibt meist nur Zeichensalat. Am besten sind die Ergebnisse bei sauberen, gut ausgeleuchteten gedruckten Seiten; die Option „Binarisieren“ hilft bei verblassten oder kontrastarmen Scans, und „PDF entzerren“ richtet schiefe Seiten vorher gerade aus.

Kann ich statt eines PDFs nur den erkannten Text erhalten?

Ja. Nach Abschluss der OCR erscheint der erkannte Text in einem Feld, wo Sie ihn prüfen, in die Zwischenablage kopieren oder als ocr-text.txt herunterladen können. Das durchsuchbare PDF laden Sie separat herunter – Sie können also das eine, das andere oder beides nehmen.

Lädt OCR meine Scans auf einen Server hoch?

Nein. Tesseract läuft als WebAssembly in Ihrem Browser; heruntergeladen werden nur die OCR-Engine und die gewählten Sprachpakete, und zwar beim ersten Bedarf. Die gescannten Seiten und der erkannte Text bleiben auf Ihrem Gerät.