Eine PDF durchsuchbar und kopierbar machen.
So funktioniert es:
Klick hier, um eine Datei auszuwählen oder per Drag & Drop reinziehen
Deine Dateien verlassen nie dein Gerät.
Ausgewählt: Keine
Nur diese Zeichen werden erkannt. Für alle Zeichen leer lassen.
Nur diese Zeichen werden erkannt. Für alle Zeichen leer lassen.
Wird initialisiert...
Ihre durchsuchbare PDF ist bereit. Sie können den extrahierten Text unten auch kopieren oder herunterladen.
Verarbeite...
Klicken oder Datei hierher ziehen
Klicken Sie auf die Verarbeitungsschaltfläche
Speichern Sie Ihre verarbeitete Datei sofort
Öffnen Sie die Datei in einem beliebigen Viewer und versuchen Sie, eine Textzeile zu markieren. Wird nichts hervorgehoben oder findet die Suche nichts, bestehen die Seiten nur aus Bildern (ein Scan oder ein Foto), und OCR fügt den fehlenden Text hinzu. Ein PDF mit bereits markierbarem Text braucht dieses Tool nicht.
Über 100 Tesseract-Sprachpakete stehen zur Auswahl, von Englisch und Spanisch bis Arabisch, Hindi, Japanisch und Chinesisch. Haken Sie jede Sprache an, die im Dokument vorkommt; die Pakete werden gemeinsam geladen, sodass mehrsprachige Seiten in einem Durchgang erkannt werden.
Nein. Die Originalseiten werden unverändert übernommen und darüber wird eine unsichtbare Textebene gelegt, Wort für Wort passend zum Scan positioniert. Sie sehen dasselbe Bild wie vorher, können den Text nun aber durchsuchen, markieren und kopieren.
Hoch (288 DPI) ist die Standardeinstellung und eignet sich für typische Bürodokumente. Wechseln Sie zu Standard (192 DPI), wenn es auf Tempo ankommt oder die Datei lang ist, und nutzen Sie Ultra (384 DPI) für Kleingedrucktes, Fußnoten oder schlechte Scans. Höhere Einstellungen dauern spürbar länger, da jede Seite vor der Erkennung in dieser Größe gerendert wird.
Sie beschränkt die Ausgabe auf einen festen Zeichensatz und reduziert so Fehler, etwa wenn ein kleines l als 1 gelesen wird. Die Vorlage „Rechnung“ erlaubt nur Ziffern und die Zeichen $ . , / - # :, „Nur Zahlen“ eignet sich für Seriennummern oder Zählerstände, und unter „Benutzerdefiniert“ geben Sie Ihren eigenen Zeichensatz ein.
Nicht zuverlässig. Tesseract ist auf gedruckten Text trainiert: Saubere Druckbuchstaben funktionieren manchmal, Schreibschrift ergibt meist nur Zeichensalat. Am besten sind die Ergebnisse bei sauberen, gut ausgeleuchteten gedruckten Seiten; die Option „Binarisieren“ hilft bei verblassten oder kontrastarmen Scans, und „PDF entzerren“ richtet schiefe Seiten vorher gerade aus.
Ja. Nach Abschluss der OCR erscheint der erkannte Text in einem Feld, wo Sie ihn prüfen, in die Zwischenablage kopieren oder als ocr-text.txt herunterladen können. Das durchsuchbare PDF laden Sie separat herunter – Sie können also das eine, das andere oder beides nehmen.
Nein. Tesseract läuft als WebAssembly in Ihrem Browser; heruntergeladen werden nur die OCR-Engine und die gewählten Sprachpakete, und zwar beim ersten Bedarf. Die gescannten Seiten und der erkannte Text bleiben auf Ihrem Gerät.