Holt den in einem PDF gespeicherten Text in ein Textfeld, das Sie kopieren oder als .txt-Datei sichern können. Gelesen werden die im Dokument eingebetteten Zeichen, ein gescanntes oder reines Bild-PDF liefert daher nichts — eine OCR gibt es nicht. Die Datei wird nur im Browser gelesen und nie hochgeladen.
Was bedeutet „PDF-Text extrahieren“?
Dabei wird der in einer PDF enthaltene Text herausgelöst und in einfachen, bearbeit-, durchsuch- und kopierbaren Text umgewandelt. Das ist nützlich, wenn Sie Inhalte an anderer Stelle weiterverwenden oder zitieren oder als TXT aufbewahren und durchsuchen möchten.
So extrahieren Sie Text aus einer PDF
- Datei auswählen — Ziehen Sie die PDF, aus der Sie Text herauslösen möchten, hinein oder klicken Sie, um sie zu öffnen.
- Text extrahieren — Klicken Sie auf „Text extrahieren“, und der Text jeder Seite wird unten angezeigt.
- Kopieren oder speichern — Übernehmen Sie ihn mit „Kopieren“ in die Zwischenablage oder laden Sie ihn mit „Als TXT speichern“ als Datei herunter.
Kommt bei einer gescannten PDF auch Text heraus?
Nein. Wenn die Seiten wie bei einem Scan oder Foto nur aus Bildern bestehen, gibt es keine Textinformationen zum Herauslösen. In diesem Fall ist eine Texterkennung (OCR) nötig, die Zeichen im Bild erkennt; dieses Tool liest nur die tatsächlich im Dokument vorhandene Textebene.
Kann ich den extrahierten Text speichern?
Ja. Der extrahierte Text wird sofort auf dem Bildschirm angezeigt und lässt sich über die Schaltfläche Kopieren in die Zwischenablage übernehmen oder über Als TXT speichern als Textdatei (.txt) herunterladen. Sie können auch nur den benötigten Teil auswählen und kopieren.
Bleiben Tabellen und Spalten erhalten?
Der Text selbst wird präzise extrahiert, aber Tabellen, mehrere Spalten und komplexe Layouts werden möglicherweise nicht originalgetreu wiedergegeben. Nach dem Extrahieren müssen Sie Reihenfolge oder Zeilenumbrüche unter Umständen leicht nacharbeiten.
Werden die Dateien auf einen Server hochgeladen?
Nein. Die Textextraktion erfolgt vollständig in Ihrem Browser, sodass die PDF weder an einen Server gesendet noch dort gespeichert wird. So können Sie auch sensible Dokumente bedenkenlos bearbeiten. Die Verarbeitungsbibliothek wird nur bei der ersten Extraktion einmal geladen und danach zwischengespeichert.