Tutorio Lab
← Alle Tutorials

Wie man den ganzen Text aus einem PDF herausholt

Geh auf tutoriolab.com/pdf/de, klick auf Text herausholen, leg das PDF hinein und drück den Knopf. Heruntergeladen wird eine .txt mit allem, was geschrieben stand, Blatt für Blatt. Ist das PDF ein Scan, kommt fast nichts heraus: da ist kein Text, da ist ein Bild von einem Text.

Den ganzen Text aus einem PDF auf einmal herausholen.

Geh auf tutoriolab.com/pdf/de

Geh auf tutoriolab.com schrägstrich pdf schrägstrich de. Du hast es oben links und als Erstes in der Beschreibung. Hier gibt es zwanzig Werkzeuge für PDF, und das, was wir suchen, ist dieses: Text herausholen.

Geh auf tutoriolab.com/pdf/de — Wie man den ganzen Text aus einem PDF herausholt

"Text herausholen" anklicken

Klick drauf. Und schon bist du drin. Das ist alles, was es hat: einen Knopf, um die Datei auszuwählen, und das Feld zum Fallenlassen.

"Text herausholen" anklicken — Wie man den ganzen Text aus einem PDF herausholt

PDF hineinlegen

Leg das PDF hinein. Klick auf den Auswahlknopf und such es aus, oder zieh es direkt auf das Feld. Und sobald es drin ist, zeichnet die Seite es dir hin: keine Liste mit Zahlen, die dir nichts sagt, sondern die Blätter des Dokuments.

PDF hineinlegen — Wie man den ganzen Text aus einem PDF herausholt

Herausholen

Es gibt nichts auszusuchen, also klick auf Text herausholen. Es geht Blatt für Blatt.

Herausholen — Wie man den ganzen Text aus einem PDF herausholt

Und wenn dein PDF ein Scan ist

Und fertig: heruntergeladen ist eine Textdatei mit allem, was geschrieben stand, Blatt für Blatt, und es sagt dir, wie viele Buchstaben herausgekommen sind. Darin bekommt jede Seite ihre eigene Überschrift, du siehst also, wo eine aufhört und die nächste anfängt. Du machst sie mit dem Editor auf und fügst sie ein, wo du willst. Und etwas, das viele überrascht: wenn dein PDF dich den Text nicht mit der Maus markieren lässt, kommt er hier trotzdem heraus, weil er aus der Datei selbst gelesen wird und nicht aus dem, was du markieren kannst. Hier bleibt dir der Knopf, falls dein Browser es geblockt hat. Und etwas, das dir den Ärger erspart: wenn dein PDF ein Scan ist, kommt hier fast nichts heraus, und das ist kein Fehler. In einem Scan gibt es keine Buchstaben: da ist ein Foto von Buchstaben, und um daraus Text zu machen, braucht man eine Texterkennung für Bilder, und die hat diese Seite nicht. Wenn das passiert, sagt die Seite es dir mit diesen Worten, statt dir eine leere Datei zu geben und dich denken zu lassen, du hättest etwas falsch gemacht.

Und wenn dein PDF ein Scan ist — Wie man den ganzen Text aus einem PDF herausholt

Das war es. Wenn es dir geholfen hat, abonnier und gib einen Daumen hoch. Der Link ist oben und als Erstes in der Beschreibung. Bis zum nächsten Mal.

Häufige Fragen

Mein PDF ist ein Scan und es kommt nichts heraus. Warum?

Weil es in einem Scan keinen Text gibt: jede Seite ist ein Foto. Um aus diesem Foto Buchstaben zu machen, braucht man eine Texterkennung für Bilder — das, was OCR heißt — und die hat diese Seite nicht. Das Werkzeug sagt es dir, wenn es merkt, dass es fast keine Buchstaben gibt.

Mein PDF lässt mich den Text nicht mit der Maus markieren.

Das ist ein Vermerk, den das Dokument trägt und der den Leser bittet, das Kopieren nicht zuzulassen; verschlüsselt wird dabei nichts. Weil der Text hier aus der Datei selbst gelesen wird, kommt er trotzdem heraus. Etwas anderes ist ein PDF, das beim Öffnen nach einem Passwort fragt: da muss man es erst entfernen, und dafür muss man es kennen.

Bleiben Formatierung, Tabellen und Fettdruck erhalten?

Nein. Heraus kommt reiner Text, ohne Schriftarten und ohne Tabellen, nach Seiten getrennt. Das ist das, was man zum Kopieren, Suchen oder Einfügen woanders braucht, und formatiert wird dort.

Weiter geht es hier