PDF zu Text

Extrahiere den Text aus einem PDF.

🔒 Diese Datei wird in deinem Browser verarbeitet. Sie wird nie hochgeladen.

Wofür es gut ist

Den Text aus einem PDF zu holen gibt dir seinen Inhalt als reinen Text zurück, fertig zum Kopieren, Suchen, Übersetzen oder Weiterverwenden. Das erspart das seitenweise Markieren von Hand, das bei langen Dokumenten langsam ist und meist seltsame Zeilenumbrüche mitschleppt.

Wichtig ist der Unterschied zwischen den beiden PDF-Arten. Aus einem Textprogramm erzeugte PDFs tragen den Text als Text in sich, daraus lässt er sich einwandfrei extrahieren. Vom Scanner stammende sind in Wahrheit Fotos von Papier: Sie zu lesen erforderte Texterkennung, die dieses Werkzeug nicht enthält.

Schnell herausfinden lässt sich das so: Öffne das PDF und versuche, ein Wort mit der Maus zu markieren. Klappt das, funktioniert die Extraktion. Zieht der Cursor nur ein Rechteck auf, ist es ein Scan.

So funktioniert's

  1. Lade das PDF hoch, dessen Text du übernehmen möchtest.
  2. Klicke auf "Verarbeiten": Das Werkzeug durchläuft alle Seiten und extrahiert den enthaltenen Text.
  3. Kopiere das Ergebnis direkt aus dem angezeigten Textfeld.

Wann man es einsetzt

Inhalte wiederverwenden

Den Text eines alten Berichts zurückzuholen erspart das komplette Abtippen.

Ein Dokument übersetzen

Maschinelle Übersetzer kommen mit reinem Text weit besser zurecht als mit einem gesetzten PDF.

Suchen und auswerten

Mit dem losen Text kannst du Begriffe suchen, Nennungen zählen oder ihn in eine Tabelle überführen.

Praktische Tipps

  • Das Ergebnis ist reiner Text: Fettung, Spalten und Tabellen gehen verloren. Die Lesereihenfolge bleibt, das Layout nicht.
  • Bei zweispaltigen Dokumenten kann die Reihenfolge durcheinandergeraten, je nachdem, wie das PDF erzeugt wurde.
  • Ist das PDF gegen Kopieren geschützt, liefert die Extraktion vermutlich nichts.
  • Aus einem Scan bekommst du keinen Text. Dafür bräuchtest du OCR, das hier nicht verfügbar ist.

Häufige Fragen

Funktioniert das mit gescannten PDF (Bildern)?

Nein. Dieses Werkzeug extrahiert echten, im PDF eingebetteten Text; ist das Dokument ein Scan ohne Textebene, bräuchte es OCR, das hier nicht verfügbar ist.

Bleibt die Formatierung des Originals erhalten?

Nein, das Ergebnis ist reiner Text ohne Fettschrift, Tabellen oder Spalten: Die Leserichtung bleibt erhalten, das Layout nicht.

Ähnliche Werkzeuge