In TXT konvertieren
TXT ist das universellste Klartextformat, das auf jedem Gerät und mit jeder Software geöffnet werden kann. Diese Gruppe extrahiert Haupttext aus fünf Dokumentformaten — EPUB in Lesereihenfolge des Buchrückens, PDF nach visuellen Blöcken, DOCX/ODT/RTF durch Strukturanalyse — 5 Konvertierungsrichtungen.
Die Ausgabe ist einheitliches UTF-8 mit erhaltenen Absatzumbrüchen. Gescannte PDFs ohne Textebene können nicht extrahiert werden. Geeignet für Inhaltsarchivierung, Volltextindexierung und Klartextanalyse.
EPUB→TXT
Extrahiert alle Kapitel als Klartext in der Lesereihenfolge des EPUB-Rückgrats (Markup und Navigationsseiten entfernt) für Volltextsuche, Textkorpora und Text-to-Speech-Quellen.
PDF→TXT
Extrahiert die PDF-TEXTEbene über MuPDF-Strukturtext (Zeilen- und Absatzlayout bleibt erhalten, bis 200 Seiten); gescannte PDFs ohne Textebene werden gemeldet.
DOCX→TXT
Parst DOCX OOXML direkt und extrahiert Absatztext als UTF-8-Klartext – kein Office benötigt – für Suchindizierung und Content-Migration.
RTF→TXT
Parst RTF mit einer Steuerwort-Zustandsmaschine, überspringt Schrift-/Stil-Metadaten, dekodiert \uN-Escapes für CJK-Text, gibt sauberes UTF-8-Klartext aus.
ODT→TXT
Parst content.xml direkt innerhalb der ODT und extrahiert Absätze, Überschriften und Listenelemente in Reihenfolge als UTF-8-Text — keine Office-Anwendung benötigt.