Converteren naar TXT
TXT is de meest universele platte-tekstindeling, te openen op elk apparaat en met elke software. Deze groep extraheert hoofdtekst uit vijf documentindelingen — EPUB in rugleesvolgorde, PDF per visuele blokken, DOCX/ODT/RTF via structurele parsing — 5 conversierichtingen.
Output is uniform UTF-8 met behoud van alinea-einden. Gescande PDF's zonder tekstlaag kunnen niet worden geëxtraheerd. Geschikt voor contentarchivering, full-text zoekindexering en platte-tekstanalyse.
EPUB→TXT
Extraheert alle hoofdstukken als platte tekst in de leesvolgorde van de EPUB-spin (opmaak en navigatiepagina's verwijderd) voor volledige tekstzoekopdrachten, corpora en tekst-naar-spraakbronnen.
PDF→TXT
Extraheert de PDF-tekstlaag via MuPDF gestructureerde tekst (regel- en alinea-indeling behouden, tot 200 pagina's); gescande PDF's zonder tekstlaag worden gerapporteerd.
DOCX→TXT
Parseert DOCX OOXML direct en extraheert alineatekst als UTF-8 platte tekst — geen Office nodig — voor zoekindexering en contentmigratie.
RTF→TXT
Parseert RTF met een control-word staatmachine, slaat font/stijl metadata over, decodeert \uN escapes voor CJK-tekst, geeft schone UTF-8 platte tekst.
ODT→TXT
Parseert content.xml direct in het ODT en extraheert paragrafen, koppen en lijstitems op volgorde als UTF-8 tekst — geen kantoorsuite nodig.