Convertir en TXT
TXT est le format de texte brut le plus universel, ouvrable par tout appareil et logiciel. Ce groupe extrait le corps de texte de cinq formats de documents — EPUB dans l'ordre de lecture du spine, PDF par blocs visuels, DOCX/ODT/RTF par analyse structurelle — 5 directions de conversion.
La sortie est en UTF-8 unifié avec conservation des sauts de paragraphe. Les PDF numérisés sans couche de texte ne peuvent pas être extraits. Convient à l'archivage de contenu, à l'indexation de recherche en texte intégral et à l'analyse de texte brut.
EPUB→TXT
Extrait tous les chapitres en texte brut dans l'ordre de lecture de la colonne vertébrale EPUB (balisage et pages de navigation retirés) pour la recherche en texte intégral, les corpus et les sources de synthèse vocale.
PDF→TXT
Extrait la couche de texte du PDF via le texte structuré MuPDF (disposition des lignes et paragraphes préservée, jusqu’à 200 pages); les PDF numérisés sans couche de texte sont signalés.
DOCX→TXT
Analyse directement DOCX OOXML et extrait le texte des paragraphes en texte brut UTF-8 — pas besoin d’Office — pour l’indexation de recherche et la migration de contenu.
RTF→TXT
Analyse le RTF avec une machine à états de mots de contrôle, ignore les métadonnées de police/style, décode les échappements \uN pour le texte CJK, génère un texte brut UTF-8 propre.
ODT→TXT
Analyse directement content.xml dans l'ODT et extrait paragraphes, titres et éléments de liste dans l'ordre en texte UTF-8 — aucune suite bureautique nécessaire.