OKfmt

Guide d'extraction de texte brut depuis EPUB : ordre des chapitres et gestion des résidus de formatage

Cet article explique comment la structure d'un EPUB affecte l'ordre d'extraction et décrit les règles de traitement du format, pour vous aider à obtenir un contenu texte brut répondant aux exigences de recherche en texte intégral et de lecture par synthèse vocale.

Mis à jour le 2026-08-11

Structure d'EPUB et différences d'ordre d'extraction

Un livre numérique au format EPUB est essentiellement une archive compressée au format ZIP. Son contenu principal inclut un fichier OPF au format XML, et le nœud spine du fichier OPF définit explicitement l'ordre de lecture de tous les chapitres.

La plupart des outils gratuits extraient le texte trié par nom de fichier des chapitres décompressés, ce qui perturbe l'ordre des chapitres du livre original. Cette approche ne convient qu'aux fichiers EPUB à un seul chapitre, et génère un contenu désordonné pour les livres à plusieurs chapitres.

Méthode d'extractionPrécision de l'ordreScénarios applicables
Extraction selon l'ordre du spine OPFCorrespond à l'ordre de lecture du livre originalTous les livres EPUB standard
Extraction triée par nom de fichierL'ordre est facilement désordonnéEPUB auto-créé à un seul chapitre

Suppression des balises HTML et règles de saut de ligne de paragraphe

Le contenu des chapitres dans un EPUB est stocké au format XHTML. L'extraction de texte brut nécessite de supprimer toutes les balises HTML et de conserver le contenu textuel réel encapsulé par les balises.

Les règles de conversion conservent les sauts de paragraphe correspondant à la balise <p> du fichier original, en utilisant une ligne vide pour séparer les différents paragraphes ; elles convertissent les balises <br> en un seul saut de ligne, pour s'adapter aux exigences de mise en page des différents scénarios de lecture.

  • Conserve les sauts de paragraphe, adapté à l'import Markdown et à l'organisation de notes
  • Supprime les balises fonctionnelles telles que style et script pour empêcher l'incorporation de contenu non pertinent dans le texte de sortie

Logique d'inclusion de la table des matières et des annotations

Le répertoire de navigation intégré d'EPUB génère un texte de table des matières correspondant. La plupart des utilisateurs n'ont pas besoin de ce contenu lors de l'extraction du corps principal, donc l'outil de conversion supprime la page de table des matières par défaut et conserve le texte du corps principal.

Il existe deux modes de traitement pour les notes de bas de page et les annotations intra-chapitres : lors de l'extraction du texte intégral, tout le contenu des annotations est conservé et placé à la fin du chapitre correspondant ; lors de l'extraction du seul corps principal, toutes les annotations peuvent être supprimées. Les utilisateurs peuvent sélectionner l'option correspondante selon leurs besoins.

Encodage de sortie et compatibilité avec les logiciels de synthèse vocale

Les scénarios de synthèse vocale nécessitent que le texte ne soit pas perturbé par des formats redondants. Le format de sortie avec séparation des paragraphes est conforme à la logique de segmentation de phrase de la plupart des logiciels de synthèse vocale, et peut réduire la probabilité de segmentation de phrase incorrecte.

Note sur la perte inévitable des images et des informations de formatage

L'extraction de texte brut ne conserve que le contenu textuel. Les ressources binaires telles que les illustrations et l'image de couverture dans un EPUB sont complètement supprimées, ce qui est un résultat inévitable de la sortie de texte brut.

Les informations de formatage du livre original, incluant la taille de police, les marges de page, les styles gras et italique, les paramètres de colonnes, etc., ne peuvent pas être conservées dans le texte brut. La sortie finale ne conserve que le contenu textuel et la structure de séparation des paragraphes.

Questions fréquentes

Le texte brut extrait peut-il être importé directement dans Obsidian pour la prise de notes ?

Oui. Le texte brut de sortie utilise l'encodage UTF-8 et sépare les paragraphes avec des lignes vides, et peut être importé directement dans Obsidian. Le format de paragraphe est conforme aux spécifications de mise en page Markdown.

Cet outil peut-il extraire le texte d'un EPUB chiffré par DRM ?

Non. Un EPUB chiffré par DRM doit d'abord être déchiffré avec un outil conforme pour obtenir un fichier non chiffré, avant que vous puissiez utiliser le convertisseur EPUB vers TXT pour extraire le texte brut.

Quel est le tarif pour l'extraction de texte brut ?

Les règles de tarification du convertisseur EPUB vers TXT sont soumises à l'avis public actuel sur le site officiel. L'utilisation de base permet de traiter gratuitement les fichiers éligibles.