Конвертировать в TXT
TXT — самый универсальный формат обычного текста, открывается на любом устройстве и в любом программном обеспечении. Эта группа инструментов извлекает основной текст из пяти форматов документов — EPUB по порядку чтения корешка, PDF по визуальным блокам, DOCX/ODT/RTF через структурный парсинг — всего 5 направлений конвертации.
Выходной текст сохраняет разрывы абзацев и приводится к унифицированному UTF-8. Текст из отсканированных PDF без текстового слоя извлечь нельзя. Подходит для архивирования контента, индексации полнотекстового поиска и анализа обычного текста.
EPUB→TXT
Извлекает все главы в виде обычного текста в порядке чтения переплета EPUB (разметка и навигационные страницы удалены) для полнотекстового поиска, корпусов текста и источников для синтеза речи.
PDF→TXT
Извлекает текстовый слой PDF через структурированный текст MuPDF (сохраняет разметку строк и абзацев, до 200 страниц); сообщает об отсканированных PDF без текстового слоя.
DOCX→TXT
Парсит DOCX OOXML напрямую и извлекает текст абзацев в виде обычного UTF-8 текста — без Office — для индексации поиска и миграции контента.
RTF→TXT
Парсит RTF с помощью конечного автомата управляющих слов, пропускает метаданные шрифтов и стилей, декодирует экранирования \uN для CJK-текста, выводит чистый простой текст UTF-8.
ODT→TXT
Парсит content.xml внутри ODT напрямую и извлекает абзацы, заголовки и элементы списка по порядку в текст UTF-8 — офисный пакет не требуется.