OKfmt

Конвертировать в TXT

TXT — самый универсальный формат обычного текста, открывается на любом устройстве и в любом программном обеспечении. Эта группа инструментов извлекает основной текст из пяти форматов документов — EPUB по порядку чтения корешка, PDF по визуальным блокам, DOCX/ODT/RTF через структурный парсинг — всего 5 направлений конвертации.

Выходной текст сохраняет разрывы абзацев и приводится к унифицированному UTF-8. Текст из отсканированных PDF без текстового слоя извлечь нельзя. Подходит для архивирования контента, индексации полнотекстового поиска и анализа обычного текста.

EPUB

EPUBTXT

Извлекает все главы в виде обычного текста в порядке чтения переплета EPUB (разметка и навигационные страницы удалены) для полнотекстового поиска, корпусов текста и источников для синтеза речи.

PDF

PDFTXT

Извлекает текстовый слой PDF через структурированный текст MuPDF (сохраняет разметку строк и абзацев, до 200 страниц); сообщает об отсканированных PDF без текстового слоя.

DOCX

DOCXTXT

Парсит DOCX OOXML напрямую и извлекает текст абзацев в виде обычного UTF-8 текста — без Office — для индексации поиска и миграции контента.

RTF

RTFTXT

Парсит RTF с помощью конечного автомата управляющих слов, пропускает метаданные шрифтов и стилей, декодирует экранирования \uN для CJK-текста, выводит чистый простой текст UTF-8.

ODT

ODTTXT

Парсит content.xml внутри ODT напрямую и извлекает абзацы, заголовки и элементы списка по порядку в текст UTF-8 — офисный пакет не требуется.