Konwertuj na TXT
TXT to najbardziej uniwersalny format zwykłego tekstu, otwierany na każdym urządzeniu i przez każde oprogramowanie. Ta grupa narzędzi wyodrębnia tekst główny z pięciu formatów dokumentów — EPUB w kolejności czytania grzbietu, PDF według bloków wizualnych, DOCX/ODT/RTF przez parsowanie strukturalne — 5 kierunków konwersji.
Wyjście jest ujednicone do UTF-8 z zachowaniem podziałów na akapity. Nie można wyodrębnić tekstu z zeskanowanych plików PDF bez warstwy tekstowej. Narzędzie nadaje się do archiwizacji treści, indeksowania do pełnotekstowego wyszukiwania i analizy zwykłego tekstu.
EPUB→TXT
Ekstrahuje wszystkie rozdziały jako zwykły tekst w kolejności czytania z grzbietu EPUB (znaczniki i strony nawigacyjne usunięte) do wyszukiwania pełnotekstowego, korpusów i źródeł tekstu na mowę.
PDF→TXT
Wyodrębnia warstwę tekstową PDF za pomocą tekstu strukturalnego MuPDF (z zachowaniem układu linii i akapitów, do 200 stron); skanowane PDF bez warstwy tekstowej są raportowane.
DOCX→TXT
Parsuje bezpośrednio DOCX OOXML i wyodrębnia tekst akapitów jako zwykły tekst UTF-8 — bez potrzeby posiadania Office — do indeksowania wyszukiwania i migracji treści.
RTF→TXT
Parsuje RTF za pomocą automatu stanów słów kontrolnych, pomija metadane czcionek i stylów, dekoduje znaki \uN dla tekstu CJK, tworzy czysty zwykły tekst UTF-8.
ODT→TXT
Parsuje content.xml bezpośrednio wewnątrz ODT i wyodrębnia akapity, nagłówki i elementy list w kolejności jako tekst UTF-8 — brak wymogu pakietu biurowego.