TXT로 변환
TXT는 모든 기기와 소프트웨어에서 열 수 있는 가장 보편적인 일반 텍스트 형식입니다. 이 도구 모음은 다섯 가지 문서 형식에서 본문 텍스트를 추출합니다 — EPUB는 스파인 읽기 순서, PDF는 시각적 블록 단위, DOCX/ODT/RTF는 구조 파싱을 통해 처리하며, 5가지 변환 방향을 지원합니다.
출력은 단락 줄바꿈이 유지된 통합 UTF-8입니다. 텍스트 레이어가 없는 스캔 PDF는 추출할 수 없습니다. 콘텐츠 아카이빙, 전문 검색 인덱싱, 일반 텍스트 분석에 적합합니다.
EPUB
EPUB→TXT
EPUB 척자 읽기 순서대로 모든 챕터를 일반 텍스트로 추출하며(마크업과 탐색 페이지 제거) 전문 검색, 말뭉치, 텍스트 음성 변환 소스로 사용할 수 있습니다.
PDF
PDF→TXT
MuPDF 구조화 텍스트를 통해 PDF 텍스트 레이어를 추출합니다(줄 및 단락 레이아웃 유지, 최대 200페이지). 텍스트 레이어가 없는 스캔 PDF는 처리 불가로 알립니다.
DOCX
DOCX→TXT
DOCX OOXML을 직접 파싱하여 단락 텍스트를 UTF-8 일반 텍스트로 추출합니다. Office가 필요 없으며 검색 인덱싱과 콘텐츠 마이그레이션에 적합합니다.
RTF
RTF→TXT
제어 단어 상태 기계로 RTF를 파싱하고 글꼴/스타일 메타데이터를 건너뛰며 CJK 텍스트의 \uN 이스케이프를 디코딩하여 깔끔한 UTF-8 일반 텍스트를 출력합니다.
ODT
ODT→TXT
ODT 내부의 content.xml을 직접 파싱하고 단락, 제목, 목록 항목을 순서대로 UTF-8 텍스트로 추출합니다. 오피스 스위트가 필요하지 않습니다.