OKfmt

EPUB에서 일반 텍스트 추출 가이드: 챕터 순서 지정 및 형식 잔여물 처리

이 글은 EPUB 구조가 추출 순서에 미치는 영향을 설명하고 형식 처리 규칙을 기술하여, 전문 검색과 텍스트 음성 변환 읽기 요구 사항을 충족하는 일반 텍스트 콘텐츠를 출력하는 방법을 안내합니다.

2026-08-11에 업데이트됨

EPUB 구조와 추출 순서의 차이

EPUB 전자책은 기본적으로 ZIP 형식으로 압축된 아카이브입니다. 핵심 콘텐츠에는 XML 형식의 OPF 파일이 포함되어 있으며, OPF 파일의 스파인 노드는 모든 챕터의 읽기 순서를 명시적으로 정의합니다.

대부분의 무료 도구는 압축 해제된 챕터의 파일명을 기준으로 정렬하여 텍스트를 추출하므로 원본 책의 챕터 순서가 뒤섞입니다. 이 방식은 단일 챕터 EPUB 파일에만 적합하며, 다중 챕터 책의 경우 콘텐츠 순서가 뒤섞인 결과가 발생합니다.

추출 방법순서 정확도적용 시나리오
OPF 스파인 순서로 추출원본 책의 읽기 순서와 일치모든 표준 EPUB 전자책
파일명으로 정렬하여 추출순서가 뒤섞이기 쉬움직접 제작한 단일 챕터 EPUB

HTML 태그 제거 및 단락 줄 바꿈 규칙

EPUB의 챕터 콘텐츠는 XHTML 형식으로 저장됩니다. 일반 텍스트를 추출하려면 모든 HTML 태그를 제거하고 태그로 감싸인 실제 본문 텍스트 콘텐츠를 유지해야 합니다.

변환 규칙은 원본 파일의 <p> 태그에 해당하는 단락 줄 바꿈을 유지하며, 서로 다른 단락을 빈 줄 하나로 구분합니다. <br> 태그는 단일 줄 바꿈으로 변환하여 다양한 읽기 시나리오의 레이아웃 요구 사항에 맞춥니다.

  • 단락 줄 바꿈을 유지하므로 Markdown 가져오기 및 노트 정리에 적합합니다
  • 스타일, 스크립트 등 기능성 태그를 제거하여 출력 텍스트에 관련 없는 콘텐츠가 섞이는 것을 방지합니다

목차 및 주석 포함 논리

EPUB의 내장 탐색 디렉터리는 해당 목차 텍스트를 생성합니다. 대부분의 사용자는 본문 추출 시 이 콘텐츠를 필요로 하지 않으므로 변환 도구는 기본적으로 목차 페이지를 제거하고 본문 텍스트를 유지합니다.

각주와 챕터 내 주석에 대해 두 가지 처리 모드가 있습니다. 전문 추출 시 모든 주석 콘텐츠를 유지하고 해당 챕터의 마지막에 배치하며, 본문 텍스트만 추출할 때 모든 주석을 제거할 수 있습니다. 사용자는 본인의 필요에 따라 해당 옵션을 선택할 수 있습니다.

출력 인코딩 및 텍스트 음성 변환 소프트웨어 호환성

텍스트 음성 변환 시나리오에서는 텍스트에 불필요한 형식 간섭이 없어야 합니다. 단락 분리가 적용된 출력 형식은 대부분 텍스트 음성 변환 소프트웨어의 문장 분리 논리와 일치하며, 잘못된 문장 분리가 발생할 확률을 줄일 수 있습니다.

이미지 및 형식 정보의 불가피한 손실에 대한 참고

일반 텍스트 추출은 텍스트 콘텐츠만 유지합니다. EPUB 내 삽화, 표지 이미지 등 바이너리 리소스는 완전히 제거되며, 이는 일반 텍스트 출력의 불가피한 결과입니다.

원본 책의 글꼴 크기, 페이지 여백, 굵고 기울임꼴 스타일, 열 설정 등 형식 정보는 일반 텍스트에 유지할 수 없습니다. 최종 출력은 텍스트 콘텐츠와 단락 분리 구조만 유지합니다.

자주 묻는 질문

추출된 일반 텍스트를 Obsidian에 직접 가져와서 노트 작성할 수 있나요?

가능합니다. 출력되는 일반 텍스트는 UTF-8 인코딩을 사용하며 빈 줄로 단락을 구분하므로 Obsidian에 직접 가져올 수 있습니다. 단락 형식이 Markdown 레이아웃 사양과 일치합니다.

이 도구는 DRM 암호화된 EPUB에서 텍스트를 추출할 수 있나요?

불가능합니다. DRM 암호화된 EPUB는 적합한 도구로 먼저 복호화하여 비암호화 파일을 얻은 후에 EPUB to TXT 변환기를 사용해 일반 텍스트를 추출할 수 있습니다.

일반 텍스트 추출의 가격은 어떻게 되나요?

EPUB to TXT 변환기의 가격 규칙은 공식 웹사이트의 현재 공지를 따릅니다. 기본 사용의 경우 적합한 파일을 무료로 처리할 수 있습니다.