TXTに変換
TXTは最も汎用的なプレーンテキスト形式で、あらゆるデバイスやソフトウェアで開けます。このツールは5つのドキュメント形式から本文テキストを抽出します — EPUBは背表紙の読み順、PDFは視覚的ブロック、DOCX/ODT/RTFは構造パースによる処理で、計5種類の変換方向に対応しています。
出力は統一UTF-8で段落区切りを保持します。テキストレイヤーのないスキャンPDFからは抽出できません。コンテンツのアーカイブ、全文検索インデックス作成、プレーンテキスト分析に適しています。
EPUB
EPUB→TXT
EPUBの spine 読み順にすべてのチャプターをプレーンテキストとして抽出(マークアップとナビゲーションページは削除)し、全文検索、コーパス、音声読み上げソースとして利用できます。
PDF
PDF→TXT
MuPDF構造化テキスト経由でPDFのテキストレイヤーを抽出します(行と段落のレイアウトを保持、最大200ページ)。テキストレイヤーのないスキャンPDFは通知されます。
DOCX
DOCX→TXT
DOCX OOXMLを直接解析し、段落テキストをUTF-8プレーンテキストとして抽出します。Officeは不要で、検索インデックスやコンテンツ移行に適しています。
RTF
RTF→TXT
RTFを制御文のステートマシンで解析し、フォント/スタイルのメタデータをスキップ、CJKテキストの\uNエスケープをデコードし、クリーンなUTF-8プレーンテキストを出力します。
ODT
ODT→TXT
ODT内のcontent.xmlを直接解析し、段落、見出し、リスト項目を順番に抽出してUTF-8テキストとして出力します。オフィススイートは不要です。