แปลงเป็น TXT
TXT เป็นรูปแบบข้อความธรรมดาที่ใช้ได้กับทุกอุปกรณ์และซอฟต์แวร์ กลุ่มนี้จะดึงเนื้อหาข้อความจากรูปแบบเอกสารห้าชนิด — EPUB เรียงตามลำดับการอ่าน, PDF แบ่งตามบล็อกภาพ, DOCX/ODT/RTF แยกวิเคราะห์ตามโครงสร้าง — มีทั้งหมด 5 ทิศทางการแปลง
เอาต์พุตรวมเป็น UTF-8 เดียว เก็บการแบ่งย่อหน้าไว้ ไม่สามารถดึงข้อความจาก PDF สแกนที่ไม่มีชั้นข้อความ เหมาะสำหรับการเก็บถาวรเนื้อหา การจัดทำดัชนีค้นหาข้อความเต็ม และการวิเคราะห์ข้อความธรรมดา
EPUB→TXT
แยกทุกบทเป็นข้อความธรรมดาตามลำดับการอ่านสัน EPUB (ตัดมาร์กอัปและหน้านำทางออก) สำหรับการค้นหาข้อความเต็ม คอร์ปัส และแหล่งข้อมูลข้อความเป็นเสียง
PDF→TXT
ดึงเลเยอร์ข้อความ PDF ผ่านข้อความแบบมีโครงสร้าง MuPDF (คงเค้าโครงบรรทัดและย่อหน้า สูงสุด 200 หน้า) จะแจ้งเตือนหากเป็น PDF สแกนที่ไม่มีเลเยอร์ข้อความ
DOCX→TXT
แยกวิเคราะห์ DOCX OOXML โดยตรงและดึงข้อความย่อหน้าเป็นข้อความธรรมดา UTF-8 ไม่ต้องใช้ Office สำหรับทำดัชนีค้นหาและย้ายเนื้อหา
RTF→TXT
แยกวิเคราะห์ RTF ด้วยสเตทแมชีน control-word ข้ามเมตาดาต้าแบบอักษร/สไตล์ ถอดรหัสเอสเคป \uN สำหรับข้อความ CJK ส่งออกเป็นข้อความธรรมดา UTF-8 ที่สะอาด
ODT→TXT
แยกวิเคราะห์ content.xml ภายใน ODT โดยตรง และดึงย่อหน้า หัวข้อ และรายการตามลำดับเป็นข้อความ UTF-8 — ไม่ต้องชุดโปรแกรมสำนักงาน