OKfmt

แปลงเป็น TXT

TXT เป็นรูปแบบข้อความธรรมดาที่ใช้ได้กับทุกอุปกรณ์และซอฟต์แวร์ กลุ่มนี้จะดึงเนื้อหาข้อความจากรูปแบบเอกสารห้าชนิด — EPUB เรียงตามลำดับการอ่าน, PDF แบ่งตามบล็อกภาพ, DOCX/ODT/RTF แยกวิเคราะห์ตามโครงสร้าง — มีทั้งหมด 5 ทิศทางการแปลง

เอาต์พุตรวมเป็น UTF-8 เดียว เก็บการแบ่งย่อหน้าไว้ ไม่สามารถดึงข้อความจาก PDF สแกนที่ไม่มีชั้นข้อความ เหมาะสำหรับการเก็บถาวรเนื้อหา การจัดทำดัชนีค้นหาข้อความเต็ม และการวิเคราะห์ข้อความธรรมดา

EPUB

EPUBTXT

แยกทุกบทเป็นข้อความธรรมดาตามลำดับการอ่านสัน EPUB (ตัดมาร์กอัปและหน้านำทางออก) สำหรับการค้นหาข้อความเต็ม คอร์ปัส และแหล่งข้อมูลข้อความเป็นเสียง

PDF

PDFTXT

ดึงเลเยอร์ข้อความ PDF ผ่านข้อความแบบมีโครงสร้าง MuPDF (คงเค้าโครงบรรทัดและย่อหน้า สูงสุด 200 หน้า) จะแจ้งเตือนหากเป็น PDF สแกนที่ไม่มีเลเยอร์ข้อความ

DOCX

DOCXTXT

แยกวิเคราะห์ DOCX OOXML โดยตรงและดึงข้อความย่อหน้าเป็นข้อความธรรมดา UTF-8 ไม่ต้องใช้ Office สำหรับทำดัชนีค้นหาและย้ายเนื้อหา

RTF

RTFTXT

แยกวิเคราะห์ RTF ด้วยสเตทแมชีน control-word ข้ามเมตาดาต้าแบบอักษร/สไตล์ ถอดรหัสเอสเคป \uN สำหรับข้อความ CJK ส่งออกเป็นข้อความธรรมดา UTF-8 ที่สะอาด

ODT

ODTTXT

แยกวิเคราะห์ content.xml ภายใน ODT โดยตรง และดึงย่อหน้า หัวข้อ และรายการตามลำดับเป็นข้อความ UTF-8 — ไม่ต้องชุดโปรแกรมสำนักงาน