OKfmt

MP4/MKV에서 내장 자막 추출하기: 자막 스트림과 하드코딩 자막의 차이 가이드

본 문서는 비디오 내장 소프트 자막과 하드코딩 자막의 차이를 설명하며, 패키징된 자막 스트림을 추출해 SRT와 VTT 형식으로 출력하는 과정의 기술 원리와 제한 사항을 서술합니다.

2026-08-11에 업데이트됨

소프트 자막 스트림과 하드코딩 자막의 본질적인 차이

패키징된 자막 스트림이라고도 불리는 소프트 자막은 비디오 컨테이너에 독립적인 이진 데이터 트랙으로 저장됩니다. 프레임 픽셀에 결합되지 않으며 별도로 재인코딩하거나 전환하거나 추출할 수 있습니다.

하드코딩 자막은 프레임 픽셀로 렌더링되어 비디오 프레임에 굽혀지며 이미지 픽셀과 완전히 합쳐져 별도로 분리 가능한 자막 데이터 트랙으로 존재하지 않습니다.

일반적인 내장 자막은 위 두 가지 유형을 모두 포함합니다. 독립적으로 패키징된 소프트 자막 스트림만 리멀싱을 통해 추출할 수 있습니다.

MKV와 MP4의 자막 컨테이너 차이

MKV는 개방형 멀티미디어 컨테이너로서 여러 유형의 여러 자막 트랙 패키징을 기본적으로 지원합니다. 내장 자막이 있는 대부분의 비디오는 MKV 형식을 사용합니다.

MP4는 표준 텍스트 자막 저장 형식으로 mov_text를 사용합니다. 기기에서 생성한 일부 MP4 파일은 비표준 형식으로 자막을 저장하므로 직접 추출할 수 없습니다.

컨테이너 형식지원하는 자막 트랙 유형다중 자막 트랙 지원
MKVSSA/ASS, SRT, VobSub를 포함한 여러 유형다른 언어의 여러 자막 트랙 패키징 지원
MP4표준 mov_text 텍스트 트랙만 지원하며 이미지 자막 지원이 제한적단일 텍스트 자막 트랙만 지원

리멀싱을 통한 추출의 기술 원리

이 비디오 자막 추출기는 FFmpeg의 -c:s copy 매개변수를 사용해 추출을 수행합니다. 이 매개변수는 자막 스트림을 재인코딩하지 않고 원본 자막 데이터를 직접 복사해 대상 파일을 생성합니다.

전체 추출 과정은 패키징된 자막 데이터만 복사하며 전체 비디오를 디코딩하고 재인코딩할 필요가 없습니다. 1GB 비디오에서 자막을 추출하는 데 몇 초밖에 걸리지 않습니다.

추출 과정은 원본 비디오 파일을 수정하지 않으며 과도한 프로세서 자원을 소모하지 않습니다. 작업 과정은 원본 비디오에서 자막 트랙 데이터만 읽어 새 파일을 출력합니다.

추출 도구의 기능 범위

이 비디오 자막 추출기는 하드코딩 자막에 대한 OCR 인식을 지원하지 않습니다. 하드코딩 자막 인식은 전용 AI 모델 학습과 컴퓨팅 자원이 필요하며 독립적인 OCR 서비스 분야에 속하므로 본 도구는 이 기능을 제공하지 않습니다.

업로드한 비디오에 분리 가능한 독립 자막 스트림이 포함되지 않은 경우, 도구는 명확한 오류 메시지를 반환해 현재 비디오에서 추출 가능한 자막 트랙이 감지되지 않았음을 사용자에게 알립니다.

추출 후 사용자는 SRT 또는 VTT 두 가지 일반적인 자막 형식 중에서 자유롭게 출력 형식을 선택할 수 있어 다양한 재생 및 편집 요구 사항을 충족합니다. 두 형식 모두 개방된 공개 표준입니다.

자주 묻는 질문

내 MP4에서 내장 자막을 추출할 수 없는 이유가 무엇인가요?

두 가지 원인이 가능합니다: 첫째, 자막이 프레임에 하드코딩되어 굽혀져 있어 독립적으로 추출 가능한 자막 스트림이 존재하지 않는 경우이며, 둘째, MP4의 자막 트랙이 비표준 형식이라 도구가 인식할 수 없는 경우입니다. 세부 내용은 도구가 반환한 특정 오류 메시지를 확인하실 수 있습니다.

추출된 자막이 idx+sub 형식인 이유가 무엇인가요?

이는 원본 비디오에 이미지 기반 VobSub 자막이 패키징되어 있기 때문입니다. 이 형식은 본래 이미지 자막이므로 도구는 추가 형식 변환을 수행하지 않고 원본 데이터를 직접 복사해 출력합니다. 텍스트 형식으로 변환해야 하는 경우 전용 OCR 도구를 사용해 처리하실 수 있습니다. 가격은 공식 웹사이트의 현재 공고를 따릅니다.

MKV에서 여러 자막 트랙을 추출할 수 있나요?

본 도구는 MKV에 패키징된 모든 독립 자막 트랙을 인식하는 것을 지원합니다. 추출할 지정된 자막 트랙을 선택하실 수 있습니다. 각 자막 트랙은 별도로 추출해야 하며, 작업마다 해당 개별 자막 파일이 생성됩니다.