OKfmt

MP4/MKVからの埋め込み字幕抽出: 字幕ストリームとハードコード字幕の違いについてのガイド

本記事では、動画における埋め込みソフト字幕とハードコード字幕の違いを解説し、パッケージングされた字幕ストリームの抽出に対応し、SRTおよびVTT形式で出力する当該プロセスの技術原理と制限について説明します。

2026-08-11 更新

ソフト字幕ストリームとハードコード字幕の本質的な違い

ソフト字幕はパッケージングされた字幕ストリームとも呼ばれ、動画コンテナ内に独立したバイナリデータトラックとして保存されます。フレームのピクセルに結合されていないため、個別に再エンコード、切り替え、抽出を行うことが可能です。

ハードコード字幕はフレームのピクセルにレンダリングされて動画フレームに焼き付けられ、画像ピクセルと完全に融合しており、分離可能な個別の字幕データトラックとして存在しません。

一般的な埋め込み字幕には上記の2種類が存在します。リマックスによる抽出が可能なのは、独立してパッケージングされたソフト字幕ストリームのみです。

MKVとMP4における字幕コンテナの違い

オープンなマルチメディアコンテナであるMKVは、複数種類の複数字幕トラックをパッケージングすることをネイティブでサポートしています。埋め込み字幕を持つ動画の多くはMKV形式を使用しています。

MP4は標準のテキスト字幕保存形式としてmov_textを使用します。機器から生成された一部のMP4ファイルでは、非標準形式で字幕が保存されており、直接抽出できない場合があります。

コンテナ形式対応する字幕トラックの種類複数字幕トラックの対応
MKVSSA/ASS, SRT, VobSubを含む複数の種類複数の言語の複数字幕トラックのパッケージングに対応
MP4標準のmov_textテキストトラックのみ、画像字幕の対応は限定的単一のテキスト字幕トラックのみに対応

リマックスによる抽出の技術原理

本動画字幕抽出ツールはFFmpegの-c:s copyパラメータを使用して抽出を実行します。このパラメータでは字幕ストリームを再エンコードせず、元の字幕データを直接コピーしてターゲットファイルを生成します。

抽出プロセス全体ではパッケージングされた字幕データのみをコピーするため、動画全体をデコードして再エンコードする必要がありません。1GBの動画から字幕を抽出する場合でも数秒しかかかりません。

抽出プロセスでは元の動画ファイルを変更せず、過剰なプロセッサリソースを消費することもありません。ワークフローでは元の動画から字幕トラックのデータを読み取って新しいファイルを出力するのみです。

抽出ツールの利用範囲

本動画字幕抽出ツールはハードコード字幕に対するOCR認識に対応していません。ハードコード字幕の認識には専用のAIモデルの学習と計算リソースが必要であり、独立したOCRサービスの区分に属するため、本ツールではこの機能を提供していません。

アップロードされた動画が分離可能な独立した字幕ストリームを含まない場合、ツールは明確なエラーメッセージを返し、現在の動画から抽出可能な字幕トラックが検出されなかったことをユーザーに通知します。

抽出後、ユーザーは一般的な字幕形式であるSRTまたはVTTのいずれかで出力することを自由に選択でき、さまざまな再生および編集の要求に対応可能です。どちらの形式もオープンな公開規格です。

よくある質問

MP4の埋め込み字幕を抽出できないのはなぜですか

原因として2つの可能性があります。1つ目は字幕がフレームに焼き付けられたハードコードであり、独立して抽出可能な字幕ストリームが存在しない場合、2つ目はMP4の字幕トラックが非標準形式であり、ツールで認識できない場合です。詳細はツールが返す具体的なエラーメッセージを確認してください。

抽出された字幕がidx+sub形式なのはなぜですか

これは元の動画に画像ベースのVobSub字幕がパッケージングされているためです。この形式は本来画像字幕であるため、ツールは追加の形式変換を行わず元のデータを直接コピーして出力します。テキスト形式に変換する必要がある場合は、専用のOCRツールを使用して処理してください。料金は公式サイトの現在の公表に従います。

MKVから複数の字幕トラックを抽出できますか

本ツールはMKVにパッケージングされたすべての独立した字幕トラックを認識することに対応しています。抽出を行う指定の字幕トラックを選択可能です。各字幕トラックは個別に抽出する必要があり、操作ごとに対応する個別の字幕ファイルが生成されます。