OKfmt

Causa Raiz e Soluções para Codificação Corrompida de Legendas: Explicação das Codificações GBK/Big5/UTF-8

Este artigo analisa três causas comuns de codificação corrompida de legendas, fornece métodos de correção manual para VLC e PotPlayer, bem como uma solução permanente através da conversão para UTF-8, que pode resolver mais de 90% dos problemas de codificação corrompida de legendas em leitores de multimídia.

Atualizado 2026-08-11

Princípios Fundamentais da Codificação de Caracteres

Ao armazenar texto, os computadores armazenam apenas dados de bytes binários. A codificação é um conjunto de regras de mapeamento de bytes para caracteres específicos. Codificações diferentes correspondem a tabelas de mapeamento diferentes. Se um leitor selecionar a tabela de mapeamento errada ao ler uma legenda, não conseguirá corresponder aos caracteres corretos.

O sistema de codificação Unicode integra a maioria dos caracteres escritos do mundo. UTF-8 é uma implementação de armazenamento de comprimento variável do Unicode, e é o padrão atual de codificação de texto geral para a Internet. A maioria dos arquivos de legenda criados recentemente em todo o mundo são armazenados por padrão com codificação UTF-8.

Origens Históricas das Codificações Regionais

GBK é uma codificação estendida chinesa desenvolvida pela China continental, lançada em 1995. Contém mais de 21.000 caracteres chineses, e foi criada para resolver a capacidade insuficiente de caracteres da codificação inicial GB2312. As legendas de filmes e televisão domésticas antigas eram geralmente armazenadas em codificação GBK.

Big5 é uma codificação de chinês tradicional comumente usada em Taiwan, China. Shift_JIS é uma codificação regional japonesa geral para o Japão. Todas essas codificações foram criadas antes da formação de padrões unificados da Internet, e resolveram o problema de que a codificação de byte único só pode armazenar 256 caracteres, o que não pode se adaptar ao grande conjunto de caracteres do Leste Asiático.

Tipo de CodificaçãoRegião AplicávelAno de LançamentoCapacidade de Caracteres
GBKChina continental1995Aproximadamente 21.000 caracteres chineses
Big5Taiwan, China1984Aproximadamente 13.000 caracteres chineses
Shift_JISJapão1982Inclui Kanji e Kana japoneses comuns
UTF-8Global1993Cobre a maioria dos caracteres escritos do mundo

Formas Típicas e Causas de Três Tipos de Codificação Corrompida de Legendas

A primeira forma são caracteres de quadrado em branco completos. Isto ocorre quando a tabela de caracteres da codificação alvo não tem uma entrada correspondente ao byte atual. O leitor não consegue renderizar o caractere, e só pode exibir um quadrado em branco como marcador de posição.

A segunda forma é codificação corrompida com pontos de interrogação completos. Isto é causado pela deteção incorreta de informações de byte no arquivo de legenda. O leitor reconhece caracteres asiáticos orientais de vários bytes como caracteres ASCII de byte único, e cada caractere é substituído por um marcador de ponto de interrogação.

A terceira forma é caracteres chineses corrompidos como "锟斤拷". Isto é causado pela sobreposição de tabelas de mapeamento de codificações diferentes. Depois que o leitor analisa os bytes com a codificação errada, acaba por corresponder a outro caractere chinês não relacionado, gerando eventualmente texto completamente ilegível.

Correção por Troca Manual de Codificação em Leitores de Multimídia

O caminho para trocar a codificação de legendas no VLC é: clique no menu Ferramentas superior na interface de reprodução, selecione Preferências, clique na opção Legendas/OSD, selecione manualmente a codificação correspondente no módulo Codificação de Texto, e reinicie o leitor para que a alteração entre em vigor.

O caminho para trocar a codificação de legendas no PotPlayer é: clique com o botão direito na interface de reprodução, selecione a opção Legenda, encontre a opção Codificação de legenda, selecione a codificação regional correspondente na lista expandida. A alteração entra em vigor imediatamente, e não é necessário reiniciar o leitor.

Solução Permanente: Converter para UTF-8

A troca manual de codificação só entra em vigor para uma única reprodução. Depois de alterar dispositivos ou leitores, o problema de codificação corrompida irá reaparecer. Re-codificar os arquivos de legenda existentes para UTF-8 pode resolver os problemas de codificação corrompida em todos os leitores que suportam codificação padrão.

Pode usar o conversor de codificação de texto do OKfmt. Depois de carregar o seu arquivo de legenda original, selecione a codificação de origem e defina UTF-8 como codificação alvo, e obterá um novo arquivo de legenda com codificação de uso geral. A legenda convertida pode ser exibida normalmente em todos os leitores de multimídia mainstream.

Ferramentas relacionadas

Perguntas frequentes

Por que é que as legendas descarregadas de filmes antigos ficam sempre com codificação corrompida?

As legendas de filmes antigos foram criadas maioritariamente por volta do ano 2000. Naquela época, não existia um padrão de codificação unificado na Internet, e os criadores domésticos geralmente usavam codificação GBK para armazenamento. A maioria dos leitores atuais detetam codificação UTF-8 por padrão, o que leva à codificação corrompida.

Que codificação devo selecionar para legendas em chinês tradicional com codificação corrompida?

Legendas em chinês tradicional criadas em Taiwan, China geralmente usam codificação Big5. Algumas legendas em chinês tradicional de Hong Kong, China também usam codificação Big5. Trocar manualmente para a codificação Big5 permitirá a exibição normal.

As legendas UTF-8 ocupam mais espaço de armazenamento do que a codificação original?

Para legendas em chinês, cada caractere chinês ocupa 3 bytes em UTF-8, e 2 bytes em GBK. Uma legenda UTF-8 com o mesmo conteúdo será 50% maior do que uma legenda GBK. Para um único arquivo de legenda, este aumento de volume não tem impacto óbvio na reprodução.