Extração de Texto de PDF: Guia Técnico para Copiar Texto de PDF
Este artigo explica os princípios da extração de texto de PDF, processa documentos PDF com não mais de 200 páginas e ajuda a resolver o problema de formatação desorganizada ao copiar texto de PDF.
Atualizado 2026-08-11
Arquitetura Separada da Camada de Texto do PDF e Renderização Visual
O PDF adota uma arquitetura de armazenamento que separa a camada de texto e a renderização visual. A camada de texto armazena a codificação de caracteres e as informações de coordenadas, enquanto a renderização visual é responsável por exibir os estilos de texto no ecrã.
Quando os utilizadores copiam texto de PDF, a maioria dos leitores de PDF emite o conteúdo por padrão na ordem de armazenamento da camada de texto. Esta ordem frequentemente difere da ordem de leitura visual do utilizador, o que leva a uma formatação desorganizada no resultado copiado.
StructuredText Reordena Texto por Blocos Visuais
A ferramenta de extração de texto de PDF do OKfmt utiliza o algoritmo StructuredText. Primeiro analisa a camada de texto do PDF para obter as coordenadas e informações de caracteres de todo o texto, depois divide blocos visuais independentes com base nos intervalos de coordenadas.
O algoritmo classifica os blocos visuais divididos na ordem de cima para baixo, esquerda para a direita, depois junta o texto dentro de todos os blocos, e finalmente emite texto editável que está em conformidade com os hábitos de leitura dos utilizadores.
Comparação de Efeitos de Extração para Diferentes Tipos de PDF
PDF nativo e PDF digitalizado têm estruturas internas diferentes, o que leva a diferenças óbvias na capacidade de extração. Segue-se uma comparação específica dos dois tipos de PDF.
| Tipo de PDF | Descrição da capacidade de extração |
|---|---|
| PDF nativo | Contém uma camada de texto, e texto editável pode ser extraído através do algoritmo StructuredText |
| PDF digitalizado | Apenas contém conteúdo de mapa de bits, não tem camada de texto, e não pode extrair texto diretamente |
Casos de Uso Comuns e Limite de Processamento para Texto Extraído
O texto simples extraído pode ser usado em muitos cenários, incluindo pesquisa de texto completo do conteúdo de documentos, entrada de conteúdo para tradução em lote e edição e organização secundária do conteúdo original do PDF.
A ferramenta de extração de texto de PDF do OKfmt define atualmente o limite de processamento de arquivo único para 200 páginas. Arquivos que excedem este limite não podem ser processados, mas pode dividir o arquivo e processá-lo em lotes.
Perguntas frequentes
Por que o PDF digitalizado não consegue extrair texto diretamente?
O PDF digitalizado é um documento montado a partir de mapas de bits, e não contém uma camada de texto editável. Requer reconhecimento de texto através de OCR primeiro. A ferramenta atual não fornece serviços de OCR, pelo que a extração não é possível.
O texto extraído pode ser usado para tradução?
O texto extraído é texto editável simples, que pode ser copiado em lote para várias ferramentas de tradução como entrada de tradução. O limite de palavras específico está sujeito ao anúncio público atual no site oficial da ferramenta de tradução correspondente.
Como processar um PDF com mais de 200 páginas?
Pode primeiro usar um divisor de PDF para dividir o arquivo original em vários arquivos de não mais de 200 páginas, depois usar esta ferramenta para extrair texto de cada arquivo dividido separadamente.