PDF para texto

Extrai o texto contido num PDF.

🔒 Este ficheiro é processado no teu navegador. Nunca é enviado para um servidor.

Para que serve

Extrair o texto de um PDF devolve-te o conteúdo em texto simples, pronto a copiar, pesquisar, traduzir ou reutilizar. Evita o trabalho manual de ir selecionando por páginas, que em documentos longos é lento e costuma arrastar quebras de linha estranhas.

Convém perceber a diferença entre os dois tipos de PDF que existem. Os gerados a partir de um processador de texto levam o texto lá dentro como tal, e daí extrai-se perfeitamente. Os que vêm de um digitalizador são na verdade fotografias de papel: para os ler seria preciso reconhecimento ótico de carateres, que esta ferramenta não inclui.

A forma rápida de saber qual tens é abrir o PDF e tentar selecionar uma palavra com o rato. Se conseguires, a extração funciona. Se o cursor só desenha um retângulo, é uma digitalização.

Como funciona

  1. Carregue o PDF de onde quer copiar o texto.
  2. Clique em "Processar": a ferramenta percorre todas as páginas e extrai o texto que contêm.
  3. Copie o resultado diretamente da caixa de texto que aparece.

Quando usar

Reutilizar conteúdo

Recuperar o texto de um relatório antigo para o atualizar poupa voltar a escrevê-lo.

Traduzir um documento

Os tradutores automáticos funcionam melhor com texto simples do que com um PDF paginado.

Pesquisar e analisar

Ter o texto solto permite procurar termos, contar menções ou passá-lo para uma folha de cálculo.

Conselhos práticos

  • O resultado é texto simples: perdem-se negritos, colunas e tabelas. Conserva a ordem de leitura, mas não o aspeto.
  • Em documentos a duas colunas a ordem pode sair misturada, porque depende de como o PDF foi gerado.
  • Se o PDF estiver protegido contra cópia, é provável que a extração não devolva nada.
  • Com uma digitalização não obténs texto. Precisas de OCR, que aqui não está disponível.

Perguntas frequentes

Funciona com PDF digitalizados (imagens)?

Não. Esta ferramenta extrai texto real incorporado no PDF; se o documento for uma digitalização sem camada de texto, precisaria de OCR, que aqui não está disponível.

A formatação do documento original mantém-se?

Não, o resultado é texto simples sem negritos, tabelas nem colunas: conserva a ordem de leitura, mas não o aspeto visual.

Ferramentas relacionadas