Limpador de texto de PDF
Cole texto copiado de um PDF e obtenha na hora um texto limpo e legível. O limpador corrige hifenizações de fim de linha, parágrafos com quebras forçadas, espaços duplos, ligaduras (fi→fi, fl→fl) e artefatos Unicode invisíveis. Dez regras de limpeza configuráveis: ative as que combinam com o seu documento. Grátis, privado e sem cadastro.
Cleaning Rules
Por que o texto de um PDF sai tão sujo
Um PDF não guarda parágrafos nem frases: guarda glifos com coordenadas exatas na página. Ao copiar, o visualizador tenta reconstruir a ordem de leitura e, no processo, corta o texto no fim de cada linha visual e insere hífens para dividir palavras.
Daí os sintomas típicos: parágrafos picados em muitas linhas, palavras com hífen no meio, ligaduras tipográficas e espaços invisíveis que estragam as buscas.
As dez regras e para que servem
Cada regra é ativada separadamente, então você adapta a limpeza ao documento que tem em mãos.
- Reparar o hífen condicional e recolar palavras divididas.
- Unir linhas com quebra forçada para reconstruir parágrafos.
- Colapsar espaços duplos e remover espaços no fim da linha.
- Corrigir ligaduras (fi→fi, fl→fl) e endireitar aspas tipográficas.
- Normalizar marcadores, colapsar linhas em branco e substituir espaços não separáveis.
- Remover caracteres invisíveis e de largura zero que quebram buscas e comparações.
Privacidade: tudo acontece no seu navegador
A limpeza roda em JavaScript no seu dispositivo. Não há requisições de rede, nada é gravado e nenhum caractere vai para um servidor.
Você pode trabalhar com documentos confidenciais ou sem conexão: a ferramenta continua funcionando offline.
Perguntas frequentes
Ele remove os artefatos de formatação criados ao copiar texto de um PDF: hifenizações de fim de linha, parágrafos com quebras forçadas, espaços duplos, ligaduras e caracteres Unicode invisíveis. Processa seu texto na hora, no navegador, com dez regras configuráveis.
Os PDF armazenam o texto como glifos posicionados, não como prosa contínua. Ao copiar, o visualizador reconstrói a ordem de leitura pelas posições dos glifos, gerando quebras de linha em cada fim de linha visual, hifenizações e ligaduras.
Ligaduras são glifos combinados (fi, fl, ff, ffi, ffl) guardados como um único caractere Unicode nas fontes do PDF. Ao copiar, aparecem como caracteres isolados que ficam estranhos em texto simples. O limpador os substitui pelos equivalentes ASCII corretos.
Muitos PDFs quebram o texto numa largura de coluna fixa. Ao copiar, cada linha visual vira uma linha separada e quebra os parágrafos. Esta regra detecta as linhas quebradas e as une em parágrafos contínuos, preservando as separações por linha em branco.
Sim, totalmente. Toda a limpeza acontece localmente no seu navegador. Seu texto nunca sai do dispositivo nem é enviado a servidor algum.
Sim, 100% grátis. Sem cadastro, sem plano premium, sem limite de tamanho e sem teto de uso. Roda inteiramente no seu navegador.
Sim. Clique no botão de envio do painel de entrada para carregar um arquivo .txt com texto extraído de PDF. Você também pode baixar o resultado limpo como .txt.
A heurística preserva as linhas em branco e não une linhas terminadas em pontuação de fim de frase. Para textos com linhas curtas intencionais (poesia, código), desative a regra «unir linhas com quebra forçada».
São caracteres Unicode invisíveis que aparecem no texto de PDF e causam problemas em buscas, comparações e processamento de linguagem natural. O limpador remove os caracteres invisíveis e de largura zero mais comuns.