Nettoyeur de texte PDF
Collez du texte copié depuis un PDF et obtenez instantanément un texte propre et lisible. Le nettoyeur corrige les césures, les paragraphes à retours forcés, les doubles espaces, les ligatures (fi→fi, fl→fl) et les artefacts Unicode invisibles. Dix règles de nettoyage configurables : activez celles adaptées à votre document. Gratuit, privé et sans inscription.
Cleaning Rules
Pourquoi le texte d'un PDF ressort si sale
Un PDF ne stocke pas de paragraphes ni de phrases : il stocke des glyphes avec des coordonnées précises sur la page. À la copie, la visionneuse tente de reconstruire l'ordre de lecture et, ce faisant, coupe le texte à chaque fin de ligne visuelle et insère des traits d'union.
D'où les symptômes habituels : paragraphes découpés en de nombreuses lignes, mots coupés en deux, ligatures typographiques et espaces invisibles qui ruinent les recherches.
Les dix règles et à quoi elles servent
Chaque règle s'active séparément : vous adaptez donc le nettoyage au document que vous avez sous les yeux.
- Réparer le trait d'union conditionnel et recoller les mots coupés.
- Joindre les lignes à retour forcé pour reconstruire les paragraphes.
- Fusionner les doubles espaces et supprimer les espaces de fin de ligne.
- Corriger les ligatures (fi→fi, fl→fl) et redresser les guillemets typographiques.
- Normaliser les puces, fusionner les lignes vides et remplacer les espaces insécables.
- Supprimer les caractères invisibles et de largeur nulle qui cassent recherches et comparaisons.
Confidentialité : tout se passe dans votre navigateur
Le nettoyage s'exécute en JavaScript sur votre appareil. Aucune requête réseau n'est envoyée, rien n'est enregistré et aucun caractère ne part vers un serveur.
Vous pouvez traiter des documents confidentiels ou hors connexion : l'outil fonctionne même sans réseau.
Foire aux questions
Il supprime les artefacts de mise en forme créés lors de la copie de texte depuis un PDF : césures, paragraphes à retours forcés, doubles espaces, ligatures et caractères Unicode invisibles. Il traite votre texte instantanément dans le navigateur avec dix règles configurables.
Les PDF stockent le texte sous forme de glyphes positionnés, et non de prose fluide. À la copie, la visionneuse reconstruit l'ordre de lecture à partir des positions des glyphes, ce qui produit des retours à la ligne à chaque fin de ligne visuelle, des césures et des ligatures.
Les ligatures sont des glyphes combinés (fi, fl, ff, ffi, ffl) stockés comme un seul caractère Unicode dans les polices PDF. Copiées, elles apparaissent comme des caractères isolés qui rendent mal en texte brut. Le nettoyeur les remplace par leurs équivalents ASCII corrects.
De nombreux PDF forcent le texte à une largeur de colonne fixe. À la copie, chaque ligne visuelle devient une ligne distincte et casse les paragraphes. Cette règle détecte les lignes forcées et les réunit en paragraphes continus, en préservant les séparations par ligne vide.
Oui, totalement. Tout le nettoyage se fait localement dans votre navigateur. Votre texte ne quitte jamais votre appareil et n'est jamais envoyé à un serveur.
Oui, 100 % gratuit. Sans inscription, sans offre premium, sans limite de taille et sans plafond d'usage. Il s'exécute entièrement dans votre navigateur.
Oui. Cliquez sur le bouton d'envoi du panneau d'entrée pour charger un fichier .txt de texte extrait d'un PDF. Vous pouvez aussi télécharger le résultat nettoyé en .txt.
L'heuristique préserve les lignes vides et ne joint pas les lignes terminées par une ponctuation de fin de phrase. Pour les textes à lignes courtes volontaires (poésie, code), désactivez la règle « joindre les lignes à retour forcé ».
Ce sont des caractères Unicode invisibles présents dans le texte des PDF, qui perturbent la recherche, la comparaison et le traitement automatique du langage. Le nettoyeur supprime les caractères invisibles et de largeur nulle les plus courants.