Aller au contenu
Aback Tools Logo

Recherche de fichiers quasi-dupliqués

Téléchargez plusieurs fichiers pour rechercher des quasi-doublons à l'aide de notre outil de recherche de fichiers quasi-doublons en ligne gratuit. L'outil utilise un algorithme de hachage flou inspiré de ssdeep (Context Triggered Piecewise Hashing) pour identifier les fichiers similaires mais non identiques. Les fichiers sont divisés en morceaux basés sur le contenu à l'aide d'un hachage roulant, chaque morceau est haché avec SHA-256 et les signatures résultantes sont comparées sur toutes les paires de fichiers pour calculer des scores de similarité de 0 % à 100 %. Tout le traitement est entièrement effectué dans votre navigateur – aucun téléchargement, aucune inscription requise.

Near-Duplicate File Finder

Upload two or more files to find near-duplicates using fuzzy hashing. The tool analyzes file content using a context-triggered piecewise hashing algorithm (similar to ssdeep) to detect files that are similar but not identical. All processing happens locally in your browser.

Drop files here or click to browse

Upload at least 2 files (any type, any size) - all processing is local

Minimum 2 files required for comparison. Select multiple files to find which ones are similar, near-duplicate, or identical.
How Fuzzy Hashing Works

The near-duplicate file finder uses a fuzzy hashing algorithm inspired by ssdeep(Context Triggered Piecewise Hashing). Each file is divided into content-based chunks using a rolling hash - the chunk boundaries are determined by the file content itself, not by fixed positions. Each chunk is then hashed using SHA-256, creating a signature that captures the file's structure. Files are compared by computing exact chunk matches, longest common subsequence of chunks, and size ratio to produce a similarity score from 0% to 100%. This approach can detect files that have been partially edited, reformatted, or had metadata changes while still recognizing them as near-duplicates.

Pourquoi utiliser notre outil de recherche de fichiers quasi-doublons ?

  • Algorithme de hachage flou : détecte les fichiers quasi-dupliqués à l'aide d'un algorithme de hachage par morceaux (CTPH) déclenché par le contexte et inspiré de ssdeep. Contrairement à la comparaison de hachage exacte (SHA-256/MD5), notre hachage flou divise les fichiers en morceaux basés sur le contenu à l'aide d'un hachage roulant et compare les signatures de morceaux pour trouver des fichiers similaires même lorsque des métadonnées, un formatage ou des modifications mineures ont été appliqués. Cela permet de détecter des fichiers similaires mais non identiques.
  • Comparaison par lots multi-fichiers : téléchargez simultanément plusieurs fichiers de tout type pour une détection par lots de quasi-doublons. L'outil compare automatiquement chaque paire unique de fichiers, calculant les scores de similarité pour toutes les combinaisons. Les résultats sont organisés par catégorie de similarité (identique, quasi-duplicata, similaire, quelque peu similaire) avec des barres de progression visuelles indiquant le pourcentage exact de similarité pour chaque paire.
  • Score de similarité complet : chaque paire de fichiers reçoit un score de similarité de 0 % à 100 % basé sur une combinaison pondérée de trois mesures : le taux de correspondance exact des fragments (blocs de contenu identiques), la sous-séquence commune la plus longue de fragments (chevauchement de structure ordonné) et le rapport de taille de fichier (similitude de taille globale). Cette approche multimétrique permet une détection précise des quasi-doublons sur divers types de fichiers.
  • Traitement 100 % privé basé sur un navigateur : tout le traitement des fichiers s'effectue entièrement dans votre navigateur à l'aide de l'API Web Crypto pour le hachage SHA-256. Les fichiers sont lus localement et ne sont jamais téléchargés sur un serveur. Vos données restent totalement privées sur votre appareil. Aucune inscription, aucun compte, aucune collecte de données, aucune limite d'utilisation - entièrement gratuit et privé.

Cas d'utilisation courants de l'outil de recherche de fichiers quasi-dupliqués

  • Optimisation et nettoyage du stockage : identifiez les fichiers en double ou quasi-dupliqués qui encombrent votre stockage. Notre outil de recherche de fichiers quasi-dupliqués aide les administrateurs système et les utilisateurs à trouver des documents, des images et des sauvegardes similaires qui peuvent être consolidés pour libérer de l'espace disque précieux. Détectez les fichiers presque identiques, à l'exception de différences mineures de métadonnées, de modifications de version ou de modifications de formatage sur vos systèmes de stockage.
  • Déduplication de la bibliothèque de photos : recherchez des photos quasi-dupliquées dans votre bibliothèque d'images sur lesquelles de légères modifications, recadrages, filtres ou redimensionnements ont été appliqués. Les photographes et les utilisateurs occasionnels peuvent utiliser notre outil pour identifier les images similaires qui peuvent avoir été enregistrées dans plusieurs versions, aidant ainsi à organiser et à nettoyer les collections de photos en regroupant des photos presque en double.
  • Analyse de similarité de base de code : détectez les fichiers de code dupliqués ou quasi-dupliqués dans vos projets. Les développeurs peuvent identifier les fichiers qui partagent un code important avec des modifications mineures, aidant ainsi à refactoriser, fusionner ou dédupliquer les bases de code. Utile pour auditer de grands référentiels, détecter le code copié et maintenir une architecture de code propre.
  • Gestion des versions de documents : suivez les versions de documents et identifiez les révisions quasi-dupliquées dans votre système de gestion de documents. Au lieu de comparer manuellement chaque paire de documents, notre outil trouve automatiquement les documents similaires mais non identiques, permettant ainsi d'identifier la dernière version, de détecter les modifications non autorisées et de gérer plus efficacement les cycles de vie des documents.
  • Nettoyage des sauvegardes et des archives : nettoyez les archives de sauvegarde en identifiant les fichiers quasi-dupliqués créés lors de différentes exécutions de sauvegarde. Les administrateurs système peuvent trouver des fichiers presque identiques dans les sauvegardes, ce qui contribue à réduire les besoins de stockage des sauvegardes et à optimiser les stratégies d'archivage en consolidant les données quasi-dupliquées.
  • Forensique numérique et analyse des preuves : les enquêteurs médico-légaux peuvent utiliser la détection des quasi-doublons pour trouver des fichiers associés dans les collections de preuves. Identifiez les documents qui ont été modifiés, renommés ou réenregistrés avec des modifications. Notre outil aide les professionnels de la criminalistique numérique à identifier rapidement les fichiers liés les uns aux autres, même lorsque les noms de fichiers, les métadonnées ou le contenu spécifique ont été modifiés.

Qu'est-ce que la détection des fichiers quasi-dupliqués ?

La détection de fichiers quasi-dupliqués est le processus de recherche de fichiers similaires mais non identiques - contrairement à la détection exacte des doublons qui ne trouve que les fichiers ayant un contenu identique. Les quasi-doublons partagent un contenu important mais peuvent différer en termes de métadonnées, de formatage, de compression, de modifications ou de réencodage. Notre outil utilise un algorithme de hachage flou inspiré de ssdeep (Context Triggered Piecewise Hashing ou CTPH) qui divise les fichiers en morceaux basés sur le contenu et compare leurs signatures de morceaux pour calculer un score de similarité. Cette approche détecte les fichiers qui ne manqueraient pas par une comparaison de hachage exacte, ce qui la rend idéale pour rechercher des documents associés, des images similaires, des fichiers versionnés et des copies modifiées.

Comment fonctionne notre algorithme de hachage flou

  1. Chunking basé sur le contenu : le fichier est lu sous forme d'octets et un hachage roulant (similaire à Adler-32) parcourt les données. Lorsque la valeur de hachage correspond à un modèle de déclenchement spécifique, une limite de bloc est créée. Cela signifie que les morceaux s'alignent sur la structure naturelle du contenu du fichier plutôt que sur des positions fixes, ce qui rend l'algorithme robuste contre les insertions et les suppressions.
  2. Hachage de fragments : chaque fragment de contenu est haché à l'aide de SHA-256 via l'API Web Crypto. Les signatures de hachage résultantes capturent le contenu de chaque morceau. Des morceaux identiques dans différents fichiers produisent des hachages identiques, permettant à l'algorithme de détecter le contenu partagé même lorsque les fichiers diffèrent dans d'autres parties.
  3. Calcul de similarité : les fichiers sont comparés en calculant trois métriques : le taux de correspondance exact des morceaux (combien de morceaux ont des hachages identiques), la sous-séquence commune la plus longue de morceaux (dans quelle mesure l'ordre des morceaux est préservé) et le rapport de taille de fichier. Ceux-ci sont pondérés et combinés dans un score de similarité final allant de 0 % à 100 %.
  4. Comparaison par lots : lorsque plusieurs fichiers sont téléchargés, chaque paire unique est automatiquement comparée. Les résultats sont triés par similarité décroissante et classés en cinq niveaux : identique, quasi-dupliqué, similaire, quelque peu similaire et différent.

Qu’est-ce qui fait qu’un fichier est quasi-dupliqué ?

  • Modifications des métadonnées : les fichiers avec le même contenu mais des métadonnées différentes (données EXIF ​​dans les images, propriétés du document, horodatages des fichiers) sont détectés comme des quasi-doublons puisque les morceaux de contenu restent en grande partie les mêmes.
  • Différences de formatage : les documents reformatés avec des polices, un espacement ou une mise en page différents partageront toujours la plupart des morceaux de contenu, ce qui les rendra détectables comme des quasi-doublons, même lorsque l'apparence visuelle diffère.
  • Modifications mineures : les fichiers comportant de petits ajouts, suppressions ou modifications (comme des paragraphes mis à jour, des fautes de frappe corrigées ou des commentaires ajoutés) partageront la majorité des morceaux de contenu inchangés, ce qui entraînera des scores de similarité élevés.
  • Réencodage/Recompression : les images réenregistrées à différents niveaux de qualité ou les fichiers recompressés avec différents paramètres partageront la structure de contenu sous-jacente, bien que les limites des morceaux puissent changer, ce qui entraînera des scores de similarité modérés à élevés.

Confidentialité, sécurité et limites

Notre outil de recherche de fichiers quasi-doublons traite tout localement dans votre navigateur. Les fichiers sont lus à l'aide de l'API FileReader et hachés à l'aide de l'API Web Crypto. Aucune donnée n'est jamais téléchargée sur un serveur - vos fichiers restent totalement privés sur votre appareil. L'outil est 100 % gratuit, sans inscription, sans compte et sans limite d'utilisation.

Limitations importantes : l'algorithme est conçu pour la détection de similarité basée sur le contenu. Les fichiers sémantiquement similaires mais dont le contenu binaire est complètement différent (par exemple, le même texte enregistré au format PDF ou DOCX) ne seront pas détectés comme des quasi-doublons. Les très petits fichiers (moins de 64 octets) peuvent produire des morceaux insuffisants pour une comparaison significative. Le temps de traitement augmente avec le nombre de fichiers puisque chaque paire doit être comparée. Pour les ensembles très volumineux (plus de 50 fichiers), envisagez de traiter par lots plus petits.

Foire aux questions

Le hachage régulier (SHA-256, MD5) produit des valeurs de hachage complètement différentes si même un seul octet est modifié, ce qui le rend utile pour la détection exacte des doublons mais inutile pour rechercher des fichiers similaires. Le hachage flou divise les fichiers en morceaux basés sur le contenu et crée une signature qui capture la structure du fichier. Les fichiers partageant un contenu similaire produisent des signatures de hachage floues similaires, même avec des différences mineures. Notre algorithme est inspiré de ssdeep (Context Triggered Piecewise Hashing).

Il n’y a pas de limite stricte sur les téléchargements. Cependant, puisque chaque paire unique est comparée, 10 fichiers produisent 45 paires, 20 fichiers produisent 190 paires et 50 fichiers produisent 1 225 paires. Pour de meilleures performances, nous vous recommandons de traiter les fichiers par lots de 10 à 30 à la fois. Tout le traitement est local, les performances dépendent donc du processeur et de la mémoire de votre appareil.

Tous les types de fichiers sont pris en charge : documents, images, audio, vidéo, code source, archives et tout autre format. L'algorithme fonctionne sur des octets bruts et n'a pas besoin de comprendre le format de fichier. Cependant, un contenu sémantiquement similaire stocké dans des formats complètement différents (par exemple, le même texte au format PDF ou DOCX) ne sera pas détecté comme quasi-doublon en raison de structures binaires très différentes.

Absolument. Tout le traitement des fichiers s'effectue entièrement dans votre navigateur à l'aide de l'API FileReader et de l'API Web Crypto. Aucune donnée n'est jamais téléchargée sur un serveur. Vos fichiers et leur contenu restent totalement privés sur votre appareil. Pas d'inscription, pas de compte, pas de collecte de données.

Les scores vont de 0 % (complètement différent) à 100 % (identique). 95 à 100 % signifie des fichiers identiques ou presque identiques. 75 à 95 % indiquent des quasi-doublons avec des changements mineurs. 50 à 75 % montrent des fichiers partageant un contenu important mais avec des différences notables. 25 à 50 % indique un contenu partagé, et moins de 25 % signifie aucune similitude significative.

Oui! Puisque notre algorithme analyse le contenu des fichiers plutôt que les noms de fichiers, un fichier renommé sera détecté comme identique (similarité à 100 %) à l'original tant que le contenu n'a pas changé. Cela rend l'outil idéal pour rechercher des fichiers qui ont été copiés, renommés ou déplacés.

Les outils de recherche de fichiers en double réguliers comparent les fichiers à l'aide d'algorithmes de hachage exacts et ne trouvent que des fichiers identiques bit par bit. Notre outil de recherche de fichiers quasi-dupliqués utilise le hachage flou pour rechercher des fichiers similaires mais non identiques : fichiers avec des modifications de métadonnées, des différences de formatage, des modifications mineures ou des niveaux de compression différents. Les chercheurs de doublons réguliers manqueraient tous ces éléments.

Oui! 100 % gratuit, sans inscription, sans compte, sans clé API et sans limite d'utilisation. Comparez autant de fichiers que nécessaire - entièrement gratuitement, pour toujours. Tout le traitement s'effectue dans votre navigateur sans frais de serveur.