Saltar al contenido
Aback Tools Logo

Buscador de archivos casi duplicados

Cargue varios archivos para encontrar casi duplicados utilizando nuestro Buscador de archivos casi duplicados en línea gratuito. La herramienta utiliza un algoritmo de hash difuso inspirado en ssdeep (Context Triggered Piecewise Hashing) para identificar archivos que son similares pero no idénticos. Los archivos se dividen en fragmentos basados ​​en contenido mediante un hash continuo, cada fragmento se procesa con SHA-256 y las firmas resultantes se comparan en todos los pares de archivos para calcular puntuaciones de similitud del 0% al 100%. Todo el procesamiento se realiza íntegramente en su navegador: no es necesario realizar cargas ni registrarse.

Near-Duplicate File Finder

Upload two or more files to find near-duplicates using fuzzy hashing. The tool analyzes file content using a context-triggered piecewise hashing algorithm (similar to ssdeep) to detect files that are similar but not identical. All processing happens locally in your browser.

Drop files here or click to browse

Upload at least 2 files (any type, any size) - all processing is local

Minimum 2 files required for comparison. Select multiple files to find which ones are similar, near-duplicate, or identical.
How Fuzzy Hashing Works

The near-duplicate file finder uses a fuzzy hashing algorithm inspired by ssdeep(Context Triggered Piecewise Hashing). Each file is divided into content-based chunks using a rolling hash - the chunk boundaries are determined by the file content itself, not by fixed positions. Each chunk is then hashed using SHA-256, creating a signature that captures the file's structure. Files are compared by computing exact chunk matches, longest common subsequence of chunks, and size ratio to produce a similarity score from 0% to 100%. This approach can detect files that have been partially edited, reformatted, or had metadata changes while still recognizing them as near-duplicates.

¿Por qué utilizar nuestro buscador de archivos casi duplicados?

  • Algoritmo de hash difuso: detecta archivos casi duplicados utilizando un algoritmo de hash por partes (CTPH) activado por contexto inspirado en ssdeep. A diferencia de la comparación de hash exacta (SHA-256/MD5), nuestro hash difuso divide los archivos en fragmentos basados ​​en el contenido mediante un hash continuo y compara firmas de fragmentos para encontrar archivos similares incluso cuando se han aplicado metadatos, formato o ediciones menores. Esto permite la detección de archivos que son similares pero no idénticos.
  • Comparación de lotes de varios archivos: cargue varios archivos de cualquier tipo simultáneamente para la detección de lotes casi duplicados. La herramienta compara automáticamente cada par único de archivos y calcula puntuaciones de similitud para todas las combinaciones. Los resultados están organizados por categoría de similitud (Idéntico, Casi duplicado, Similar, Algo similar) con barras de progreso visual que muestran el porcentaje de similitud exacto para cada par.
  • Puntuación de similitud integral: cada par de archivos recibe una puntuación de similitud del 0% al 100% basada en una combinación ponderada de tres métricas: relación de coincidencia exacta de fragmentos (bloques de contenido idénticos), subsecuencia común más larga de fragmentos (superposición de estructura ordenada) y relación de tamaño de archivo (similitud de tamaño general). Este enfoque multimétrico proporciona una detección precisa de casi duplicados en diversos tipos de archivos.
  • Procesamiento 100% privado basado en navegador: todo el procesamiento de archivos se realiza completamente en su navegador utilizando Web Crypto API para hash SHA-256. Los archivos se leen localmente y nunca se cargan en ningún servidor. Sus datos permanecen completamente privados en su dispositivo. Sin registro, sin cuenta, sin recopilación de datos, sin límites de uso: completamente gratis y privado.

Casos de uso comunes para el buscador de archivos casi duplicados

  • Optimización y limpieza del almacenamiento: identifique archivos duplicados y casi duplicados que saturan su almacenamiento. Nuestro buscador de archivos casi duplicados ayuda a los administradores y usuarios del sistema a encontrar documentos, imágenes y copias de seguridad similares que se pueden consolidar para liberar valioso espacio en disco. Detecte archivos que sean casi idénticos excepto por diferencias menores de metadatos, cambios de versión o cambios de formato en sus sistemas de almacenamiento.
  • Deduplicación de la biblioteca de fotos: encuentre fotos casi duplicadas en su biblioteca de imágenes donde se hayan aplicado ligeras ediciones, recortes, filtros o cambios de tamaño. Tanto los fotógrafos como los usuarios ocasionales pueden utilizar nuestra herramienta para identificar imágenes similares que pueden haberse guardado en varias versiones, lo que ayuda a organizar y limpiar colecciones de fotografías agrupando tomas casi duplicadas.
  • Análisis de similitud de base de código: detecte archivos de código duplicados o casi duplicados en sus proyectos. Los desarrolladores pueden identificar archivos que comparten código importante con modificaciones menores, lo que ayuda a refactorizar, fusionar o deduplicar bases de código. Útil para auditar repositorios grandes, detectar código copiado y mantener una arquitectura de código limpia.
  • Gestión de versiones de documentos: realice un seguimiento de las versiones de documentos e identifique revisiones casi duplicadas en su sistema de gestión de documentos. En lugar de comparar cada par de documentos manualmente, nuestra herramienta encuentra automáticamente documentos que son similares pero no idénticos, lo que ayuda a identificar la última versión, detectar modificaciones no autorizadas y administrar los ciclos de vida de los documentos de manera más eficiente.
  • Limpieza de respaldo y archivos: limpie los archivos de respaldo identificando archivos casi duplicados que se crearon en diferentes ejecuciones de respaldo. Los administradores de sistemas pueden encontrar archivos que son casi idénticos en todas las copias de seguridad, lo que ayuda a reducir los requisitos de almacenamiento de las copias de seguridad y optimizar las estrategias de archivo al consolidar datos casi duplicados.
  • Análisis forense y de pruebas digitales: los investigadores forenses pueden utilizar la detección casi duplicada para encontrar archivos relacionados en las colecciones de pruebas. Identifique documentos que han sido alterados, renombrados o guardados nuevamente con modificaciones. Nuestra herramienta ayuda a los profesionales de la ciencia forense digital a identificar rápidamente archivos relacionados entre sí, incluso cuando se han cambiado los nombres de los archivos, los metadatos o el contenido específico.

¿Qué es la detección de archivos casi duplicados?

La detección de archivos casi duplicados es el proceso de encontrar archivos que son similares pero no idénticos, a diferencia de la detección exacta de duplicados que solo encuentra archivos con contenido idéntico. Los casi duplicados comparten contenido importante, pero pueden diferir en metadatos, formato, compresión, ediciones o recodificación. Nuestra herramienta utiliza un algoritmo de hash difuso inspirado en ssdeep (Context Triggered Piecewise Hashing o CTPH) que divide archivos en fragmentos basados ​​en contenido y compara sus firmas de fragmentos para calcular una puntuación de similitud. Este enfoque detecta archivos que la comparación hash exacta pasaría por alto, lo que lo hace ideal para buscar documentos relacionados, imágenes similares, archivos versionados y copias modificadas.

Cómo funciona nuestro algoritmo de hash difuso

  1. Fragmentación basada en contenido: el archivo se lee como bytes y un hash continuo (similar a Adler-32) se desliza a través de los datos. Cuando el valor hash coincide con un patrón de activación específico, se crea un límite de fragmento. Esto significa que los fragmentos se alinean con la estructura de contenido natural del archivo en lugar de con posiciones fijas, lo que hace que el algoritmo sea robusto frente a inserciones y eliminaciones.
  2. Hashing de fragmentos: cada fragmento de contenido se procesa utilizando SHA-256 a través de Web Crypto API. Las firmas hash resultantes capturan el contenido de cada fragmento. Fragmentos idénticos en diferentes archivos producen hashes idénticos, lo que permite que el algoritmo detecte contenido compartido incluso cuando los archivos difieren en otras partes.
  3. Cálculo de similitud: los archivos se comparan calculando tres métricas: proporción exacta de coincidencia de fragmentos (cuántos fragmentos tienen hashes idénticos), subsecuencia común más larga de fragmentos (cuánto del orden de los fragmentos se conserva) y relación de tamaño de archivo. Estos se ponderan y combinan en una puntuación de similitud final del 0% al 100%.
  4. Comparación por lotes: cuando se cargan varios archivos, cada par único se compara automáticamente. Los resultados se ordenan de forma descendente por similitud y se clasifican en cinco niveles: idénticos, casi duplicados, similares, algo similares y diferentes.

¿Qué hace que un archivo esté casi duplicado?

  • Cambios de metadatos: los archivos con el mismo contenido pero diferentes metadatos (datos EXIF ​​en imágenes, propiedades de documentos, marcas de tiempo de archivos) se detectan como casi duplicados, ya que los fragmentos de contenido siguen siendo en gran medida los mismos.
  • Diferencias de formato: los documentos reformateados con diferentes fuentes, espacios o diseños seguirán compartiendo la mayoría de los fragmentos de contenido, lo que los hará detectables como casi duplicados incluso cuando la apariencia visual difiera.
  • Ediciones menores: los archivos con pequeñas adiciones, eliminaciones o modificaciones (como párrafos actualizados, errores tipográficos corregidos o comentarios agregados) compartirán la mayoría de los fragmentos de contenido sin cambios, lo que generará puntuaciones de similitud altas.
  • Recodificación/recompresión: las imágenes guardadas nuevamente con diferentes niveles de calidad o los archivos recomprimidos con diferentes configuraciones compartirán la estructura de contenido subyacente, aunque los límites de los fragmentos pueden cambiar, lo que resultará en puntuaciones de similitud de moderadas a altas.

Privacidad, seguridad y limitaciones

Nuestro Buscador de archivos casi duplicados procesa todo localmente en su navegador. Los archivos se leen mediante la API FileReader y se procesan mediante la API Web Crypto. Nunca se cargan datos en ningún servidor: sus archivos permanecen completamente privados en su dispositivo. La herramienta es 100% gratuita, sin registro, sin cuenta y sin límites de uso.

Limitaciones importantes: el algoritmo está diseñado para la detección de similitudes basada en contenido. Los archivos que son semánticamente similares pero que tienen contenido binario completamente diferente (por ejemplo, el mismo texto guardado en formato PDF versus DOCX) no se detectarán como casi duplicados. Los archivos muy pequeños (menos de 64 bytes) pueden producir fragmentos insuficientes para una comparación significativa. El tiempo de procesamiento aumenta con la cantidad de archivos, ya que se debe comparar cada par. Para conjuntos muy grandes (más de 50 archivos), considere procesar en lotes más pequeños.

Preguntas frecuentes

El hash regular (SHA-256, MD5) produce valores hash completamente diferentes si cambia incluso un solo byte, lo que lo hace útil para la detección exacta de duplicados pero inútil para encontrar archivos similares. El hashing difuso divide los archivos en fragmentos basados ​​en el contenido y crea una firma que captura la estructura del archivo. Los archivos que comparten contenido similar producen firmas hash difusas similares incluso con diferencias menores. Nuestro algoritmo está inspirado en ssdeep (Context Triggered Piecewise Hashing).

No hay un límite estricto para las cargas. Sin embargo, dado que se compara cada par único, 10 archivos producen 45 pares, 20 archivos producen 190 pares y 50 archivos producen 1225 pares. Para obtener el mejor rendimiento, recomendamos procesar archivos en lotes de 10 a 30 a la vez. Todo el procesamiento es local, por lo que el rendimiento depende de la CPU y la memoria de su dispositivo.

Se admiten todos los tipos de archivos: documentos, imágenes, audio, vídeo, código fuente, archivos y cualquier otro formato. El algoritmo opera con bytes sin formato y no necesita comprender el formato del archivo. Sin embargo, el contenido semánticamente similar almacenado en formatos completamente diferentes (por ejemplo, el mismo texto en PDF frente a DOCX) no se detectará como casi duplicado debido a estructuras binarias muy diferentes.

Absolutamente. Todo el procesamiento de archivos se realiza íntegramente en su navegador mediante la API FileReader y la API Web Crypto. Nunca se cargan datos en ningún servidor. Sus archivos y su contenido permanecen completamente privados en su dispositivo. Sin registro, sin cuenta, sin recopilación de datos.

Las puntuaciones oscilan entre 0% (completamente diferentes) y 100% (idénticas). 95-100% significa archivos idénticos o casi idénticos. 75-95% indica casi duplicados con cambios menores. Entre el 50% y el 75% muestra archivos que comparten contenido significativo pero con diferencias notables. Entre el 25% y el 50% indica algún contenido compartido y por debajo del 25% significa que no hay similitud significativa.

¡Sí! Dado que nuestro algoritmo analiza el contenido de los archivos en lugar de los nombres de los archivos, un archivo cuyo nombre haya cambiado se detectará como idéntico (100 % de similitud) al original siempre que el contenido no haya cambiado. Esto hace que la herramienta sea ideal para buscar archivos que han sido copiados, renombrados o movidos.

Los buscadores habituales de archivos duplicados comparan archivos utilizando algoritmos hash exactos y sólo encuentran archivos idénticos bit a bit. Nuestro Buscador de archivos casi duplicados utiliza hash difuso para encontrar archivos que son similares pero no idénticos: archivos con cambios de metadatos, diferencias de formato, ediciones menores o diferentes niveles de compresión. Los buscadores habituales de duplicados se perderían todos estos.

¡Sí! 100% gratis, sin registro, sin cuenta, sin clave API y sin límites de uso. Compara tantos archivos como necesites, completamente gratis y para siempre. Todo el procesamiento se realiza en su navegador sin costos de servidor.