Pular para o conteúdo
Aback Tools Logo

Localizador de arquivos quase duplicados

Carregue vários arquivos para encontrar arquivos quase duplicados usando nosso Localizador de arquivos quase duplicados on-line gratuito. A ferramenta usa um algoritmo de hash difuso inspirado em ssdeep (Context Triggered Piecewise Hashing) para identificar arquivos semelhantes, mas não idênticos. Os arquivos são divididos em pedaços baseados em conteúdo usando um hash contínuo, cada pedaço é hash com SHA-256 e as assinaturas resultantes são comparadas em todos os pares de arquivos para calcular pontuações de similaridade de 0% a 100%. Todo o processamento é feito inteiramente no seu navegador - sem uploads, sem necessidade de inscrição.

Near-Duplicate File Finder

Upload two or more files to find near-duplicates using fuzzy hashing. The tool analyzes file content using a context-triggered piecewise hashing algorithm (similar to ssdeep) to detect files that are similar but not identical. All processing happens locally in your browser.

Drop files here or click to browse

Upload at least 2 files (any type, any size) - all processing is local

Minimum 2 files required for comparison. Select multiple files to find which ones are similar, near-duplicate, or identical.
How Fuzzy Hashing Works

The near-duplicate file finder uses a fuzzy hashing algorithm inspired by ssdeep(Context Triggered Piecewise Hashing). Each file is divided into content-based chunks using a rolling hash - the chunk boundaries are determined by the file content itself, not by fixed positions. Each chunk is then hashed using SHA-256, creating a signature that captures the file's structure. Files are compared by computing exact chunk matches, longest common subsequence of chunks, and size ratio to produce a similarity score from 0% to 100%. This approach can detect files that have been partially edited, reformatted, or had metadata changes while still recognizing them as near-duplicates.

Por que usar nosso localizador de arquivos quase duplicados?

  • Algoritmo Fuzzy Hashing: detecta arquivos quase duplicados usando um algoritmo de hash por partes acionado por contexto (CTPH) inspirado em ssdeep. Ao contrário da comparação exata de hash (SHA-256/MD5), nosso hash difuso divide os arquivos em partes baseadas em conteúdo usando um hash contínuo e compara assinaturas de partes para encontrar arquivos semelhantes, mesmo quando metadados, formatação ou edições menores foram aplicadas. Isso permite a detecção de arquivos semelhantes, mas não idênticos.
  • Comparação de lotes de vários arquivos: carregue vários arquivos de qualquer tipo simultaneamente para detecção de lote quase duplicado. A ferramenta compara automaticamente cada par exclusivo de arquivos, calculando pontuações de similaridade para todas as combinações. Os resultados são organizados por categoria de similaridade (Idêntico, Quase Duplicado, Semelhante, Um pouco semelhante) com barras de progresso visuais mostrando a porcentagem exata de similaridade para cada par.
  • Pontuação abrangente de similaridade: cada par de arquivos recebe uma pontuação de similaridade de 0% a 100% com base em uma combinação ponderada de três métricas: proporção exata de correspondência de pedaços (blocos de conteúdo idênticos), maior subsequência comum de pedaços (sobreposição de estrutura ordenada) e proporção de tamanho de arquivo (semelhança de tamanho geral). Essa abordagem multimétrica fornece detecção precisa de quase duplicatas em diversos tipos de arquivos.
  • Processamento 100% privado baseado em navegador: todo o processamento de arquivos acontece inteiramente em seu navegador usando a API Web Crypto para hashing SHA-256. Os arquivos são lidos localmente e nunca enviados para nenhum servidor. Seus dados permanecem totalmente privados no seu dispositivo. Sem inscrição, sem conta, sem coleta de dados, sem limites de uso - totalmente gratuito e privado.

Casos de uso comuns para localizador de arquivos quase duplicados

  • Otimização e limpeza de armazenamento: identifique arquivos duplicados e quase duplicados que sobrecarregam seu armazenamento. Nosso localizador de arquivos quase duplicados ajuda administradores de sistema e usuários a encontrar documentos, imagens e backups semelhantes que podem ser consolidados para liberar espaço valioso em disco. Detecte arquivos quase idênticos, exceto por pequenas diferenças de metadados, alterações de versão ou alterações de formatação em seus sistemas de armazenamento.
  • Desduplicação da biblioteca de fotos: Encontre fotos quase duplicadas em sua biblioteca de imagens onde pequenas edições, cortes, filtros ou redimensionamento foram aplicados. Fotógrafos e usuários casuais podem usar nossa ferramenta para identificar imagens semelhantes que podem ter sido salvas em várias versões, ajudando a organizar e limpar coleções de fotos agrupando fotos quase duplicadas.
  • Análise de similaridade de base de código: detecte arquivos de código duplicados ou quase duplicados em seus projetos. Os desenvolvedores podem identificar arquivos que compartilham código significativo com pequenas modificações, ajudando a refatorar, mesclar ou desduplicar bases de código. Útil para auditar grandes repositórios, detectar código copiado e manter uma arquitetura de código limpa.
  • Gerenciamento de versões de documentos: rastreie versões de documentos e identifique revisões quase duplicadas em seu sistema de gerenciamento de documentos. Em vez de comparar cada par de documentos manualmente, nossa ferramenta encontra automaticamente documentos semelhantes, mas não idênticos, ajudando a identificar a versão mais recente, detectar modificações não autorizadas e gerenciar os ciclos de vida dos documentos com mais eficiência.
  • Limpeza de backup e arquivo: limpe arquivos de backup identificando arquivos quase duplicados que foram criados em diferentes execuções de backup. Os administradores de sistema podem encontrar arquivos quase idênticos em todos os backups, ajudando a reduzir os requisitos de armazenamento de backup e a otimizar estratégias de arquivamento ao consolidar dados quase duplicados.
  • Análise forense digital e de evidências: Os investigadores forenses podem usar a detecção quase duplicada para encontrar arquivos relacionados em coleções de evidências. Identifique documentos que foram alterados, renomeados ou salvos novamente com modificações. Nossa ferramenta ajuda os profissionais de perícia digital a identificar rapidamente arquivos relacionados entre si, mesmo quando nomes de arquivos, metadados ou conteúdo específico foram alterados.

O que é detecção de arquivos quase duplicados?

A detecção de arquivos quase duplicados é o processo de localização de arquivos semelhantes, mas não idênticos - ao contrário da detecção exata de duplicatas, que encontra apenas arquivos com conteúdo idêntico. Quase duplicatas compartilham conteúdo significativo, mas podem diferir em metadados, formatação, compactação, edições ou recodificação. Nossa ferramenta usa um algoritmo de hash difuso inspirado em ssdeep (Context Triggered Piecewise Hashing ou CTPH) que divide os arquivos em pedaços baseados em conteúdo e compara suas assinaturas de pedaços para calcular uma pontuação de similaridade. Essa abordagem detecta arquivos que seriam perdidos na comparação exata de hash, tornando-a ideal para localizar documentos relacionados, imagens semelhantes, arquivos com versão e cópias modificadas.

Como funciona nosso algoritmo Fuzzy Hashing

  1. Chunking baseado em conteúdo: o arquivo é lido como bytes e um hash contínuo (semelhante ao Adler-32) desliza pelos dados. Quando o valor hash corresponde a um padrão de disparo específico, um limite de bloco é criado. Isso significa que os pedaços se alinham com a estrutura natural do conteúdo do arquivo, em vez de posições fixas – tornando o algoritmo robusto contra inserções e exclusões.
  2. Hashing de pedaços: cada pedaço de conteúdo é hash usando SHA-256 por meio da API Web Crypto. As assinaturas hash resultantes capturam o conteúdo de cada pedaço. Pedaços idênticos em arquivos diferentes produzem hashes idênticos, permitindo que o algoritmo detecte conteúdo compartilhado mesmo quando os arquivos diferem em outras partes.
  3. Computação de similaridade: os arquivos são comparados calculando três métricas: proporção exata de correspondência de pedaços (quantos pedaços têm hashes idênticos), maior subsequência comum de pedaços (quanto da ordem dos pedaços é preservada) e proporção de tamanho de arquivo. Eles são ponderados e combinados em uma pontuação final de similaridade de 0% a 100%.
  4. Comparação de lotes: quando vários arquivos são carregados, cada par exclusivo é comparado automaticamente. Os resultados são classificados por similaridade decrescente e categorizados em cinco níveis: Idêntico, Quase Duplicado, Semelhante, Um pouco semelhante e Diferente.

O que torna um arquivo quase duplicado?

  • Alterações de metadados: arquivos com o mesmo conteúdo, mas metadados diferentes (dados EXIF ​​em imagens, propriedades de documentos, carimbos de data e hora de arquivos) são detectados como quase duplicados, pois os pedaços de conteúdo permanecem praticamente os mesmos.
  • Diferenças de formatação: documentos reformatados com fontes, espaçamentos ou layout diferentes ainda compartilharão a maioria dos pedaços de conteúdo, tornando-os detectáveis ​​como quase duplicados, mesmo quando a aparência visual for diferente.
  • Edições menores: arquivos com pequenas adições, exclusões ou modificações (como parágrafos atualizados, erros de digitação corrigidos ou comentários adicionados) compartilharão a maioria dos pedaços de conteúdo inalterados, resultando em altas pontuações de similaridade.
  • Recodificação/recompactação: imagens salvas novamente em diferentes níveis de qualidade ou arquivos recompactados com configurações diferentes compartilharão a estrutura de conteúdo subjacente, embora os limites dos blocos possam mudar, resultando em pontuações de similaridade moderadas a altas.

Privacidade, segurança e limitações

Nosso Localizador de Arquivos Quase Duplicados processa tudo localmente em seu navegador. Os arquivos são lidos usando a API FileReader e hash usando a API Web Crypto. Nenhum dado é carregado em nenhum servidor - seus arquivos permanecem completamente privados no seu dispositivo. A ferramenta é 100% gratuita, sem inscrição, sem conta e sem limites de uso.

Limitações importantes: O algoritmo foi projetado para detecção de similaridade baseada em conteúdo. Arquivos semanticamente semelhantes, mas com conteúdo binário completamente diferente (por exemplo, o mesmo texto salvo no formato PDF vs. DOCX) não serão detectados como quase duplicados. Arquivos muito pequenos (menos de 64 bytes) podem produzir blocos insuficientes para uma comparação significativa. O tempo de processamento aumenta com o número de arquivos, pois cada par deve ser comparado. Para conjuntos muito grandes (mais de 50 arquivos), considere o processamento em lotes menores.

Perguntas frequentes

O hash regular (SHA-256, MD5) produz valores de hash completamente diferentes mesmo que um único byte seja alterado - tornando-o útil para detecção exata de duplicatas, mas inútil para encontrar arquivos semelhantes. O hash difuso divide os arquivos em partes baseadas em conteúdo e cria uma assinatura que captura a estrutura do arquivo. Arquivos que compartilham conteúdo semelhante produzem assinaturas hash difusas semelhantes, mesmo com pequenas diferenças. Nosso algoritmo é inspirado em ssdeep (Context Triggered Piecewise Hashing).

Não há limite rígido para uploads. No entanto, como cada par único é comparado, 10 arquivos produzem 45 pares, 20 arquivos produzem 190 pares e 50 arquivos produzem 1.225 pares. Para melhor desempenho, recomendamos processar arquivos em lotes de 10 a 30 por vez. Todo o processamento é local, portanto o desempenho depende da CPU e da memória do seu dispositivo.

Todos os tipos de arquivos são suportados – documentos, imagens, áudio, vídeo, código-fonte, arquivos e qualquer outro formato. O algoritmo opera em bytes brutos e não precisa entender o formato do arquivo. No entanto, conteúdo semanticamente semelhante armazenado em formatos completamente diferentes (por exemplo, o mesmo texto em PDF vs. DOCX) não será detectado como quase duplicado devido a estruturas binárias muito diferentes.

Absolutamente. Todo o processamento de arquivos acontece inteiramente em seu navegador usando a API FileReader e a API Web Crypto. Nenhum dado é carregado em nenhum servidor. Seus arquivos e seu conteúdo permanecem totalmente privados no seu dispositivo. Sem inscrição, sem conta, sem coleta de dados.

As pontuações variam de 0% (completamente diferente) a 100% (idêntica). 95-100% significa arquivos idênticos ou quase idênticos. 75-95% indica quase duplicatas com pequenas alterações. 50-75% mostram arquivos que compartilham conteúdo significativo, mas com diferenças notáveis. 25-50% indica algum conteúdo compartilhado e abaixo de 25% significa nenhuma semelhança significativa.

Sim! Como nosso algoritmo analisa o conteúdo do arquivo em vez dos nomes dos arquivos, um arquivo renomeado será detectado como idêntico (100% de similaridade) ao original, desde que o conteúdo não tenha sido alterado. Isso torna a ferramenta ideal para localizar arquivos que foram copiados, renomeados ou movidos.

Os localizadores regulares de arquivos duplicados comparam arquivos usando algoritmos de hash exatos e encontram apenas arquivos idênticos bit a bit. Nosso Localizador de Arquivos Quase Duplicados usa hash difuso para encontrar arquivos semelhantes, mas não idênticos - arquivos com alterações de metadados, diferenças de formatação, pequenas edições ou diferentes níveis de compactação. Os localizadores regulares de duplicatas perderiam tudo isso.

Sim! 100% gratuito, sem inscrição, sem conta, sem chave de API e sem limites de uso. Compare quantos arquivos você precisar - totalmente gratuito, para sempre. Todo o processamento acontece no seu navegador sem custos de servidor.