Перейти к содержимому
Aback Tools Logo

Поиск почти повторяющихся файлов

Загрузите несколько файлов, чтобы найти почти повторяющиеся файлы, используя наш бесплатный онлайн-поиск почти повторяющихся файлов. Инструмент использует алгоритм нечеткого хеширования, основанный на ssdeep (кусочное хеширование, запускаемое контекстом), для идентификации файлов, которые похожи, но не идентичны. Файлы делятся на фрагменты на основе содержимого с помощью скользящего хэша, каждый фрагмент хешируется с помощью SHA-256, а полученные подписи сравниваются по всем парам файлов для вычисления оценки сходства от 0 % до 100 %. Вся обработка осуществляется полностью в вашем браузере — никаких загрузок и регистрации не требуется.

Near-Duplicate File Finder

Upload two or more files to find near-duplicates using fuzzy hashing. The tool analyzes file content using a context-triggered piecewise hashing algorithm (similar to ssdeep) to detect files that are similar but not identical. All processing happens locally in your browser.

Drop files here or click to browse

Upload at least 2 files (any type, any size) - all processing is local

Minimum 2 files required for comparison. Select multiple files to find which ones are similar, near-duplicate, or identical.
How Fuzzy Hashing Works

The near-duplicate file finder uses a fuzzy hashing algorithm inspired by ssdeep(Context Triggered Piecewise Hashing). Each file is divided into content-based chunks using a rolling hash - the chunk boundaries are determined by the file content itself, not by fixed positions. Each chunk is then hashed using SHA-256, creating a signature that captures the file's structure. Files are compared by computing exact chunk matches, longest common subsequence of chunks, and size ratio to produce a similarity score from 0% to 100%. This approach can detect files that have been partially edited, reformatted, or had metadata changes while still recognizing them as near-duplicates.

Зачем использовать наш инструмент поиска почти повторяющихся файлов?

  • Алгоритм нечеткого хеширования: обнаруживает почти повторяющиеся файлы с помощью алгоритма кусочного хеширования с контекстным запуском (CTPH), вдохновленного ssdeep. В отличие от точного сравнения хешей (SHA-256/MD5), наше нечеткое хеширование делит файлы на фрагменты на основе содержимого с помощью скользящего хеша и сравнивает подписи фрагментов для поиска похожих файлов, даже если были применены метаданные, форматирование или незначительные изменения. Это позволяет обнаруживать файлы, которые похожи, но не идентичны.
  • Пакетное сравнение нескольких файлов: загрузите несколько файлов любого типа одновременно для обнаружения в пакете почти повторяющихся файлов. Инструмент автоматически сравнивает каждую уникальную пару файлов, вычисляя показатели сходства для всех комбинаций. Результаты организованы по категориям сходства («Идентичные», «Почти повторяющиеся», «Похожие», «В некоторой степени похожие») с визуальными индикаторами выполнения, показывающими точный процент сходства для каждой пары.
  • Комплексная оценка сходства: каждая пара файлов получает оценку сходства от 0% до 100% на основе взвешенной комбинации трех показателей: коэффициент точного совпадения фрагментов (идентичные блоки контента), самая длинная общая подпоследовательность фрагментов (перекрытие упорядоченной структуры) и соотношение размеров файлов (общее сходство размеров). Этот мультиметрический подход обеспечивает точное обнаружение почти повторяющихся файлов в различных типах файлов.
  • 100% конфиденциальная обработка на основе браузера: вся обработка файлов происходит полностью в вашем браузере с использованием API Web Crypto для хеширования SHA-256. Файлы читаются локально и никогда не загружаются на какой-либо сервер. Ваши данные остаются полностью конфиденциальными на вашем устройстве. Никакой регистрации, никакой учетной записи, никакого сбора данных, никаких ограничений на использование — совершенно бесплатно и конфиденциально.

Распространенные случаи использования средства поиска почти повторяющихся файлов

  • Оптимизация и очистка хранилища. Выявляйте повторяющиеся и почти повторяющиеся файлы, загромождающие ваше хранилище. Наш инструмент поиска почти повторяющихся файлов помогает системным администраторам и пользователям находить похожие документы, изображения и резервные копии, которые можно объединить, чтобы освободить ценное дисковое пространство. Обнаруживайте файлы, которые практически идентичны, за исключением незначительных различий в метаданных, изменений версий или изменений форматирования в ваших системах хранения.
  • Дедупликация библиотеки фотографий. Найдите в своей библиотеке изображений почти повторяющиеся фотографии, к которым были применены небольшие изменения, обрезка, фильтры или изменение размера. Как фотографы, так и обычные пользователи могут использовать наш инструмент для выявления похожих изображений, которые могли быть сохранены в нескольких версиях, помогая организовать и очистить коллекции фотографий, группируя почти повторяющиеся снимки.
  • Анализ сходства кодовой базы: обнаружение дублированных или почти повторяющихся файлов кода в ваших проектах. Разработчики могут идентифицировать файлы, которые содержат общий код с небольшими изменениями, что помогает проводить рефакторинг, объединение или дедупликацию кодовых баз. Полезно для аудита больших репозиториев, обнаружения скопированного кода и поддержания чистой архитектуры кода.
  • Управление версиями документов: отслеживайте версии документов и выявляйте почти повторяющиеся версии в вашей системе управления документами. Вместо сравнения каждой пары документов вручную наш инструмент автоматически находит похожие, но не идентичные документы, помогая идентифицировать последнюю версию, обнаруживать несанкционированные изменения и более эффективно управлять жизненным циклом документов.
  • Очистка резервного копирования и архива: Очистка архивов резервных копий путем выявления почти повторяющихся файлов, созданных при различных запусках резервного копирования. Системные администраторы могут находить в резервных копиях файлы, которые практически идентичны, что помогает снизить требования к хранилищу резервных копий и оптимизировать стратегии архивирования за счет консолидации практически повторяющихся данных.
  • Цифровая криминалистика и анализ доказательств: судебно-медицинские следователи могут использовать обнаружение почти дубликатов для поиска связанных файлов в коллекциях доказательств. Определите документы, которые были изменены, переименованы или повторно сохранены с изменениями. Наш инструмент помогает специалистам в области цифровой криминалистики быстро идентифицировать файлы, связанные друг с другом, даже если имена файлов, метаданные или конкретное содержимое были изменены.

Что такое обнаружение почти повторяющихся файлов?

Обнаружение почти повторяющихся файлов — это процесс поиска файлов, которые похожи, но не идентичны, в отличие от точного обнаружения дубликатов, которое находит только файлы с идентичным содержимым. Почти дубликаты имеют общий контент, но могут отличаться метаданными, форматированием, сжатием, редактированием или перекодированием. Наш инструмент использует алгоритм нечеткого хеширования, основанный на ssdeep (кусочное хеширование, запускаемое контекстом или CTPH), который делит файлы на фрагменты на основе содержимого и сравнивает их подписи фрагментов для вычисления показателя сходства. Этот подход обнаруживает файлы, которые были бы пропущены при точном сравнении хешей, что делает его идеальным для поиска связанных документов, похожих изображений, файлов с версиями и измененных копий.

Как работает наш алгоритм нечеткого хеширования

  1. Разбивка на основе содержимого: файл читается как байты, а по данным перемещается скользящий хэш (аналогично Adler-32). Когда значение хеш-функции соответствует определенному шаблону триггера, создается граница фрагмента. Это означает, что фрагменты выравниваются по естественной структуре содержимого файла, а не по фиксированным позициям, что делает алгоритм устойчивым к вставкам и удалениям.
  2. Хеширование фрагментов: каждый фрагмент контента хешируется с использованием SHA-256 через Web Crypto API. Полученные хэш-подписи фиксируют содержимое каждого фрагмента. Идентичные фрагменты в разных файлах создают одинаковые хэши, что позволяет алгоритму обнаруживать общий контент, даже если файлы различаются в других частях.
  3. Вычисление сходства: файлы сравниваются путем вычисления трех показателей: коэффициент точного совпадения фрагментов (сколько фрагментов имеют одинаковые хэши), самая длинная общая подпоследовательность фрагментов (какая часть порядка фрагментов сохраняется) и соотношение размеров файлов. Они взвешиваются и объединяются в окончательную оценку сходства от 0% до 100%.
  4. Пакетное сравнение: при загрузке нескольких файлов каждая уникальная пара сравнивается автоматически. Результаты сортируются по убыванию сходства и распределяются по пяти уровням: идентичные, почти повторяющиеся, похожие, несколько похожие и разные.

Что делает файл почти дубликатом?

  • Изменения метаданных. Файлы с одинаковым содержимым, но с разными метаданными (данные EXIF ​​в изображениях, свойства документа, временные метки файлов) обнаруживаются как почти дубликаты, поскольку фрагменты контента остаются в основном теми же.
  • Различия в форматировании. Документы, отформатированные с использованием других шрифтов, интервалов или макета, по-прежнему будут использовать большинство фрагментов контента, что делает их практически идентичными, даже если внешний вид отличается.
  • Незначительные изменения: файлы с небольшими дополнениями, удалениями или изменениями (например, обновленными абзацами, исправленными опечатками или добавленными комментариями) будут использовать большую часть неизмененных фрагментов содержимого, что приведет к высоким показателям сходства.
  • Повторное кодирование/повторное сжатие: изображения, повторно сохраненные с разными уровнями качества, или файлы, повторно сжатые с другими настройками, будут иметь общую структуру содержимого, хотя границы фрагментов могут смещаться, что приводит к умеренному или высокому показателю сходства.

Конфиденциальность, безопасность и ограничения

Наш инструмент поиска почти повторяющихся файлов обрабатывает все локально в вашем браузере. Файлы считываются с помощью API FileReader и хэшируются с помощью API Web Crypto. Никакие данные никогда не загружаются на какой-либо сервер — ваши файлы остаются полностью конфиденциальными на вашем устройстве. Инструмент на 100% бесплатен, без регистрации, учетной записи и ограничений на использование.

Важные ограничения: Алгоритм предназначен для обнаружения сходства на основе контента. Файлы, которые семантически схожи, но имеют совершенно разное двоичное содержимое (например, один и тот же текст, сохраненный в формате PDF и DOCX), не будут распознаваться как почти дубликаты. Очень маленькие файлы (менее 64 байтов) могут содержать фрагменты, недостаточные для значимого сравнения. Время обработки увеличивается с увеличением количества файлов, поскольку необходимо сравнивать каждую пару. Для очень больших наборов (более 50 файлов) рассмотрите возможность обработки меньшими пакетами.

Часто задаваемые вопросы

Обычное хеширование (SHA-256, MD5) дает совершенно разные значения хеш-функции, если изменяется хотя бы один байт, что делает его полезным для точного обнаружения дубликатов, но бесполезным для поиска похожих файлов. Нечеткое хеширование делит файлы на фрагменты на основе содержимого и создает подпись, фиксирующую структуру файла. Файлы со схожим содержимым создают схожие нечеткие хэш-подписи даже с незначительными различиями. Наш алгоритм основан на ssdeep (кусочное хеширование, запускаемое контекстом).

Жестких ограничений на загрузку нет. Однако, поскольку сравнивается каждая уникальная пара, из 10 файлов получается 45 пар, из 20 файлов — 190 пар, а из 50 файлов — 1225 пар. Для достижения максимальной производительности мы рекомендуем обрабатывать файлы пакетами по 10–30 штук за раз. Вся обработка является локальной, поэтому производительность зависит от процессора и памяти вашего устройства.

Поддерживаются все типы файлов — документы, изображения, аудио, видео, исходный код, архивы и любой другой формат. Алгоритм работает с необработанными байтами и не требует понимания формата файла. Однако семантически схожий контент, хранящийся в совершенно разных форматах (например, один и тот же текст в PDF и DOCX), не будет распознан как почти дубликаты из-за совершенно разных двоичных структур.

Абсолютно. Вся обработка файлов происходит полностью в вашем браузере с использованием FileReader API и Web Crypto API. Никакие данные никогда не загружаются ни на один сервер. Ваши файлы и их содержимое остаются полностью конфиденциальными на вашем устройстве. Никакой регистрации, никакой учетной записи, никакого сбора данных.

Оценки варьируются от 0% (полностью разные) до 100% (идентичны). 95-100% означает идентичные или почти идентичные файлы. 75-95% указывают на почти дубликаты с незначительными изменениями. 50–75 % показывают файлы, имеющие общий контент, но с заметными различиями. 25–50 % указывает на наличие общего контента, а значение ниже 25 % означает отсутствие существенного сходства.

Да! Поскольку наш алгоритм анализирует содержимое файла, а не имена файлов, переименованный файл будет распознаваться как идентичный (100% сходство) оригиналу, пока содержимое не изменилось. Это делает инструмент идеальным для поиска файлов, которые были скопированы, переименованы или перемещены.

Обычные средства поиска дубликатов файлов сравнивают файлы, используя точные алгоритмы хеширования, и находят только побитовые идентичные файлы. Наш инструмент поиска почти повторяющихся файлов использует нечеткое хеширование для поиска похожих, но не идентичных файлов — файлов с изменениями метаданных, различиями в форматировании, незначительными изменениями или разными уровнями сжатия. Обычные средства поиска дубликатов пропустят все это.

Да! 100% бесплатно, без регистрации, учетной записи, ключа API и ограничений на использование. Сравнивайте столько файлов, сколько вам нужно — совершенно бесплатно и навсегда. Вся обработка происходит в вашем браузере без каких-либо затрат на сервер.