Pencari File Hampir Duplikat
Unggah banyak file untuk menemukan hampir duplikat menggunakan Pencari File Dekat Duplikat online gratis kami. Alat ini menggunakan algoritma hashing fuzzy yang terinspirasi oleh ssdeep (Context Triggered Piecewise Hashing) untuk mengidentifikasi file yang serupa tetapi tidak identik. File dibagi menjadi beberapa bagian berbasis konten menggunakan hash bergulir, setiap bagian di-hash dengan SHA-256, dan tanda tangan yang dihasilkan dibandingkan di semua pasangan file untuk menghitung skor kesamaan dari 0% hingga 100%. Semua pemrosesan dilakukan sepenuhnya di browser Anda - tidak perlu mengunggah, tidak perlu mendaftar.
Upload two or more files to find near-duplicates using fuzzy hashing. The tool analyzes file content using a context-triggered piecewise hashing algorithm (similar to ssdeep) to detect files that are similar but not identical. All processing happens locally in your browser.
Drop files here or click to browse
Upload at least 2 files (any type, any size) - all processing is local
The near-duplicate file finder uses a fuzzy hashing algorithm inspired by ssdeep(Context Triggered Piecewise Hashing). Each file is divided into content-based chunks using a rolling hash - the chunk boundaries are determined by the file content itself, not by fixed positions. Each chunk is then hashed using SHA-256, creating a signature that captures the file's structure. Files are compared by computing exact chunk matches, longest common subsequence of chunks, and size ratio to produce a similarity score from 0% to 100%. This approach can detect files that have been partially edited, reformatted, or had metadata changes while still recognizing them as near-duplicates.
Mengapa Menggunakan Pencari File Hampir Duplikat Kami?
- Algoritma Fuzzy Hashing: Mendeteksi file yang hampir duplikat menggunakan algoritma hashing sepotong-sepotong yang dipicu konteks (CTPH) yang terinspirasi oleh ssdeep. Tidak seperti perbandingan hash yang tepat (SHA-256/MD5), hashing fuzzy kami membagi file menjadi potongan-potongan berbasis konten menggunakan hash bergulir dan membandingkan tanda tangan potongan untuk menemukan file serupa bahkan ketika metadata, pemformatan, atau pengeditan kecil telah diterapkan. Hal ini memungkinkan deteksi file yang serupa tetapi tidak identik.
- Perbandingan Batch Multi-File: Unggah beberapa file jenis apa pun secara bersamaan untuk deteksi batch yang hampir duplikat. Alat ini membandingkan setiap pasangan file unik secara otomatis, menghitung skor kesamaan untuk semua kombinasi. Hasil disusun berdasarkan kategori kesamaan (Identik, Hampir Duplikat, Serupa, Agak Mirip) dengan bilah kemajuan visual yang menunjukkan persentase kesamaan yang tepat untuk setiap pasangan.
- Skor Kesamaan Komprehensif: Setiap pasangan file menerima skor kesamaan dari 0% hingga 100% berdasarkan kombinasi tertimbang dari tiga metrik: rasio kecocokan potongan yang tepat (blok konten yang identik), urutan potongan yang terpanjang (struktur yang diurutkan tumpang tindih), dan rasio ukuran file (kesamaan ukuran keseluruhan). Pendekatan multi-metrik ini memberikan deteksi hampir duplikat yang akurat di berbagai jenis file.
- 100% Pemrosesan Berbasis Browser Pribadi: Semua pemrosesan file terjadi sepenuhnya di browser Anda menggunakan Web Crypto API untuk hashing SHA-256. File dibaca secara lokal dan tidak pernah diunggah ke server mana pun. Data Anda tetap sepenuhnya pribadi di perangkat Anda. Tanpa pendaftaran, tanpa akun, tanpa pengumpulan data, tanpa batasan penggunaan - sepenuhnya gratis dan pribadi.
Kasus Penggunaan Umum untuk Pencari File Hampir Duplikat
- Pengoptimalan & Pembersihan Penyimpanan: Identifikasi file duplikat dan hampir duplikat yang mengacaukan penyimpanan Anda. Pencari file kami yang hampir duplikat membantu administrator sistem dan pengguna menemukan dokumen, gambar, dan cadangan serupa yang dapat digabungkan untuk mengosongkan ruang disk yang berharga. Deteksi file yang hampir sama kecuali sedikit perbedaan metadata, perubahan versi, atau perubahan format di seluruh sistem penyimpanan Anda.
- Deduplikasi Perpustakaan Foto: Temukan foto yang hampir duplikat di perpustakaan gambar Anda yang telah menerapkan sedikit pengeditan, pemotongan, filter, atau pengubahan ukuran. Fotografer dan pengguna biasa sama-sama dapat menggunakan alat kami untuk mengidentifikasi gambar serupa yang mungkin telah disimpan dalam beberapa versi, membantu mengatur dan membersihkan koleksi foto dengan mengelompokkan foto yang hampir duplikat menjadi satu.
- Analisis Kesamaan Basis Kode: Deteksi file kode yang diduplikasi atau hampir duplikat di seluruh proyek Anda. Pengembang dapat mengidentifikasi file yang berbagi kode signifikan dengan sedikit modifikasi, membantu memfaktorkan ulang, menggabungkan, atau menghapus duplikat basis kode. Berguna untuk mengaudit repositori besar, mendeteksi kode yang disalin, dan memelihara arsitektur kode yang bersih.
- Manajemen Versi Dokumen: Lacak versi dokumen dan identifikasi revisi yang hampir duplikat dalam sistem manajemen dokumen Anda. Daripada membandingkan setiap pasangan dokumen secara manual, alat kami secara otomatis menemukan dokumen yang serupa namun tidak identik, membantu mengidentifikasi versi terbaru, mendeteksi modifikasi yang tidak sah, dan mengelola siklus hidup dokumen dengan lebih efisien.
- Pembersihan Pencadangan & Arsip: Bersihkan arsip cadangan dengan mengidentifikasi file yang hampir duplikat yang dibuat di berbagai proses pencadangan. Administrator sistem dapat menemukan file yang hampir sama di seluruh cadangan, membantu mengurangi kebutuhan penyimpanan cadangan dan mengoptimalkan strategi pengarsipan dengan menggabungkan data yang hampir duplikat.
- Forensik Digital & Analisis Bukti: Penyelidik forensik dapat menggunakan deteksi hampir duplikat untuk menemukan file terkait di seluruh koleksi bukti. Identifikasi dokumen yang telah diubah, diganti namanya, atau disimpan ulang dengan modifikasi. Alat kami membantu profesional forensik digital dengan cepat mengidentifikasi file yang terkait satu sama lain, bahkan ketika nama file, metadata, atau konten tertentu telah diubah.
Apa itu Deteksi File Hampir Duplikat?
Deteksi file hampir duplikat adalah proses menemukan file yang serupa tetapi tidak identik - tidak seperti deteksi duplikat persis yang hanya menemukan file dengan konten identik. Hampir duplikat berbagi konten yang signifikan tetapi mungkin berbeda dalam metadata, pemformatan, kompresi, pengeditan, atau pengodean ulang. Alat kami menggunakan algoritma hashing fuzzy yang terinspirasi oleh ssdeep (Context Triggered Piecewise Hashing atau CTPH) yang membagi file menjadi potongan-potongan berbasis konten dan membandingkan tanda tangan potongannya untuk menghitung skor kesamaan. Pendekatan ini mendeteksi file yang tidak dapat dibandingkan dengan perbandingan hash yang tepat, sehingga ideal untuk menemukan dokumen terkait, gambar serupa, file berversi, dan salinan yang dimodifikasi.
Cara Kerja Algoritma Fuzzy Hashing Kami
- Pemotongan Berbasis Konten: File dibaca sebagai byte dan hash bergulir (mirip dengan Adler-32) meluncur melalui data. Ketika nilai hash cocok dengan pola pemicu tertentu, batas potongan dibuat. Ini berarti potongan-potongan tersebut selaras dengan struktur konten alami file, bukan pada posisi tetap - menjadikan algoritme ini kuat terhadap penyisipan dan penghapusan.
- Hashing Potongan: Setiap potongan konten di-hash menggunakan SHA-256 melalui Web Crypto API. Tanda tangan hash yang dihasilkan menangkap konten setiap potongan. Potongan identik di berbagai file menghasilkan hash yang identik, memungkinkan algoritme mendeteksi konten bersama bahkan ketika file berbeda di bagian lain.
- Komputasi Kesamaan: File dibandingkan dengan menghitung tiga metrik: rasio kecocokan bongkahan yang tepat (berapa banyak bongkahan yang memiliki hash identik), urutan bongkahan terpanjang yang umum (berapa banyak urutan bongkahan yang dipertahankan), dan rasio ukuran file. Ini diberi bobot dan digabungkan menjadi skor kesamaan akhir dari 0% hingga 100%.
- Perbandingan Batch: Saat beberapa file diunggah, setiap pasangan unik dibandingkan secara otomatis. Hasil diurutkan berdasarkan kemiripan dan dikategorikan ke dalam lima tingkatan: Identik, Hampir Duplikat, Serupa, Agak Mirip, dan Berbeda.
Apa yang Membuat File Hampir Duplikat?
- Perubahan Metadata: File dengan konten yang sama tetapi metadata berbeda (data EXIF dalam gambar, properti dokumen, stempel waktu file) terdeteksi hampir duplikat karena sebagian besar potongan konten tetap sama.
- Perbedaan Pemformatan: Dokumen yang diformat ulang dengan font, spasi, atau tata letak berbeda akan tetap berbagi sebagian besar potongan konten, sehingga dapat dideteksi sebagai hampir duplikat meskipun tampilan visualnya berbeda.
- Pengeditan Kecil: File dengan sedikit tambahan, penghapusan, atau modifikasi (seperti paragraf yang diperbarui, kesalahan ketik yang diperbaiki, atau komentar yang ditambahkan) akan berbagi sebagian besar potongan konten yang tidak diubah, sehingga menghasilkan skor kesamaan yang tinggi.
- Pengkodean ulang/kompresi ulang: Gambar yang disimpan ulang pada tingkat kualitas berbeda atau file yang dikompresi ulang dengan pengaturan berbeda akan memiliki struktur konten yang sama, meskipun batas potongan mungkin bergeser, sehingga menghasilkan skor kesamaan sedang hingga tinggi.
Privasi, Keamanan & Batasan
Pencari File Hampir Duplikat kami memproses semuanya secara lokal di browser Anda. File dibaca menggunakan FileReader API dan di-hash menggunakan Web Crypto API. Tidak ada data yang diunggah ke server mana pun - file Anda tetap bersifat pribadi di perangkat Anda. Alat ini 100% gratis tanpa pendaftaran, tanpa akun, dan tanpa batasan penggunaan.
Batasan penting: Algoritme ini dirancang untuk deteksi kesamaan berbasis konten. File yang secara semantik mirip tetapi memiliki konten biner yang sangat berbeda (misalnya, teks yang sama disimpan dalam format PDF vs. DOCX) tidak akan terdeteksi sebagai hampir duplikat. File yang sangat kecil (di bawah 64 byte) mungkin menghasilkan potongan yang tidak mencukupi untuk perbandingan yang berarti. Waktu pemrosesan bertambah seiring dengan jumlah file karena setiap pasangan harus dibandingkan. Untuk kumpulan yang sangat besar (50+ file), pertimbangkan untuk memproses dalam kelompok yang lebih kecil.
Pertanyaan yang Sering Diajukan
Hashing reguler (SHA-256, MD5) menghasilkan nilai hash yang sangat berbeda bahkan jika satu byte pun berubah - sehingga berguna untuk deteksi duplikat yang tepat tetapi tidak berguna untuk menemukan file serupa. Hashing fuzzy membagi file menjadi potongan-potongan berbasis konten dan membuat tanda tangan yang menangkap struktur file. File yang berbagi konten serupa menghasilkan tanda hash fuzzy yang serupa meskipun dengan perbedaan kecil. Algoritme kami terinspirasi oleh ssdeep (Context Triggered Piecewise Hashing).
Tidak ada batasan keras untuk mengunggah. Namun, karena setiap pasangan unik dibandingkan, 10 file menghasilkan 45 pasang, 20 file menghasilkan 190 pasang, dan 50 file menghasilkan 1,225 pasang. Untuk performa terbaik, kami merekomendasikan pemrosesan file dalam batch 10-30 sekaligus. Semua pemrosesan bersifat lokal, jadi kinerja bergantung pada CPU dan memori perangkat Anda.
Semua jenis file didukung - dokumen, gambar, audio, video, kode sumber, arsip, dan format lainnya. Algoritma ini beroperasi pada byte mentah dan tidak perlu memahami format file. Namun, konten serupa secara semantik yang disimpan dalam format yang sangat berbeda (misalnya, teks yang sama dalam PDF vs. DOCX) tidak akan terdeteksi sebagai hampir duplikat karena struktur binernya sangat berbeda.
Sangat. Semua pemrosesan file terjadi sepenuhnya di browser Anda menggunakan FileReader API dan Web Crypto API. Tidak ada data yang pernah diunggah ke server mana pun. File Anda dan kontennya tetap bersifat pribadi di perangkat Anda. Tanpa pendaftaran, tanpa akun, tanpa pengumpulan data.
Skor berkisar dari 0% (sangat berbeda) hingga 100% (identik). 95-100% berarti file identik atau hampir identik. 75-95% menunjukkan hampir duplikat dengan sedikit perubahan. 50-75% menunjukkan file berbagi konten yang signifikan tetapi dengan perbedaan yang mencolok. 25-50% menunjukkan beberapa konten yang dibagikan, dan di bawah 25% berarti tidak ada kesamaan yang signifikan.
Ya! Karena algoritme kami menganalisis konten file, bukan nama file, file yang diganti namanya akan terdeteksi identik (100% kemiripan) dengan aslinya selama kontennya tidak berubah. Hal ini menjadikan alat ini ideal untuk menemukan file yang telah disalin, diganti namanya, atau dipindahkan.
Pencari file duplikat biasa membandingkan file menggunakan algoritma hash yang tepat dan hanya menemukan file yang identik sedikit demi sedikit. Pencari File Hampir Duplikat kami menggunakan hashing fuzzy untuk menemukan file yang serupa tetapi tidak identik - file dengan perubahan metadata, perbedaan format, pengeditan kecil, atau tingkat kompresi berbeda. Pencari duplikat biasa akan melewatkan semua ini.
Ya! 100% gratis tanpa pendaftaran, tanpa akun, tanpa kunci API, dan tanpa batasan penggunaan. Bandingkan file sebanyak yang Anda perlukan - sepenuhnya gratis, selamanya. Semua pemrosesan terjadi di browser Anda tanpa biaya server.