Detektor BOM
Unggah file apa pun untuk mendeteksi Byte Order Mark (BOM) dan mengidentifikasi pengodean teks. Detektor BOM kami membaca header file dan mencocokkannya dengan tanda tangan BOM yang dikenal untuk UTF-8, UTF-16 (Big Endian dan Little Endian), UTF-32, UTF-7, GB 18030, dan lainnya. Lihat dump heksadesimal interaktif dengan byte BOM disorot, dapatkan informasi pengodean terperinci dengan deteksi endianness, dan terima rekomendasi praktis untuk kompatibilitas lintas platform. Semua pemrosesan dilakukan sepenuhnya di browser Anda - tanpa unggahan, tanpa pendaftaran.
Upload any file to detect Byte Order Marks (BOMs) - hidden byte sequences at the start of files that identify the text encoding and byte order. Supports UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), UTF-7, GB 18030, and other BOM signatures. Displays the hex dump with BOM bytes highlighted, encoding details, and recommendations for cross-platform compatibility. All processing is done entirely in your browser - no uploads, no signup required.
Drag & drop a file here, or click to select
Detects BOM signatures in text and binary files
Mengapa Menggunakan Detektor BOM Kami?
- Deteksi Tanda Tangan BOM yang Komprehensif: mendeteksi semua tanda tangan Byte Order Mark standar: UTF-8 (EF BB BF), UTF-16 Big Endian (FE FF), UTF-16 Little Endian (FF FE), UTF-32 Big Endian (00 00 FE FF), UTF-32 Little Endian (FF FE 00 00), UTF-7 (+/v), UTF-1, SCSU, BOCU-1, dan GB 18030. Setiap BOM diidentifikasi dengan nama pengodean, charset IANA, endianness, dan konteks penggunaan umum.
- Tampilan Heksadesimal & ASCII Interaktif: menampilkan 48 byte pertama file sebagai dump heksadesimal interaktif dengan representasi ASCII berdampingan. Byte BOM yang terdeteksi disorot dengan warna kuning agar mudah dikenali secara visual. Data heksadesimal dapat disalin ke clipboard dengan satu klik untuk dokumentasi atau analisis lanjutan.
- Rekomendasi Pengodean: memberikan rekomendasi yang dapat ditindaklanjuti berdasarkan pengodean BOM yang terdeteksi. Memberi saran tentang masalah kompatibilitas lintas platform - misalnya, memperingatkan saat BOM UTF-8 terdeteksi dalam kode sumber yang dapat menimbulkan masalah di sistem Unix/Linux, atau menyarankan konversi dari UTF-16 ke UTF-8 untuk efisiensi penyimpanan dan kompatibilitas alat yang lebih baik.
- Pemrosesan 100 % Privat di Browser: semua deteksi BOM terjadi sepenuhnya di browser Anda. Hanya 1024 byte pertama file yang dibaca menggunakan API FileReader - tidak ada data yang pernah diunggah ke server mana pun. File Anda tidak pernah meninggalkan perangkat, sehingga aman menganalisis file sensitif atau kepemilikan.
Kasus Penggunaan Umum Detektor BOM
- Men-debug Masalah Pengodean di Pengembangan Web: saat file PHP, Python, atau JavaScript menampilkan output tak terduga (seperti karakter  di atas halaman web), BOM UTF-8 sering menjadi penyebabnya. Gunakan Detektor BOM kami untuk dengan cepat mengidentifikasi apakah file sumber memiliki BOM, lalu konversi ke UTF-8 tanpa BOM agar tampil bersih.
- Kompatibilitas File Lintas Platform: file yang dibuat di Windows sering menyertakan BOM UTF-8 yang menyebabkan masalah saat dipindahkan ke sistem Unix/Linux/macOS. Skrip dengan baris shebang (#!) dapat gagal, file konfigurasi dapat salah dibaca, dan alat diff dapat menunjukkan perbedaan palsu. Deteksi BOM untuk mendiagnosis dan mengatasi masalah kompatibilitas ini.
- Verifikasi Pengodean CSV & File Data: file CSV yang diekspor dari Microsoft Excel sering menyertakan BOM UTF-8, yang dapat memengaruhi cara alat pemrosesan data mengurai file. Deteksi BOM dan pengodean untuk memastikan pipeline ETL, impor basis data, dan alat analisis data Anda menangani file dengan benar.
- Migrasi Format File Warisan: saat memigrasikan sistem lama yang menggunakan pengodean UTF-16, UTF-32, atau GB 18030 ke standar UTF-8 modern, gunakan deteksi BOM untuk mengidentifikasi file mana yang perlu dikonversi. Mesin rekomendasi memberikan panduan tentang strategi konversi terbaik untuk setiap jenis pengodean.
- QA & Validasi File dalam Pipeline CI/CD: integrasikan deteksi BOM ke dalam alur kerja jaminan kualitas Anda. Pastikan semua kode sumber, file konfigurasi, dan dokumentasi mengikuti standar pengodean tim Anda. Deteksi dan tandai file dengan BOM tak terduga sebelum menyebabkan masalah produksi.
- Edukasi Ilmu Komputer & Unicode: pelajari pengodean Unicode, urutan byte, endianness, dan karakter BOM (U+FEFF) secara interaktif. Unggah file dalam berbagai pengodean dan amati bagaimana tanda tangan BOM berbeda. Alat pengajaran praktis untuk kursus internasionalisasi dan pengodean karakter.
Apa Itu Byte Order Mark (BOM)?
Byte Order Mark (BOM) adalah karakter Unicode (U+FEFF) yang ditempatkan di awal file teks untuk menunjukkan pengodean dan urutan byte-nya. BOM dirancang untuk menyelesaikan masalah mendasar pada pengodean multi-byte: arsitektur komputer yang berbeda menyimpan nilai multi-byte dalam urutan byte yang berbeda (endianness). Dengan membaca beberapa byte pertama file, program dapat menentukan apakah teks dikodekan dalam UTF-8, UTF-16 Big Endian, UTF-16 Little Endian, atau format lain, dan menafsirkan byte berikutnya dengan benar. BOM ditetapkan dalam standar Unicode dan dikenali oleh banyak editor teks, peramban web, dan runtime bahasa pemrograman.
Bagaimana Detektor BOM Kami Bekerja
- Pembacaan File: saat Anda mengunggah file, alat kami membaca 1024 byte pertama menggunakan API FileReader browser. Hanya header yang dibaca, sehingga proses deteksi tetap cepat bahkan untuk file besar.
- Pencocokan Tanda Tangan BOM: byte di awal file dibandingkan dengan basis data 10 tanda tangan BOM yang dikenal. Setiap tanda tangan diperiksa byte demi byte untuk kecocokan persis. Jika BOM ditemukan, pengodean, endianness, dan charset IANA diidentifikasi.
- Pemindaian Mendalam: selain memeriksa awal file, alat ini memindai lebih dalam (hingga 128 byte) untuk pola mirip BOM lainnya. Ini membantu mendeteksi file yang digabung atau struktur file tidak biasa yang mungkin memiliki BOM pada offset bukan nol.
- Pembuatan Rekomendasi: berdasarkan pengodean yang terdeteksi, alat ini memberikan rekomendasi yang disesuaikan untuk kompatibilitas lintas platform, efisiensi penyimpanan, dan interoperabilitas alat.
Kapan Menggunakan (dan Tidak Menggunakan) BOM
- UTF-8 dengan BOM (EF BB BF): umum di Windows tetapi dapat menyebabkan masalah di Unix/Linux. Skrip PHP dengan BOM akan menyebabkan error «headers already sent». Skrip Python dapat gagal pada baris shebang. Skrip shell dapat rusak secara diam-diam. Direkomendasikan: gunakan UTF-8 tanpa BOM untuk konten web dan kode sumber.
- BOM UTF-16 (FE FF / FF FE): penting untuk mengidentifikasi urutan byte pada file UTF-16. Diperlukan oleh beberapa API Windows dan aplikasi .NET. Namun, file UTF-16 lebih sulit diproses dengan alat Unix standar (grep, sed, awk) dan memakan lebih banyak ruang untuk konten yang banyak ASCII.
- BOM UTF-32 (00 00 FE FF / FF FE 00 00): sangat jarang digunakan. UTF-32 melipatgandakan ukuran penyimpanan hingga empat kali dibanding UTF-8 untuk sebagian besar teks dan hanya didukung sedikit aplikasi. Tidak direkomendasikan untuk penggunaan umum.
- BOM Non-Unicode: BOM GB 18030 digunakan di sistem pemerintah Tiongkok. Penanda pengodean lain (UTF-7, SCSU, BOCU-1, UTF-1) sudah usang atau sangat jarang di aplikasi modern.
Privasi, Keamanan & Keterbatasan
Detektor BOM kami memproses semuanya sepenuhnya di browser Anda. Hanya 1024 byte pertama setiap file yang dibaca - tidak ada data yang pernah diunggah ke server mana pun. Alat ini 100 % gratis tanpa pendaftaran, tanpa akun, dan tanpa batas penggunaan.
Tanda tangan BOM yang didukung: UTF-8, UTF-16 BE/LE, UTF-32 BE/LE, UTF-7, UTF-1, SCSU, BOCU-1, dan GB 18030 - mencakup semua tanda tangan BOM standar yang ditetapkan dalam standar Unicode dan spesifikasi pengodean terkait.
Keterbatasan: deteksi BOM hanya mengidentifikasi penanda pengodean - alat ini tidak memvalidasi apakah sisa file sesuai dengan pengodean tersebut. File tanpa BOM (seperti sebagian besar file UTF-8 di Unix/Linux) akan ditampilkan sebagai «BOM Tidak Ditemukan». File biner bisa kebetulan diawali byte yang cocok dengan tanda tangan BOM, berpotensi menghasilkan positif palsu. Alat ini hanya membaca 1024 byte pertama; BOM di luar rentang ini tidak akan terdeteksi.
Pertanyaan yang Sering Diajukan
Byte Order Mark (BOM) adalah karakter Unicode (U+FEFF) yang dikodekan di awal file teks yang mengidentifikasi pengodean dan urutan byte yang digunakan. Ini membantu perangkat lunak menafsirkan pengodean teks dengan benar tanpa menebak.
Detektor BOM kami mendukung 10 tanda tangan BOM: UTF-8 dengan BOM, UTF-16 Big Endian, UTF-16 Little Endian, UTF-32 Big Endian, UTF-32 Little Endian, UTF-7, UTF-1, SCSU, BOCU-1, dan GB 18030.
UTF-8 tanpa BOM direkomendasikan untuk kompatibilitas lintas platform, terutama untuk pengembangan web dan kode sumber. BOM dapat menyebabkan masalah pada PHP, Python, dan skrip shell di sistem Unix/Linux.
Ya. File biner bisa kebetulan diawali byte yang cocok dengan tanda tangan BOM. Pertimbangkan konteks jenis file saat menafsirkan hasil.
1024 byte pertama (1 KB) dibaca, yang lebih dari cukup karena BOM paling panjang hanya 4 byte.
Ya. Hanya 1024 byte pertama yang dibaca dan semua pemrosesan dilakukan di browser - tidak ada data yang pernah diunggah.
Alat ini melaporkan «BOM Tidak Ditemukan» untuk file tanpa BOM. Sebagian besar file UTF-8 di Unix/Linux/macOS disimpan tanpa BOM, yang merupakan praktik yang direkomendasikan.
Ya! 100 % gratis tanpa pendaftaran, tanpa akun, tanpa kunci API, dan tanpa batas penggunaan.