Lompat ke konten
Aback Tools Logo

Detektor Pengkodean Teks

Tempelkan teks atau unggah file untuk langsung mendeteksi pengkodean karakternya. Detektor Pengkodean Teks memeriksa Tanda Urutan Byte (BOM), memvalidasi urutan byte UTF-8, dan menggunakan analisis statistik untuk mengidentifikasi pengkodean dengan skor keyakinan. Mendeteksi UTF-8, UTF-16, UTF-32, ISO-8859-1 hingga ISO-8859-15, Windows-1252, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437, dan banyak lagi - semua pemrosesan berjalan secara lokal di browser Anda, tanpa unggahan, tanpa pendaftaran, sepenuhnya gratis.

Text Encoding Detector

Paste text or upload a file to detect its character encoding. The tool checks for Byte Order Marks (BOM), validates UTF-8 sequences, and uses statistical analysis to identify the encoding with a confidence score. Detects UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, Big5, KOI8-R, and more - all processing runs locally in your browser.

Ctrl+Enter to detect encoding · 0 characters

Mengapa Menggunakan Detektor Pengkodean Teks Kami?

  • Mendeteksi 15+ Pengkodean Karakter: Detektor Pengkodean Teks mengidentifikasi UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), ISO-8859-1 hingga ISO-8859-15, Windows-1252, Windows-1251, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437, dan banyak lagi. Setiap deteksi menyertakan skor keyakinan untuk membantu Anda memilih pengkodean yang tepat.
  • BOM & Analisis Statistik: Alat ini pertama-tama memeriksa Byte Order Marks (BOM) - cara pasti untuk mengidentifikasi pengkodean UTF. Jika tidak ada BOM yang ditemukan, ia menggunakan analisis statistik: validasi urutan byte UTF-8, pencocokan pola byte tinggi, analisis frekuensi karakter, dan distribusi byte nol untuk mengidentifikasi pengkodean dengan akurasi tinggi.
  • Referensi Pengkodean Komprehensif: Setiap pengkodean yang terdeteksi mencakup label yang dapat dibaca manusia, kategori (Unicode, Barat, Sirilik, Jepang, Cina, dll.), dan deskripsi singkat. Alat ini juga menampilkan semua alias pengkodean (misalnya, "latin1", "cp1252", "sjis") sehingga Anda dapat menggunakan nama yang tepat dalam kode atau konfigurasi database Anda.
  • 100% Pemrosesan Browser Pribadi: Teks dan file Anda tidak pernah meninggalkan perangkat Anda. Semua deteksi pengkodean - mulai dari pemindaian BOM hingga analisis statistik - terjadi secara lokal menggunakan browser TextEncoder dan array yang diketik. Tidak ada unggahan server, tidak ada pencatatan data, tidak perlu mendaftar. Sepenuhnya gratis dan pribadi.

Kasus Penggunaan Umum untuk Detektor Pengodean Teks

  • Pemulihan Ekspor Basis Data: Ketika database mengekspor dump CSV atau SQL dengan deklarasi pengkodean yang salah, gunakan Detektor Pengkodean Teks untuk mengidentifikasi pengkodean sebenarnya dari data yang diekspor. Hal ini penting ketika mengimpor data lama atau memulihkan konten dari ekspor yang salah dikonfigurasi dengan teks yang kacau.
  • Pengikisan Web & Integrasi API: Saat menggores situs web atau menggunakan API yang tidak mendeklarasikan rangkaian karakternya, deteksi pengkodean isi respons sebelum memproses. Detektor Pengkodean Teks membantu Anda mengidentifikasi UTF-8, Shift-JIS, GB2312, dan pengkodean lain yang biasa digunakan dalam konten web internasional.
  • Konversi Dokumen Lama: Konversikan dokumen lama yang disimpan di Windows-1252, MacRoman, IBM437, atau pengkodean lama lainnya ke UTF-8 modern. Pertama-tama deteksi pengkodean asli, lalu gunakan informasi tersebut untuk mentranskode file dengan benar tanpa kehilangan karakter beraksen, simbol, atau format khusus.
  • Men-debug Mojibake (Teks Berkaca-kaca): Saat teks ditampilkan sebagai karakter kacau (mojibake - seperti "é" dan bukan "é"), gunakan Detektor Pengkodean Teks pada byte mentah untuk menentukan pengkodean sebenarnya. Bandingkan pengkodean yang terdeteksi dengan pengkodean yang dinyatakan untuk mendiagnosis dan memperbaiki ketidakcocokan.
  • Analisis Konten Multibahasa: Saat memproses konten multibahasa yang menggabungkan skrip - Sirilik, Jepang, Cina, Arab, Ibrani, Korea - Detektor Pengkodean Teks mengidentifikasi pengkodean yang digunakan untuk setiap segmen teks. Penting untuk proyek pelokalan, alur kerja terjemahan, dan migrasi CMS internasional.
  • Validasi Pengkodean Unggahan File: Saat membangun aplikasi yang menerima unggahan file, validasi bahwa file yang diunggah menggunakan pengkodean yang diharapkan sebelum diproses. Detektor Pengkodean Teks dapat digunakan untuk memverifikasi bahwa file CSV, file konfigurasi, atau ekspor data menggunakan UTF-8 atau pengkodean lain yang diperlukan.

Apa itu Deteksi Pengkodean Teks?

Deteksi pengkodean teks adalah proses mengidentifikasi pengkodean karakter mana yang digunakan untuk menyandikan urutan byte menjadi teks yang dapat dibaca. Saat teks disimpan ke file, karakternya diubah menjadi byte sesuai dengan skema pengkodean - UTF-8, Windows-1252, Shift-JIS, dan lainnya. Detektor Pengkodean Teks menganalisis pola byte, mencari Tanda Urutan Byte (BOM), memvalidasi urutan UTF-8, dan menggunakan analisis statistik untuk menentukan pengkodean mana yang paling mungkin, membantu Anda menafsirkan teks yang kacau atau tidak dikenal dengan benar.

Cara Kerja Detektor Pengodean Teks Kami

  1. Masukkan teks atau file - Tempelkan teks langsung ke area teks atau unggah file. Alat ini membaca byte mentah menggunakan browser FileReader API. Jika Anda menempelkan teks, teks akan dikodekan sebagai UTF-8 byte untuk dianalisis. Semua pemrosesan bersifat lokal - tidak ada yang diunggah ke server mana pun.
  2. Pemindaian Byte Order Mark (BOM) - Alat ini memeriksa byte pertama data untuk tanda tangan BOM yang diketahui. Jika BOM ditemukan (EF BB BF untuk UTF-8, FF FE untuk UTF-16LE, FE FF untuk UTF-16BE, dll.), pengkodeannya diidentifikasi dengan hampir pasti. Deteksi BOM adalah metode yang paling andal dan menjadi prioritas.
  3. Analisis pengkodean statistik - Jika tidak ada BOM yang ditemukan, alat akan melakukan analisis statistik multi-lapis: validasi urutan byte UTF-8 (memeriksa urutan multi-byte yang tepat dan menolak pengkodean yang terlalu panjang/pengganti), analisis distribusi byte nol untuk deteksi UTF-16/UTF-32, pencocokan pola byte tinggi untuk pengkodean byte tunggal (ISO-8859-1, Windows-1252, KOI8-R), dan pemeriksaan rentang ASCII untuk 7-bit teks ASCII.

Metode Deteksi Pengkodean yang Didukung

  • Deteksi BOM (Byte Order Mark): Mengidentifikasi 11 tanda tangan BOM termasuk UTF-8 (EF BB BF), UTF-16BE/LE, UTF-32BE/LE, UTF-7, UTF-1, SCSU, BOCU-1, dan GB-18030. Deteksi BOM memberikan kepercayaan >99% dan merupakan standar emas untuk pengkodean Unicode.
  • Validasi UTF-8: Validasi penuh yang sesuai dengan RFC 3629 memeriksa byte awal yang tepat (0xC2-0xDF, 0xE0-0xEF, 0xF0-0xF4), byte kelanjutan yang valid (0x80-0xBF), penolakan urutan yang terlalu panjang, bagian pengganti (0xED 0xA0+), dan titik kode di atas U+10FFFF (0xF4 0x90+).
  • Deteksi Statistik UTF-16: Menganalisis posisi byte nol untuk membedakan big-endian dari little-endian dalam teks berkode UTF-16. Memindai karakter rentang ASCII (satu byte adalah 0x00 dan yang lainnya adalah 0x20-0x7E) untuk menentukan urutan byte.
  • Deteksi Pengkodean Byte Tunggal: Menggunakan analisis frekuensi karakter dan pemeriksaan rentang byte yang valid untuk keluarga ISO-8859, halaman kode Windows (1250, 1251, 1252), KOI8-R/U, MacRoman, dan IBM437/850/866. Windows-1252 dibedakan dari ISO-8859-1 dengan mendeteksi byte 0x80-0x9F yang valid di Windows-1252 tetapi tidak di ISO-8859-1.

Privasi, Keamanan & Ketersediaan

Detektor Pengkodean Teks memproses semuanya secara lokal di browser Anda. Tidak ada data teks atau file yang diunggah ke server mana pun - semua pemindaian BOM, validasi UTF-8, dan analisis statistik dilakukan di perangkat Anda menggunakan browser TextEncoder dan array yang diketik. Tidak ada persyaratan pendaftaran, tidak ada batasan penggunaan, tidak ada fitur premium, dan tidak ada pencatatan data. Alat ini sepenuhnya gratis untuk tujuan apa pun - men-debug mojibake, menganalisis file lama, atau mempelajari tentang pengkodean karakter.

Pertanyaan yang Sering Diajukan

Detektor Pengkodean Teks menganalisis byte mentah dan menentukan pengkodean karakter mana yang digunakan untuk membuat teks. Ini mendeteksi UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, KOI8-R, dan banyak lagi dengan mencari Byte Order Marks (BOM), memvalidasi urutan byte UTF-8, dan menganalisis pola byte tinggi secara statistik. Ini penting untuk memperbaiki teks yang kacau (mojibake) dan menafsirkan file lama dengan benar.

Alat ini mendeteksi lebih dari 30 pengkodean: UTF-8, UTF-16BE/LE, UTF-32BE/LE, ASCII (7-bit), ISO-8859-1 hingga ISO-8859-15, Windows-1252, Windows-1251, Windows-1250, Shift-JIS, EUC-JP, ISO-2022-JP, GB2312, GBK, GB 18030, Big5, Big5-HKSCS, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437, IBM850, dan IBM866. Setiap deteksi menunjukkan skor kepercayaan dan metode deteksi yang digunakan.

Tanda Urutan Byte (BOM) adalah urutan byte khusus di awal file teks yang mendeklarasikan pengkodean dan urutan byte. Misalnya, EF BB BF menunjukkan UTF-8, FE FF menunjukkan UTF-16BE, dan FF FE menunjukkan UTF-16LE. BOM adalah cara paling andal untuk mengidentifikasi pengkodean. Alat ini mendeteksi 11 tanda tangan BOM yang berbeda termasuk UTF-7, SCSU, BOCU-1, dan GB-18030.

Deteksi berbasis BOM 99% akurat karena BOM merupakan penanda pengkodean eksplisit. Akurasi deteksi statistik bergantung pada jumlah teks dan kekhasan pengkodean. Untuk teks dengan banyak karakter byte tinggi, akurasinya sangat tinggi. Untuk teks pendek khusus ASCII, beberapa pengkodean mungkin tampak valid - alat ini menunjukkan semua kemungkinan yang diberi peringkat berdasarkan keyakinan.

Ya - beralih ke tab "Unggah File" untuk memilih file dari perangkat Anda. Alat ini membaca file sebagai byte mentah menggunakan API FileReader browser dan melakukan semua analisis secara lokal. File hingga 1 MB didukung. Tidak ada data yang dikirim ke server.

Statistik byte menunjukkan: jumlah dan persentase karakter ASCII yang dapat dicetak (byte 0x20-0x7E), jumlah byte nol (0x00 - jumlah tinggi menunjukkan UTF-16 atau data biner), jumlah byte tinggi (>0x7F - menunjukkan konten non-ASCII), dan klasifikasi teks/biner. Histogram byte juga memberi kode warna pada setiap byte sebagai ASCII yang dapat dicetak (hijau), byte tinggi (biru), atau byte nol (merah) untuk memudahkan analisis visual.

Alat ini melakukan validasi UTF-8 yang sesuai dengan RFC 3629, memeriksa byte awal yang tepat (0xC2-0xF4), byte kelanjutan yang benar (0x80-0xBF), penolakan urutan yang terlalu panjang, separuh pengganti, dan titik kode di atas U+10FFFF. Jika seluruh aliran byte melewati semua pemeriksaan, UTF-8 dilaporkan dengan skor keyakinan tinggi.

ISO-8859-1 dan Windows-1252 identik untuk byte 0xA0-0xFF tetapi berbeda dalam kisaran 0x80-0x9F. Dalam ISO-8859-1, byte ini adalah karakter kontrol. Di Windows-1252, mereka berisi karakter yang dapat dicetak seperti kutipan cerdas, tanda hubung, tanda Euro (€), dan simbol merek dagang. Alat ini mendeteksi byte khusus Windows-1252 untuk membedakan dua pengkodean.

Ya - 100% gratis, selamanya. Tanpa pendaftaran, tanpa akun, tanpa tingkat premium, tanpa batasan penggunaan, dan tanpa iklan. Deteksi pengkodean teks sebanyak yang Anda perlukan. Semua pemrosesan dilakukan secara lokal di browser Anda tanpa unggahan server.