Детектор кодировки текста
Вставьте текст или загрузите файл, чтобы мгновенно определить его кодировку. Детектор кодировки текста проверяет метки порядка байтов (BOM), проверяет последовательности байтов UTF-8 и использует статистический анализ для идентификации кодировки с оценками достоверности. Обнаруживает UTF-8, UTF-16, UTF-32, ISO-8859-1–ISO-8859-15, Windows-1252, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437 и другие — вся обработка выполняется локально в вашем браузере, без загрузки, нет регистрация, совершенно бесплатно.
Paste text or upload a file to detect its character encoding. The tool checks for Byte Order Marks (BOM), validates UTF-8 sequences, and uses statistical analysis to identify the encoding with a confidence score. Detects UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, Big5, KOI8-R, and more - all processing runs locally in your browser.
Ctrl+Enter to detect encoding · 0 characters
Зачем использовать наш детектор кодировки текста?
- Обнаруживает более 15 кодировок символов: детектор кодировки текста определяет UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), от ISO-8859-1 до ISO-8859-15, Windows-1252, Windows-1251, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, КОИ8-У, MacRoman, IBM437 и другие. Каждое обнаружение включает оценку достоверности, которая поможет вам выбрать правильную кодировку.
- Спецификация и статистический анализ: инструмент сначала проверяет метки порядка байтов (BOM) — точный способ идентификации кодировок UTF. Если спецификация не найдена, он использует статистический анализ: проверку последовательности байтов UTF-8, сопоставление с образцом старших байтов, анализ частоты символов и распределение нулевых байтов для определения кодировки с высокой точностью.
- Полная справка по кодированию: каждая обнаруженная кодировка включает удобочитаемую метку, категорию (Юникод, западная, кириллица, японский, китайский и т. д.) и краткое описание. Инструмент также показывает все псевдонимы кодировки (например, «latin1», «cp1252», «sjis»), поэтому вы можете использовать правильное имя в своем коде или конфигурации базы данных.
- 100% конфиденциальная обработка в браузере: ваш текст и файлы никогда не покидают ваше устройство. Все обнаружение кодировки — от сканирования спецификации до статистического анализа — происходит локально с помощью TextEncoder браузера и типизированных массивов. Никакой загрузки на сервер, никакой регистрации данных, никакой регистрации. Полностью бесплатно и конфиденциально.
Распространенные случаи использования детектора кодирования текста
- Восстановление экспорта базы данных: когда базы данных экспортируют дампы CSV или SQL с неправильными объявлениями кодировки, используйте детектор кодировки текста, чтобы определить фактическую кодировку экспортируемых данных. Это важно при импорте устаревших данных или восстановлении контента из неправильно настроенного экспорта с искаженным текстом.
- Веб-скрапинг и интеграция API. При очистке веб-сайтов или использовании API, кодировка которых не указана, перед обработкой определите кодировку тела ответа. Детектор кодировки текста помогает вам идентифицировать UTF-8, Shift-JIS, GB2312 и другие кодировки, обычно используемые в международном веб-контенте.
- Преобразование устаревших документов: конвертируйте устаревшие документы, сохраненные в Windows-1252, MacRoman, IBM437 или других устаревших кодировках, в современную UTF-8. Сначала определите исходную кодировку, а затем используйте эту информацию для правильного перекодирования файла без потери акцентированных символов, символов или специального форматирования.
- Отладка Mojibake (искаженный текст). Когда текст отображается в виде искаженных символов (mojibake — например, «Ã©» вместо «é»), используйте детектор кодировки текста на необработанных байтах, чтобы определить фактическую кодировку. Сравните обнаруженную кодировку с объявленной кодировкой, чтобы диагностировать и устранить несоответствие.
- Анализ многоязычного контента: при обработке многоязычного контента, в котором смешаны алфавиты — кириллица, японский, китайский, арабский, иврит, корейский — детектор кодировки текста определяет кодировку, используемую для каждого текстового сегмента. Незаменим для проектов локализации, рабочих процессов перевода и международной миграции CMS.
- Проверка кодировки загрузки файлов. При создании приложений, которые принимают загрузку файлов, перед обработкой убедитесь, что загруженный файл использует ожидаемую кодировку. Детектор кодировки текста можно использовать для проверки того, что файлы CSV, файлы конфигурации или экспортированные данные используют UTF-8 или другую необходимую кодировку.
Что такое обнаружение кодировки текста?
Обнаружение кодировки текста — это процесс определения того, какая кодировка символов использовалась для кодирования последовательности байтов в читаемый текст. При сохранении текста в файл его символы преобразуются в байты по схеме кодировки — UTF-8, Windows-1252, Shift-JIS и другие. Детектор кодировки текста анализирует шаблоны байтов, ищет метки порядка байтов (BOM), проверяет последовательности UTF-8 и использует статистический анализ, чтобы определить, какая кодировка наиболее вероятна, помогая правильно интерпретировать искаженный или неизвестный текст.
Как работает наш детектор кодировки текста
- Введите текст или файл. Вставьте текст непосредственно в текстовую область или загрузите файл. Инструмент считывает необработанные байты, используя API FileReader браузера. Если вы вставляете текст, он кодирует его как байты UTF-8 для анализа. Вся обработка локальная — ничего не загружается ни на один сервер.
- Сканирование метки порядка байтов (BOM). Инструмент проверяет первые байты данных на наличие известных подписей спецификации. Если спецификация найдена (EF BB BF для UTF-8, FF FE для UTF-16LE, FE FF для UTF-16BE и т. д.), кодировка определяется почти наверняка. Обнаружение спецификации является наиболее надежным методом и имеет приоритет.
- Статистический анализ кодировки. Если спецификация не найдена, инструмент выполняет многоуровневый статистический анализ: проверка последовательности байтов UTF-8 (проверка правильных многобайтовых последовательностей и отклонение слишком длинных/суррогатных кодировок), анализ распределения нулевых байтов для обнаружения UTF-16/UTF-32, сопоставление высокобайтовых шаблонов для однобайтовых кодировок (ISO-8859-1, Windows-1252, KOI8-R) и проверка диапазона ASCII для 7-битный текст ASCII.
Поддерживаемые методы обнаружения кодировки
- Обнаружение спецификации (метки порядка байтов): идентифицирует 11 подписей спецификации, включая UTF-8 (EF BB BF), UTF-16BE/LE, UTF-32BE/LE, UTF-7, UTF-1, SCSU, BOCU-1 и GB-18030. Обнаружение спецификации дает >99% достоверности и является золотым стандартом для кодировок Unicode.
- Проверка UTF-8: полная проверка в соответствии с RFC 3629, проверка правильных начальных байтов (0xC2-0xDF, 0xE0-0xEF, 0xF0-0xF4), допустимых байтов продолжения (0x80-0xBF), отклонения слишком длинных последовательностей, суррогатных половин (0xED 0xA0+) и кодовых точек выше U+10FFFF (0xF4). 0x90+).
- Статистическое обнаружение UTF-16: анализирует позиции нулевых байтов, чтобы отличить обратный порядок байтов от прямого в тексте, закодированном UTF-16. Сканирует символы диапазона ASCII (где один байт — 0x00, а другой — 0x20–0x7E) для определения порядка байтов.
- Обнаружение однобайтовой кодировки: использует анализ частоты символов и проверку допустимого диапазона байтов для семейств ISO-8859, кодовых страниц Windows (1250, 1251, 1252), KOI8-R/U, MacRoman и IBM437/850/866. Windows-1252 отличается от ISO-8859-1 обнаружением байтов 0x80-0x9F, которые действительны в Windows-1252, но не в ISO-8859-1.
Конфиденциальность, безопасность и доступность
Детектор кодировки текста обрабатывает все локально в вашем браузере. Никакие текстовые или файловые данные никогда не загружаются на какой-либо сервер — все сканирование спецификации, проверка UTF-8 и статистический анализ выполняются на вашем устройстве с использованием TextEncoder браузера и типизированных массивов. Никаких требований к регистрации, ограничений на использование, дополнительных функций и регистрации данных нет. Этот инструмент совершенно бесплатен для любых целей: отладки mojibake, анализа устаревших файлов или изучения кодировок символов.
Часто задаваемые вопросы
Детектор кодировки текста анализирует необработанные байты и определяет, какая кодировка символов использовалась для создания текста. Он обнаруживает UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, KOI8-R и другие путем поиска меток порядка байтов (BOM), проверки последовательностей байтов UTF-8 и статистического анализа шаблонов высоких байтов. Это важно для исправления искаженного текста (моджибаке) и правильной интерпретации устаревших файлов.
Инструмент обнаруживает более 30 кодировок: UTF-8, UTF-16BE/LE, UTF-32BE/LE, ASCII (7-бит), от ISO-8859-1 до ISO-8859-15, Windows-1252, Windows-1251, Windows-1250, Shift-JIS, EUC-JP, ISO-2022-JP, GB2312, GBK, GB. 18030, Big5, Big5-HKSCS, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437, IBM850 и IBM866. Для каждого обнаружения отображается показатель достоверности и используемый метод обнаружения.
Метка порядка байтов (BOM) — это специальная последовательность байтов в начале текстового файла, которая объявляет его кодировку и порядок байтов. Например, EF BB BF указывает UTF-8, FE FF указывает UTF-16BE, а FF FE указывает UTF-16LE. Спецификации — наиболее надежный способ определения кодировок. Инструмент обнаруживает 11 различных сигнатур спецификации, включая UTF-7, SCSU, BOCU-1 и GB-18030.
Обнаружение на основе спецификации имеет точность 99 %, поскольку спецификации являются явными маркерами кодирования. Статистическая точность обнаружения зависит от объема текста и различимости кодировки. Для текста с множеством высокобайтовых символов точность очень высока. Для короткого текста только в формате ASCII допустимыми могут оказаться несколько кодировок — инструмент показывает все возможности, ранжированные по степени достоверности.
Да – переключитесь на вкладку «Загрузить файл», чтобы выбрать файл с вашего устройства. Инструмент считывает файл как необработанные байты с помощью API FileReader браузера и выполняет весь анализ локально. Поддерживаются файлы размером до 1 МБ. Никакие данные никогда не отправляются на сервер.
Статистика байтов показывает: количество и процент печатаемых символов ASCII (байты 0x20–0x7E), количество нулевых байтов (0x00 — высокие значения указывают на UTF-16 или двоичные данные), большое количество байтов (>0x7F — указывает на содержимое, отличное от ASCII), а также текстовую/двоичную классификацию. На гистограмме байтов каждый байт также имеет цветовую кодировку: печатный ASCII (зеленый), старший байт (синий) или нулевой байт (красный) для облегчения визуального анализа.
Инструмент выполняет полную проверку UTF-8 в соответствии с RFC 3629, проверяя правильность начальных байтов (0xC2–0xF4), правильных байтов продолжения (0x80–0xBF), отклонение слишком длинных последовательностей, суррогатных половин и кодовых точек выше U+10FFFF. Если весь поток байтов проходит все проверки, UTF-8 сообщается с высокой степенью достоверности.
ISO-8859-1 и Windows-1252 идентичны для байтов 0xA0-0xFF, но различаются в диапазоне 0x80-0x9F. В ISO-8859-1 эти байты являются управляющими символами. В Windows-1252 они содержат печатные символы, такие как кавычки, тире, знак евро (€) и символы товарных знаков. Инструмент обнаруживает байты, специфичные для Windows-1252, чтобы различать две кодировки.
Да – 100% бесплатно, навсегда. Без регистрации, без учетной записи, без премиум-уровня, без ограничений на использование и без рекламы. Определите кодировку для любого количества текста. Вся обработка выполняется локально в вашем браузере без загрузки на сервер.