Перейти к содержимому
Aback Tools Logo

Детектор метки порядка байтов (BOM)

Обнаружение метки порядка байтов (BOM) в начале любого файла или вставленного текста. Наш детектор меток порядка байтов считывает первые байты и сравнивает их со всеми известными сигнатурами спецификации, показывая шестнадцатеричную последовательность, интерпретируемую кодировку и порядок байтов. Поддерживает UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), UTF-7, SCSU, BOCU-1 и GB-18030. Загрузите любой файл или вставьте текст, чтобы проверить наличие скрытых символов спецификации. Вся обработка выполняется локально в вашем браузере — без загрузки, без регистрации, совершенно бесплатно.

Detect Byte Order Mark (BOM)

Upload a file or paste text to detect BOM (Byte Order Mark) at the start. Shows hex sequence, encoding, and endianness.

Drop your file here

or click to browse (any file type supported)

Зачем использовать наш детектор меток порядка байтов?

  • Комплексное обнаружение спецификации: наш детектор спецификации сканирует первые байты любого файла или вставленного текста, чтобы обнаружить все известные подписи меток порядка байтов. Поддерживает кодировки UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), UTF-7, UTF-1, SCSU, BOCU-1 и GB-18030 с автоматической идентификацией.
  • 100% приватная обработка в браузере: детектор спецификации обрабатывает все локально в вашем браузере. Ваши файлы и текст никогда не покидают ваше устройство, обеспечивая полную конфиденциальность конфиденциальных документов и анализа данных.
  • Мгновенный анализ файлов и текста. Получите немедленные результаты с помощью нашего онлайн-детектора спецификаций. Загрузите любой файл или вставьте текст и получите подробный отчет, показывающий обнаруженные сигнатуры спецификации, шестнадцатеричные последовательности, кодировку, порядок байтов и анализ на уровне байтов за миллисекунды.
  • Интерактивный шестнадцатеричный дамп и справочная таблица: просмотр шестнадцатеричного дампа с цветовой кодировкой первых 16 байтов с выделенными последовательностями спецификации. Полная справочная таблица всех известных сигнатур спецификаций поможет вам понять каждый формат кодирования и его характеристики.

Распространенные случаи использования детектора меток порядка байтов

  • Отладка проблем спецификации UTF-8 в сценариях. Разработчики используют наш детектор спецификации для выявления скрытых байтов спецификации UTF-8 в начале сценариев оболочки, файлов Python и файлов JavaScript, которые вызывают загадочные синтаксические ошибки или сбои shebang при выполнении в системах на базе Unix.
  • Устранение неполадок с кодированием CSV и файлов данных. Аналитики данных используют детектор спецификации для выявления символов спецификации в CSV и файлах данных, которые вызывают ошибки анализа в таких инструментах, как Python pandas, Excel и утилиты импорта базы данных, обеспечивая чистую обработку данных.
  • Веб-разработка и проверка HTML. Веб-разработчики используют наш детектор спецификации для проверки случайных байтов спецификации в файлах HTML, CSS и JavaScript, которые могут вызвать проблемы с отрисовкой пробелов, неожиданные символы в макетах страниц или предупреждения валидатора.
  • Анализ межплатформенной кодировки файлов. Системные администраторы используют детектор спецификации для анализа файлов, передаваемых между системами Windows (которая часто добавляет спецификацию UTF-16 LE), macOS и Linux, выявляя несоответствия кодировки, которые вызывают повреждение файлов или проблемы с отображением.
  • Отладка полезных данных API и JSON. Разработчики API используют наш детектор спецификации для идентификации символов спецификации в полезных нагрузках JSON и ответах API, которые вызывают сбои JSON.parse, неожиданные последовательности байтов или проблемы согласования типа контента.
  • Текстовый редактор и конфигурация IDE. Пользователи настраивают свои текстовые редакторы и IDE с помощью нашего детектора спецификации, чтобы проверить, добавляют ли их инструменты маркеры спецификации в файлы, что помогает им принимать обоснованные решения о настройках кодирования в VS Code, Sublime Text и IntelliJ.

Что такое метка порядка байтов (BOM)?

Метка порядка байтов (BOM) — это специальный символ Юникода (U+FEFF ZERO WIDTH NO-BREAK SPACE), помещаемый в начале текстового файла или потока для указания типа кодировки и порядка байтов (порядка байтов) данных. Спецификация действует как подпись, которая помогает программному обеспечению правильно интерпретировать кодировку следующего текста. Для кодировок UTF-16 и UTF-32 спецификация конкретно определяет, расположены ли байты в порядке с прямым порядком байтов (сначала наиболее значимый байт) или с прямым порядком байтов (сначала наименее значащий байт). Хотя UTF-8 не имеет порядка байтов, его спецификация (EF BB BF) обычно используется приложениями Windows для маркировки файлов как кодированных UTF-8. Наш детектор меток порядка байтов считывает первые байты любого файла и сравнивает их с обширной базой данных известных сигнатур спецификации, чтобы мгновенно определить кодировку.

Как работает наш детектор меток порядка байтов

  1. Чтение двоичных данных. Детектор спецификации считывает необработанные байты из загруженного файла или кодирует вставленный текст в байты с использованием кодировки UTF-8. Для точного определения спецификации необходимы только первые 16 байтов, что делает процесс чрезвычайно быстрым даже для очень больших файлов.
  2. Сопоставление подписей спецификации: детектор сравнивает начальные байты со всеми известными подписями спецификации, включая UTF-8 (EF BB BF), UTF-16 BE (FE FF), UTF-16 LE (FF FE), UTF-32 BE (00 00 FE FF), UTF-32 LE (FF FE 00 00), UTF-7 (2B 2F 76 38), SCSU (0E). FE FF), BOCU-1 (FB EE 28) и GB-18030 (84 31 95 33). Если это применимо, сообщается о множественных совпадениях.
  3. Представление результатов: Детектор отображает четкий вердикт, шестнадцатеричный дамп с цветовой кодировкой и выделенными байтами спецификации, подробную информацию о кодировании, включая порядок байтов и длину байта, а также полную справочную таблицу всех известных сигнатур спецификации для образовательных целей.

Что показывает наш детектор BOM

  • Тип кодировки: Детектор определяет используемый стандарт кодировки Unicode — UTF-8, UTF-16 (с порядком байтов), UTF-32 (с порядком байтов) или другие устаревшие кодировки Unicode, такие как UTF-7, SCSU или BOCU-1.
  • Порядок байтов: для многобайтовых кодировок, таких как UTF-16 и UTF-32, детектор определяет, находятся ли байты в порядке с прямым порядком байтов (сетевой порядок) или с прямым порядком байтов, что имеет решающее значение для правильной интерпретации текстовых данных.
  • Шестнадцатеричная последовательность: точная шестнадцатеричная последовательность байтов обнаруженной спецификации отображается вместе с визуальным шестнадцатеричным дампом первых 16 байтов, при этом байты спецификации выделены для облегчения идентификации.
  • Анализ на уровне байтов: детектор показывает необработанное шестнадцатеричное и ASCII-представление начальных байтов файла, помогая понять двоичную структуру независимо от наличия спецификации.

Конфиденциальность, безопасность и лучшие практики

Ваша конфиденциальность имеет первостепенное значение. Наш детектор BOM выполняет весь анализ полностью в вашем браузере с использованием JavaScript — данные файлов не загружаются ни на один сервер, и ничего не покидает ваше устройство. Это гарантирует, что конфиденциальные документы и конфиденциальные данные останутся полностью конфиденциальными. Детектор абсолютно бесплатен и не имеет ограничений по размеру файла (для анализа считываются только первые 16 байт). Обратите внимание: хотя спецификация помогает определить кодировку, не все файлы ее имеют — во многих файлах UTF-8, особенно в системах Unix/Linux, спецификация намеренно отсутствует. Инструменты и сценарии должны корректно обрабатывать как файлы спецификации, так и файлы без спецификации для максимальной совместимости между платформами.

Часто задаваемые вопросы

Метка порядка байтов (BOM) — это символ Юникода (U+FEFF), размещаемый в начале текстового файла или потока для указания типа кодировки и порядка байтов. Он действует как подпись файла, которая помогает программному обеспечению правильно интерпретировать кодировку текстовых данных, следующих за последовательностью спецификации.

Шестнадцатеричная последовательность EF BB BF представляет собой спецификацию UTF-8. Обычно он добавляется приложениями Windows, такими как Блокнот, при сохранении файлов в формате UTF-8. Хотя UTF-8 не имеет порядка байтов, эта спецификация идентифицирует файл как кодированный UTF-8. Многие инструменты Unix и Linux не ожидают эту спецификацию и могут не правильно проанализировать файл.

Спецификацию можно удалить с помощью шестнадцатеричного редактора, повторно сохранив файл с помощью команды «Сохранить как UTF-8 без спецификации» в текстовом редакторе или используя инструменты командной строки. Спецификация — это просто первые несколько байтов файла. При их удалении остальная часть содержимого файла остается нетронутой и доступной для чтения.

Наличие спецификации зависит от приложения и платформы, на которой создан файл. Приложения Windows, такие как Блокнот и Microsoft Office, обычно добавляют спецификацию в файлы UTF-8. Инструменты Unix/Linux и современные редакторы кода, такие как VS Code, обычно по умолчанию сохраняют файлы без спецификации для максимальной совместимости.

Наш детектор BOM поддерживает все известные сигнатуры BOM: UTF-8 (EF BB BF), UTF-16 с прямым порядком байтов (FE FF), UTF-16 с прямым порядком байтов (FF FE), UTF-32 с прямым порядком байтов (00 00 FE FF), UTF-32 с прямым порядком байтов (FF FE 00 00), UTF-7 (2B 2F 76 38 и варианты), UTF-1 (F7 64) 4C), SCSU (0E FE FF), BOCU-1 (FB EE 28) и GB-18030 (84 31 95 33).

Абсолютно. Наш детектор спецификаций обрабатывает все локально в вашем браузере. Ваши файлы и текст никогда не загружаются на какой-либо сервер — весь анализ происходит на вашем устройстве, обеспечивая полную конфиденциальность и безопасность ваших данных.

Порядок байтов относится к порядку, в котором байты располагаются в многобайтовых типах данных. С прямым порядком байтов сначала сохраняется наиболее значимый байт, а с прямым порядком байтов — сначала наименее значащий байт. Для кодировок UTF-16 и UTF-32 знание порядка байтов необходимо для правильного декодирования текста. Спецификация сообщает программному обеспечению, какой порядок байтов использовать.

Да. Спецификация UTF-8 в начале файлов сценариев (скрипты оболочки, Python, JavaScript, PHP) может вызвать синтаксические ошибки, неожиданный вывод или сбои «шебанга», поскольку байты спецификации появляются перед маркерами !# или <?php. Многие компиляторы и интерпретаторы не ожидают или игнорируют байты спецификации.

Нет, практического ограничения на размер файла не существует. Наш детектор BOM считывает только первые 16 байтов любого файла для выполнения обнаружения, поэтому даже файлы размером в несколько гигабайт можно анализировать мгновенно, не потребляя значительного объема памяти или пропускной способности.