Aller au contenu
Aback Tools Logo

Détecteur de marque d'ordre d'octet (BOM)

Détectez la marque d'ordre des octets (BOM) au début de tout fichier ou texte collé. Notre détecteur de marques d'ordre d'octet lit les premiers octets et les compare à toutes les signatures de nomenclature connues - montrant la séquence hexadécimale, l'encodage interprété et le caractère boutien. Prend en charge UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), UTF-7, SCSU, BOCU-1 et GB-18030. Téléchargez n'importe quel fichier ou collez du texte pour vérifier les caractères cachés de la nomenclature. Tout le traitement s'exécute localement dans votre navigateur - pas de téléchargement, pas d'inscription, entièrement gratuit.

Detect Byte Order Mark (BOM)

Upload a file or paste text to detect BOM (Byte Order Mark) at the start. Shows hex sequence, encoding, and endianness.

Drop your file here

or click to browse (any file type supported)

Pourquoi utiliser notre détecteur de marques d'ordre d'octets ?

  • Détection complète de nomenclature : notre détecteur de nomenclature analyse les premiers octets de tout fichier ou texte collé pour détecter toutes les signatures connues de marque d'ordre d'octet. Prend en charge les encodages UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), UTF-7, UTF-1, SCSU, BOCU-1 et GB-18030 avec identification automatique.
  • Traitement 100 % privé du navigateur : le détecteur de nomenclature traite tout localement dans votre navigateur. Vos fichiers et textes ne quittent jamais votre appareil, garantissant ainsi une confidentialité totale des documents sensibles et de l'analyse des données.
  • Analyse instantanée de fichiers et de textes : obtenez des résultats immédiats avec notre détecteur de nomenclature en ligne. Téléchargez n'importe quel fichier ou collez du texte et recevez un rapport détaillé montrant les signatures de nomenclature détectées, les séquences hexadécimales, l'encodage, l'endianité et l'analyse au niveau des octets en millisecondes.
  • Dump hexadécimal interactif et tableau de référence : affichez un vidage hexadécimal codé par couleur des 16 premiers octets avec les séquences de nomenclature en surbrillance. Un tableau de référence complet de toutes les signatures de nomenclature connues vous aide à comprendre chaque format d'encodage et ses caractéristiques.

Cas d'utilisation courants du détecteur de marque d'ordre d'octet

  • Débogage des problèmes de nomenclature UTF-8 dans les scripts : les développeurs utilisent notre détecteur de nomenclature pour identifier les octets de nomenclature UTF-8 cachés au début des scripts shell, des fichiers Python et des fichiers JavaScript qui provoquent des erreurs de syntaxe cryptiques ou des échecs lorsqu'ils sont exécutés sur des systèmes basés sur Unix.
  • Dépannage de l'encodage CSV et des fichiers de données : les analystes de données utilisent le détecteur de nomenclature pour identifier les caractères de nomenclature dans les fichiers CSV et de données qui provoquent des erreurs d'analyse dans des outils tels que Python Pandas, Excel et les utilitaires d'importation de bases de données, garantissant ainsi un traitement propre des données.
  • Développement Web et validation HTML : les développeurs Web utilisent notre détecteur de nomenclature pour rechercher les octets parasites de la nomenclature dans les fichiers HTML, CSS et JavaScript qui peuvent provoquer des problèmes de rendu des espaces, des caractères inattendus dans les mises en page ou des avertissements du validateur.
  • Analyse de l'encodage de fichiers multiplateforme : les administrateurs système utilisent le détecteur de nomenclature pour analyser les fichiers transférés entre les systèmes Windows (qui ajoute souvent une nomenclature UTF-16 LE), macOS et Linux, identifiant les incohérences d'encodage qui entraînent une corruption de fichiers ou des problèmes d'affichage.
  • Débogage des charges utiles API et JSON : les développeurs d'API utilisent notre détecteur de nomenclature pour identifier les caractères de nomenclature dans les charges utiles JSON et les réponses API qui provoquent des échecs JSON.parse, des séquences d'octets inattendues ou des problèmes de négociation de type de contenu.
  • Éditeur de texte et configuration IDE : les utilisateurs configurent leurs éditeurs de texte et IDE à l'aide de notre détecteur de nomenclature pour vérifier si leurs outils ajoutent des marqueurs de nomenclature aux fichiers, les aidant ainsi à prendre des décisions éclairées concernant les paramètres d'encodage dans VS Code, Sublime Text et IntelliJ.

Qu'est-ce qu'une marque d'ordre d'octets (BOM) ?

Une marque d'ordre d'octets (BOM) est un caractère spécial Unicode (U+FEFF ZERO WIDTH NO-BREAK SPACE) placé au début d'un fichier texte ou d'un flux pour indiquer le type de codage et l'ordre des octets (endianness) des données. La nomenclature agit comme une signature qui aide le logiciel à interpréter correctement l'encodage du texte qui suit. Pour les encodages UTF-16 et UTF-32, la nomenclature identifie spécifiquement si les octets sont dans l'ordre big-endian (octet de poids fort en premier) ou small-endian (octet de poids faible en premier). Bien que l'UTF-8 n'ait pas de caractère boutien, sa nomenclature (EF BB BF) est couramment utilisée par les applications Windows pour marquer les fichiers comme étant codés en UTF-8. Notre détecteur de marques d'ordre d'octets lit les premiers octets de n'importe quel fichier et les compare à une base de données complète de signatures de nomenclature connues pour identifier instantanément l'encodage.

Comment fonctionne notre détecteur de marques d'ordre d'octets

  1. Lecture de données binaires : le détecteur de nomenclature lit les octets bruts de votre fichier téléchargé ou encode votre texte collé en octets à l'aide de l'encodage UTF-8. Seuls les 16 premiers octets sont nécessaires pour une détection précise de la nomenclature, ce qui rend le processus extrêmement rapide, même pour les fichiers très volumineux.
  2. Correspondance de signature de nomenclature : le détecteur compare les octets initiaux à toutes les signatures de nomenclature connues, notamment UTF-8 (EF BB BF), UTF-16 BE (FE FF), UTF-16 LE (FF FE), UTF-32 BE (00 00 FE FF), UTF-32 LE (FF FE 00 00), UTF-7 (2B 2F 76 38), SCSU (0E FE FF), BOCU-1 (FB). EE 28) et GB-18030 (84 31 95 33). Plusieurs correspondances sont signalées le cas échéant.
  3. Présentation des résultats : le détecteur affiche un verdict clair, un vidage hexadécimal codé par couleur avec les octets de nomenclature en surbrillance, des informations de codage détaillées, notamment le caractère boutiste et la longueur des octets, ainsi qu'un tableau de référence complet de toutes les signatures de nomenclature connues à des fins pédagogiques.

Ce que révèle notre détecteur de nomenclature

  • Type d'encodage : le détecteur identifie la norme d'encodage Unicode utilisée : UTF-8, UTF-16 (avec endianité), UTF-32 (avec endianité) ou d'autres encodages Unicode existants comme UTF-7, SCSU ou BOCU-1.
  • Endianité : pour les codages multi-octets comme UTF-16 et UTF-32, le détecteur détermine si les octets sont dans l'ordre big-endian (ordre réseau) ou small-endian, ce qui est essentiel pour une interprétation correcte des données texte.
  • Séquence hexadécimale : la séquence d'octets hexadécimale exacte de la nomenclature détectée est affichée à côté d'un vidage visuel hexadécimal des 16 premiers octets, avec les octets de la nomenclature mis en évidence pour une identification facile.
  • Analyse au niveau des octets : le détecteur affiche la représentation brute hexadécimale et ASCII des octets d'ouverture du fichier, vous aidant à comprendre la structure binaire, qu'une nomenclature soit présente ou non.

Confidentialité, sécurité et meilleures pratiques

Votre vie privée est primordiale. Notre détecteur de nomenclature effectue toutes les analyses entièrement dans votre navigateur à l'aide de JavaScript : aucune donnée de fichier n'est téléchargée sur un serveur et rien ne quitte votre appareil. Cela garantit que les documents sensibles et les données exclusives restent totalement confidentielles. Le détecteur est 100 % gratuit, sans limite de taille de fichier (seuls les 16 premiers octets sont lus pour analyse). Notez que même si une nomenclature aide à identifier l'encodage, tous les fichiers n'en ont pas un : de nombreux fichiers UTF-8, en particulier sur les systèmes Unix/Linux, omettent intentionnellement la nomenclature. Les outils et les scripts doivent gérer correctement les fichiers avec et sans nomenclature pour une compatibilité maximale entre les plates-formes.

Foire aux questions

Une marque d'ordre d'octets (BOM) est un caractère Unicode (U+FEFF) placé au début d'un fichier texte ou d'un flux pour indiquer le type de codage et l'ordre des octets. Il agit comme une signature de fichier qui aide le logiciel à interpréter correctement l'encodage des données texte qui suivent la séquence de nomenclature.

La séquence hexadécimale EF BB BF est la nomenclature UTF-8. Il est généralement ajouté par les applications Windows telles que le Bloc-notes lors de l'enregistrement de fichiers au format UTF-8. Bien que l'UTF-8 n'ait pas de caractère boutien, cette nomenclature identifie le fichier comme étant codé en UTF-8. De nombreux outils Unix et Linux n'attendent pas cette nomenclature et peuvent ne pas réussir à analyser correctement le fichier.

La nomenclature peut être supprimée à l'aide d'un éditeur hexadécimal, en réenregistrant le fichier avec "Enregistrer au format UTF-8 sans BOM" dans votre éditeur de texte ou en utilisant des outils de ligne de commande. La nomenclature correspond simplement aux premiers octets du fichier : leur suppression laisse le reste du contenu du fichier intact et lisible.

La présence de BOM dépend de l'application et de la plateforme qui ont créé le fichier. Les applications Windows telles que le Bloc-notes et Microsoft Office ajoutent généralement une nomenclature aux fichiers UTF-8. Les outils Unix/Linux et les éditeurs de code modernes comme VS Code enregistrent généralement les fichiers sans nomenclature par défaut pour une compatibilité maximale.

Notre détecteur de nomenclature prend en charge toutes les signatures de nomenclature connues : UTF-8 (EF BB BF), UTF-16 Big Endian (FE FF), UTF-16 Little Endian (FF FE), UTF-32 Big Endian (00 00 FE FF), UTF-32 Little Endian (FF FE 00 00), UTF-7 (2B 2F 76 38 et variantes), UTF-1 (F7 64 4C), SCSU (0E FE FF), BOCU-1 (FB EE 28) et GB-18030 (84 31 95 33).

Absolument. Notre détecteur de nomenclature traite tout localement dans votre navigateur. Vos fichiers et textes ne sont jamais téléchargés sur aucun serveur - toutes les analyses ont lieu sur votre appareil, garantissant ainsi une confidentialité et une sécurité totales de vos données.

L'endianisme fait référence à l'ordre dans lequel les octets sont organisés en types de données multi-octets. Le big-endian stocke l'octet le plus significatif en premier, tandis que le small-endian stocke l'octet le moins significatif en premier. Pour les encodages UTF-16 et UTF-32, connaître le boutisme est essentiel pour décoder correctement le texte. La nomenclature indique au logiciel quel ordre d'octets utiliser.

Oui. Une nomenclature UTF-8 au début des fichiers de script (scripts shell, Python, JavaScript, PHP) peut provoquer des erreurs de syntaxe, des sorties inattendues ou des échecs "shebang" car les octets de la nomenclature apparaissent avant les marqueurs !# ou <?php. De nombreux compilateurs et interprètes n'attendent pas ou n'ignorent pas les octets de la nomenclature.

Non, il n’y a pas de limite pratique à la taille des fichiers. Notre détecteur de nomenclature ne lit que les 16 premiers octets de tout fichier pour effectuer la détection, de sorte que même les fichiers de plusieurs gigaoctets peuvent être analysés instantanément sans consommer de mémoire ou de bande passante importante.