Détecteur de BOM
Importez n'importe quel fichier pour détecter les marques d'ordre des octets (BOM) et identifier l'encodage du texte. Notre Détecteur de BOM lit l'en-tête du fichier et le compare aux signatures BOM connues pour UTF-8, UTF-16 (Big Endian et Little Endian), UTF-32, UTF-7, GB 18030, et bien d'autres. Consultez le vidage hexadécimal interactif avec les octets BOM surlignés, obtenez des informations détaillées sur l'encodage avec détection de l'endianness, et recevez des recommandations pratiques pour la compatibilité multiplateforme. Tout le traitement se fait entièrement dans votre navigateur - sans envoi, sans inscription.
Upload any file to detect Byte Order Marks (BOMs) - hidden byte sequences at the start of files that identify the text encoding and byte order. Supports UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), UTF-7, GB 18030, and other BOM signatures. Displays the hex dump with BOM bytes highlighted, encoding details, and recommendations for cross-platform compatibility. All processing is done entirely in your browser - no uploads, no signup required.
Drag & drop a file here, or click to select
Detects BOM signatures in text and binary files
Pourquoi utiliser notre Détecteur de BOM ?
- Détection complète des signatures BOM : détecte toutes les signatures standard de marque d'ordre des octets : UTF-8 (EF BB BF), UTF-16 Big Endian (FE FF), UTF-16 Little Endian (FF FE), UTF-32 Big Endian (00 00 FE FF), UTF-32 Little Endian (FF FE 00 00), UTF-7 (+/v), UTF-1, SCSU, BOCU-1 et GB 18030. Chaque BOM est identifié avec son nom d'encodage, son jeu de caractères IANA, son endianness et son contexte d'utilisation courant.
- Affichage interactif hexadécimal et ASCII : affiche les 48 premiers octets du fichier sous forme de vidage hexadécimal interactif avec une représentation ASCII côte à côte. Les octets BOM détectés sont surlignés en ambre pour une identification visuelle facile. Les données hexadécimales peuvent être copiées dans le presse-papiers en un clic pour la documentation ou une analyse ultérieure.
- Recommandations d'encodage : fournit des recommandations concrètes selon l'encodage BOM détecté. Signale les problèmes de compatibilité multiplateforme - par exemple, avertit lorsqu'un BOM UTF-8 est détecté dans du code source susceptible de poser problème sur les systèmes Unix/Linux, ou suggère une conversion de UTF-16 vers UTF-8 pour une meilleure efficacité de stockage et compatibilité des outils.
- Traitement 100 % privé dans le navigateur : toute la détection de BOM se fait entièrement dans votre navigateur. Seuls les 1024 premiers octets du fichier sont lus via l'API FileReader - aucune donnée n'est jamais envoyée à un serveur. Vos fichiers ne quittent jamais votre appareil, ce qui permet d'analyser en toute sécurité des fichiers sensibles ou propriétaires.
Cas d'usage courants du Détecteur de BOM
- Débogage des problèmes d'encodage en développement web : lorsque des fichiers PHP, Python ou JavaScript affichent une sortie inattendue (comme des caractères  en haut d'une page web), le BOM UTF-8 est souvent le coupable. Utilisez notre Détecteur de BOM pour identifier rapidement si les fichiers source contiennent un BOM, puis convertissez-les en UTF-8 sans BOM pour un rendu propre.
- Compatibilité des fichiers multiplateforme : les fichiers créés sous Windows incluent souvent un BOM UTF-8 qui pose problème lors du transfert vers des systèmes Unix/Linux/macOS. Les scripts avec une ligne shebang (#!) peuvent échouer, les fichiers de configuration peuvent être mal lus, et les outils de diff peuvent afficher des différences fantômes. Détectez les BOM pour diagnostiquer et résoudre ces problèmes de compatibilité.
- Vérification de l'encodage des CSV et fichiers de données : les fichiers CSV exportés depuis Microsoft Excel incluent souvent un BOM UTF-8, ce qui peut affecter la façon dont les outils de traitement de données analysent le fichier. Détectez le BOM et l'encodage pour garantir que vos pipelines ETL, imports de bases de données et outils d'analyse traitent correctement le fichier.
- Migration de formats de fichiers hérités : lors de la migration de systèmes hérités utilisant l'encodage UTF-16, UTF-32 ou GB 18030 vers les standards UTF-8 modernes, utilisez la détection de BOM pour identifier les fichiers à convertir. Le moteur de recommandations fournit des conseils sur la meilleure stratégie de conversion pour chaque type d'encodage.
- QA et validation de fichiers dans les pipelines CI/CD : intégrez la détection de BOM à votre flux d'assurance qualité. Assurez-vous que tout le code source, les fichiers de configuration et la documentation respectent les standards d'encodage de votre équipe. Détectez et signalez les fichiers présentant des BOM inattendus avant qu'ils ne causent des incidents en production.
- Informatique et éducation Unicode : apprenez de façon interactive l'encodage Unicode, l'ordre des octets, l'endianness et le caractère BOM (U+FEFF). Importez des fichiers dans différents encodages et observez comment les signatures BOM diffèrent. Un outil pédagogique pratique pour les cours sur l'internationalisation et l'encodage des caractères.
Qu'est-ce qu'une marque d'ordre des octets (BOM) ?
Une marque d'ordre des octets (BOM) est un caractère Unicode (U+FEFF) placé au début d'un fichier texte pour indiquer son encodage et l'ordre des octets. Le BOM a été conçu pour résoudre un problème fondamental des encodages multi-octets : différentes architectures informatiques stockent les valeurs multi-octets dans des ordres d'octets différents (endianness). En lisant les premiers octets d'un fichier, un programme peut déterminer si le texte est encodé en UTF-8, UTF-16 Big Endian, UTF-16 Little Endian ou un autre format, et interpréter correctement les octets suivants. Le BOM est spécifié dans la norme Unicode et reconnu par de nombreux éditeurs de texte, navigateurs web et environnements d'exécution de langages de programmation.
Comment fonctionne notre Détecteur de BOM
- Lecture du fichier : lorsque vous importez un fichier, notre outil lit les 1024 premiers octets via l'API FileReader du navigateur. Seul l'en-tête est lu, ce qui rend la détection rapide même pour les gros fichiers.
- Correspondance des signatures BOM : les octets au début du fichier sont comparés à une base de données de 10 signatures BOM connues. Chaque signature est vérifiée octet par octet pour une correspondance exacte. Si un BOM est trouvé, l'encodage, l'endianness et le jeu de caractères IANA sont identifiés.
- Analyse approfondie : en plus de vérifier le début du fichier, l'outil recherche plus loin (jusqu'à 128 octets) d'autres motifs de type BOM. Cela aide à détecter des fichiers concaténés ou des structures de fichier inhabituelles pouvant contenir des BOM à des décalages non nuls.
- Génération de recommandations : selon l'encodage détecté, l'outil fournit des recommandations sur mesure pour la compatibilité multiplateforme, l'efficacité de stockage et l'interopérabilité des outils.
Quand utiliser (et ne pas utiliser) les BOM
- UTF-8 avec BOM (EF BB BF) : courant sous Windows mais peut causer des problèmes sous Unix/Linux. Les scripts PHP avec BOM provoqueront des erreurs « headers already sent ». Les scripts Python peuvent échouer sur la ligne shebang. Les scripts shell peuvent cesser de fonctionner silencieusement. Recommandé : utilisez l'UTF-8 sans BOM pour le contenu web et le code source.
- BOM UTF-16 (FE FF / FF FE) : essentiels pour identifier l'ordre des octets dans les fichiers UTF-16. Requis par certaines API Windows et applications .NET. Cependant, les fichiers UTF-16 sont plus difficiles à traiter avec les outils Unix standard (grep, sed, awk) et occupent plus d'espace pour le contenu riche en ASCII.
- BOM UTF-32 (00 00 FE FF / FF FE 00 00) : très rarement utilisés. L'UTF-32 quadruple la taille de stockage par rapport à l'UTF-8 pour la plupart des textes et n'est pris en charge que par très peu d'applications. Non recommandé pour un usage général.
- BOM non Unicode : le BOM GB 18030 est utilisé dans les systèmes gouvernementaux chinois. Les autres marqueurs d'encodage (UTF-7, SCSU, BOCU-1, UTF-1) sont obsolètes ou extrêmement rares dans les applications modernes.
Confidentialité, sécurité et limites
Notre Détecteur de BOM traite tout entièrement dans votre navigateur. Seuls les 1024 premiers octets de chaque fichier sont lus - aucune donnée n'est jamais envoyée à un serveur. L'outil est 100 % gratuit, sans inscription, sans compte et sans limite d'utilisation.
Signatures BOM prises en charge : UTF-8, UTF-16 BE/LE, UTF-32 BE/LE, UTF-7, UTF-1, SCSU, BOCU-1 et GB 18030 - couvrant toutes les signatures BOM standard définies dans la norme Unicode et les spécifications d'encodage associées.
Limites : la détection de BOM identifie uniquement le marqueur d'encodage - elle ne vérifie pas si le reste du fichier respecte cet encodage. Les fichiers sans BOM (comme la plupart des fichiers UTF-8 sous Unix/Linux) seront affichés comme « Aucun BOM trouvé ». Les fichiers binaires peuvent par coïncidence commencer par des octets correspondant à des signatures BOM, produisant potentiellement des faux positifs. L'outil ne lit que les 1024 premiers octets ; les BOM au-delà de cette plage ne seront pas détectés.
Foire aux questions
Une marque d'ordre des octets (BOM) est un caractère Unicode (U+FEFF) encodé au début d'un fichier texte qui identifie l'encodage et l'ordre des octets utilisés. Elle aide les logiciels à interpréter correctement l'encodage du texte sans devoir le deviner.
Notre Détecteur de BOM prend en charge 10 signatures BOM : UTF-8 avec BOM, UTF-16 Big Endian, UTF-16 Little Endian, UTF-32 Big Endian, UTF-32 Little Endian, UTF-7, UTF-1, SCSU, BOCU-1 et GB 18030.
L'UTF-8 sans BOM est recommandé pour la compatibilité multiplateforme, en particulier pour le développement web et le code source. Le BOM peut causer des problèmes avec PHP, Python et les scripts shell sur les systèmes Unix/Linux.
Oui. Les fichiers binaires peuvent par coïncidence commencer par des octets correspondant aux signatures BOM. Tenez compte du contexte du type de fichier lors de l'interprétation des résultats.
Les 1024 premiers octets (1 Ko) sont lus, ce qui est largement suffisant puisque les BOM font au maximum 4 octets.
Oui. Seuls les 1024 premiers octets sont lus et tout le traitement se fait dans le navigateur - aucune donnée n'est jamais envoyée.
L'outil affiche « Aucun BOM trouvé » pour les fichiers sans BOM. La plupart des fichiers UTF-8 sous Unix/Linux/macOS sont enregistrés sans BOM, ce qui est la pratique recommandée.
Oui ! 100 % gratuit, sans inscription, sans compte, sans clé API et sans limite d'utilisation.