Detector de marca de orden de bytes (BOM)
Detecta la marca de orden de bytes (BOM) al inicio de cualquier archivo o texto pegado. Nuestro detector de marcas de orden de bytes lee los primeros bytes y los compara con todas las firmas de listas de materiales conocidas, mostrando la secuencia hexadecimal, la codificación interpretada y el endianidad. Admite UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), UTF-7, SCSU, BOCU-1 y GB-18030. Cargue cualquier archivo o pegue texto para comprobar si hay caracteres ocultos en la lista de materiales. Todo el procesamiento se ejecuta localmente en su navegador: sin cargas, sin registro, completamente gratis.
Upload a file or paste text to detect BOM (Byte Order Mark) at the start. Shows hex sequence, encoding, and endianness.
Drop your file here
or click to browse (any file type supported)
¿Por qué utilizar nuestro detector de marcas de orden de bytes?
- Detección integral de BOM: nuestro detector de BOM escanea los primeros bytes de cualquier archivo o texto pegado para detectar todas las firmas conocidas de marcas de orden de bytes. Admite codificaciones UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), UTF-7, UTF-1, SCSU, BOCU-1 y GB-18030 con identificación automática.
- Procesamiento 100% privado del navegador: el detector de BOM procesa todo localmente en su navegador. Sus archivos y textos nunca salen de su dispositivo, lo que garantiza una privacidad total para documentos confidenciales y análisis de datos.
- Análisis instantáneo de archivos y texto: obtenga resultados inmediatos con nuestro detector de BOM en línea. Cargue cualquier archivo o pegue texto y reciba un informe detallado que muestra las firmas de BOM detectadas, secuencias hexadecimales, codificación, endianidad y análisis a nivel de bytes en milisegundos.
- Tabla de referencia y volcado hexadecimal interactivo: vea un volcado hexadecimal codificado por colores de los primeros 16 bytes con secuencias de BOM resaltadas. Una tabla de referencia completa de todas las firmas de BOM conocidas le ayuda a comprender cada formato de codificación y sus características.
Casos de uso comunes para el detector de marcas de orden de bytes
- Depuración de problemas de BOM UTF-8 en scripts: los desarrolladores utilizan nuestro detector de BOM para identificar bytes ocultos de BOM UTF-8 al inicio de scripts de shell, archivos Python y archivos JavaScript que causan errores de sintaxis crípticos o fallas de shebang cuando se ejecutan en sistemas basados en Unix.
- Solución de problemas de codificación de archivos de datos y CSV: los analistas de datos utilizan el detector de BOM para identificar caracteres de BOM en archivos CSV y de datos que causan errores de análisis en herramientas como Python pandas, Excel y utilidades de importación de bases de datos, lo que garantiza un procesamiento de datos limpio.
- Desarrollo web y validación de HTML: los desarrolladores web utilizan nuestro detector de BOM para comprobar si hay bytes de BOM perdidos en archivos HTML, CSS y JavaScript que pueden causar problemas de representación de espacios en blanco, caracteres inesperados en los diseños de página o advertencias del validador.
- Análisis de codificación de archivos multiplataforma: los administradores de sistemas utilizan el detector BOM para analizar archivos transferidos entre sistemas Windows (que a menudo agrega UTF-16 LE BOM), macOS y Linux, identificando discrepancias de codificación que causan corrupción de archivos o problemas de visualización.
- Depuración de carga útil de API y JSON: los desarrolladores de API utilizan nuestro detector de BOM para identificar caracteres de BOM en cargas útiles JSON y respuestas de API que causan fallas en JSON.parse, secuencias de bytes inesperadas o problemas de negociación de tipo de contenido.
- Editor de texto y configuración de IDE: los usuarios configuran sus editores de texto e IDE utilizando nuestro detector de BOM para verificar si sus herramientas están agregando marcadores de BOM a los archivos, lo que les ayuda a tomar decisiones informadas sobre la configuración de codificación en VS Code, Sublime Text e IntelliJ.
¿Qué es una marca de orden de bytes (BOM)?
Una marca de orden de bytes (BOM) es un carácter especial Unicode (U+FEFF ZERO WIDTH NO-BREAK SPACE) colocado al principio de un archivo de texto o secuencia para indicar el tipo de codificación y el orden de bytes (endianidad) de los datos. La lista de materiales actúa como una firma que ayuda al software a interpretar correctamente la codificación del texto siguiente. Para las codificaciones UTF-16 y UTF-32, la lista de materiales identifica específicamente si los bytes están en orden big-endian (primero el byte más significativo) o little-endian (primero el byte menos significativo). Si bien UTF-8 no tiene endianidad, las aplicaciones de Windows suelen utilizar su BOM (EF BB BF) para marcar archivos como codificados en UTF-8. Nuestro detector de marcas de orden de bytes lee los primeros bytes de cualquier archivo y los compara con una base de datos completa de firmas de listas de materiales conocidas para identificar instantáneamente la codificación.
Cómo funciona nuestro detector de marcas de orden de bytes
- Lectura de datos binarios: el detector BOM lee los bytes sin procesar de su archivo cargado o codifica su texto pegado en bytes usando codificación UTF-8. Sólo se necesitan los primeros 16 bytes para una detección precisa de la lista de materiales, lo que hace que el proceso sea extremadamente rápido incluso para archivos muy grandes.
- Coincidencia de firmas de BOM: el detector compara los bytes iniciales con todas las firmas de BOM conocidas, incluidas UTF-8 (EF BB BF), UTF-16 BE (FE FF), UTF-16 LE (FF FE), UTF-32 BE (00 00 FE FF), UTF-32 LE (FF FE 00 00), UTF-7 (2B 2F 76 38), SCSU (0E FE FF), BOCU-1 (FB EE 28), y GB-18030 (84 31 95 33). Se informan varias coincidencias cuando corresponde.
- Presentación de resultados: el detector muestra un veredicto claro, un volcado hexadecimal codificado por colores con bytes de BOM resaltados, información de codificación detallada que incluye endianidad y longitud de bytes, y una tabla de referencia completa de todas las firmas de BOM conocidas con fines educativos.
Lo que revela nuestro detector de BOM
- Tipo de codificación: el detector identifica el estándar de codificación Unicode que se utiliza: UTF-8, UTF-16 (con endianidad), UTF-32 (con endianidad) u otras codificaciones Unicode heredadas como UTF-7, SCSU o BOCU-1.
- Endianidad: para codificaciones de varios bytes como UTF-16 y UTF-32, el detector determina si los bytes están en orden big-endian (orden de red) o little-endian, lo cual es fundamental para la interpretación correcta de los datos del texto.
- Secuencia hexadecimal: la secuencia de bytes hexadecimal exacta de la lista de materiales detectada se muestra junto con un volcado hexadecimal visual de los primeros 16 bytes, con los bytes de la lista de materiales resaltados para una fácil identificación.
- Análisis a nivel de bytes: el detector muestra la representación hexadecimal y ASCII sin formato de los bytes de apertura del archivo, lo que le ayuda a comprender la estructura binaria independientemente de si hay una lista de materiales presente.
Privacidad, seguridad y mejores prácticas
Tu privacidad es primordial. Nuestro detector de BOM realiza todos los análisis completamente dentro de su navegador utilizando JavaScript: no se cargan datos de archivos en ningún servidor y nada sale de su dispositivo. Esto garantiza que los documentos confidenciales y los datos de propiedad permanezcan completamente confidenciales. El detector es 100% gratuito y no tiene límites de tamaño de archivo (solo se leen los primeros 16 bytes para su análisis). Tenga en cuenta que, si bien una BOM ayuda a identificar la codificación, no todos los archivos tienen una; muchos archivos UTF-8, especialmente en sistemas Unix/Linux, omiten la BOM intencionalmente. Las herramientas y los scripts deben manejar archivos BOM y sin BOM correctamente para lograr la máxima compatibilidad entre plataformas.
Preguntas frecuentes
Una marca de orden de bytes (BOM) es un carácter Unicode (U+FEFF) colocado al inicio de un archivo de texto o secuencia para indicar el tipo de codificación y el orden de bytes. Actúa como una firma de archivo que ayuda al software a interpretar correctamente la codificación de los datos de texto que siguen la secuencia BOM.
La secuencia hexadecimal EF BB BF es la BOM UTF-8. Las aplicaciones de Windows como el Bloc de notas lo agregan comúnmente al guardar archivos como UTF-8. Si bien UTF-8 no tiene endianidad, esta lista de materiales identifica el archivo como codificado en UTF-8. Muchas herramientas de Unix y Linux no esperan esta lista de materiales y es posible que no puedan analizar el archivo correctamente.
La BOM se puede eliminar usando un editor hexadecimal, volviendo a guardar el archivo con "Guardar como UTF-8 sin BOM" en su editor de texto o usando herramientas de línea de comandos. La lista de materiales son simplemente los primeros bytes del archivo; al eliminarlos, el resto del contenido del archivo queda intacto y legible.
La presencia de BOM depende de la aplicación y plataforma que creó el archivo. Las aplicaciones de Windows como el Bloc de notas y Microsoft Office suelen agregar BOM a archivos UTF-8. Las herramientas de Unix/Linux y los editores de código modernos como VS Code normalmente guardan archivos sin BOM de forma predeterminada para una máxima compatibilidad.
Nuestro detector de BOM admite todas las firmas de BOM conocidas: UTF-8 (EF BB BF), UTF-16 Big Endian (FE FF), UTF-16 Little Endian (FF FE), UTF-32 Big Endian (00 00 FE FF), UTF-32 Little Endian (FF FE 00 00), UTF-7 (2B 2F 76 38 y variantes), UTF-1 (F7 64 4C), SCSU (0E FE FF), BOCU-1 (FB EE 28) y GB-18030 (84 31 95 33).
Absolutamente. Nuestro detector de BOM procesa todo localmente en su navegador. Sus archivos y texto nunca se cargan en ningún servidor: todos los análisis se realizan en su dispositivo, lo que garantiza total privacidad y seguridad de sus datos.
La endianidad se refiere al orden en que se organizan los bytes en tipos de datos de varios bytes. Big-endian almacena primero el byte más significativo, mientras que little-endian almacena primero el byte menos significativo. Para las codificaciones UTF-16 y UTF-32, conocer el endianismo es esencial para decodificar correctamente el texto. La lista de materiales le indica al software qué orden de bytes utilizar.
Sí. Una lista de materiales UTF-8 al inicio de los archivos de script (scripts de shell, Python, JavaScript, PHP) puede causar errores de sintaxis, resultados inesperados o fallas "shebang" porque los bytes de la lista de materiales aparecen antes de los marcadores !# o <?php. Muchos compiladores e intérpretes no esperan ni ignoran los bytes de la lista de materiales.
No, no existe un límite práctico de tamaño de archivo. Nuestro detector de BOM solo lee los primeros 16 bytes de cualquier archivo para realizar la detección, por lo que incluso los archivos de varios gigabytes se pueden analizar instantáneamente sin consumir una cantidad significativa de memoria o ancho de banda.