BOM-Detektor
Laden Sie eine beliebige Datei hoch, um Byte Order Marks (BOMs) zu erkennen und die Textkodierung zu identifizieren. Unser BOM-Detektor liest den Dateikopf und gleicht ihn mit bekannten BOM-Signaturen für UTF-8, UTF-16 (Big Endian und Little Endian), UTF-32, UTF-7, GB 18030 und mehr ab. Sehen Sie den interaktiven Hex-Dump mit hervorgehobenen BOM-Bytes, erhalten Sie detaillierte Kodierungsinformationen mit Erkennung der Byte-Reihenfolge und praktische Empfehlungen für plattformübergreifende Kompatibilität. Die gesamte Verarbeitung erfolgt vollständig in Ihrem Browser - keine Uploads, keine Anmeldung erforderlich.
Upload any file to detect Byte Order Marks (BOMs) - hidden byte sequences at the start of files that identify the text encoding and byte order. Supports UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), UTF-7, GB 18030, and other BOM signatures. Displays the hex dump with BOM bytes highlighted, encoding details, and recommendations for cross-platform compatibility. All processing is done entirely in your browser - no uploads, no signup required.
Drag & drop a file here, or click to select
Detects BOM signatures in text and binary files
Warum unseren BOM-Detektor verwenden?
- Umfassende Erkennung von BOM-Signaturen: erkennt alle standardmäßigen Byte Order Mark-Signaturen: UTF-8 (EF BB BF), UTF-16 Big Endian (FE FF), UTF-16 Little Endian (FF FE), UTF-32 Big Endian (00 00 FE FF), UTF-32 Little Endian (FF FE 00 00), UTF-7 (+/v), UTF-1, SCSU, BOCU-1 und GB 18030. Jedes BOM wird mit Kodierungsname, IANA-Zeichensatz, Byte-Reihenfolge und üblichem Verwendungskontext angegeben.
- Interaktive Hex- und ASCII-Anzeige: zeigt die ersten 48 Bytes der Datei als interaktiven Hex-Dump mit nebeneinanderliegender ASCII-Darstellung. Erkannte BOM-Bytes werden bernsteinfarben hervorgehoben, um sie visuell leicht zu erkennen. Die Hex-Daten können mit einem Klick für Dokumentation oder weitere Analysen in die Zwischenablage kopiert werden.
- Kodierungsempfehlungen: bietet umsetzbare Empfehlungen auf Basis der erkannten BOM-Kodierung. Es wird auf Probleme mit der plattformübergreifenden Kompatibilität hingewiesen - zum Beispiel eine Warnung, wenn ein UTF-8-BOM in Quellcode erkannt wird, der auf Unix/Linux-Systemen Probleme verursachen kann, oder ein Vorschlag zur Konvertierung von UTF-16 zu UTF-8 für bessere Speichereffizienz und Tool-Kompatibilität.
- 100 % private Verarbeitung im Browser: die gesamte BOM-Erkennung findet vollständig in Ihrem Browser statt. Es werden nur die ersten 1024 Bytes der Datei über die FileReader-API gelesen - es werden niemals Daten an einen Server hochgeladen. Ihre Dateien verlassen niemals Ihr Gerät, sodass die Analyse sensibler oder proprietärer Dateien sicher ist.
Typische Anwendungsfälle für den BOM-Detektor
- Fehlersuche bei Kodierungsproblemen in der Webentwicklung: wenn PHP-, Python- oder JavaScript-Dateien unerwartete Ausgaben zeigen (wie -Zeichen am Anfang einer Webseite), ist oft das UTF-8-BOM die Ursache. Nutzen Sie unseren BOM-Detektor, um schnell festzustellen, ob Quelldateien ein BOM enthalten, und konvertieren Sie sie dann zu UTF-8 ohne BOM für eine saubere Darstellung.
- Plattformübergreifende Dateikompatibilität: unter Windows erstellte Dateien enthalten häufig ein UTF-8-BOM, das bei der Übertragung auf Unix/Linux/macOS-Systeme Probleme verursacht. Skripte mit Shebang-Zeile (#!) können fehlschlagen, Konfigurationsdateien falsch gelesen werden und Diff-Tools Phantomunterschiede anzeigen. Erkennen Sie BOMs, um diese Kompatibilitätsprobleme zu diagnostizieren und zu beheben.
- Überprüfung der Kodierung von CSV- und Datendateien: aus Microsoft Excel exportierte CSV-Dateien enthalten oft ein UTF-8-BOM, was beeinflussen kann, wie Datenverarbeitungstools die Datei einlesen. Erkennen Sie BOM und Kodierung, um sicherzustellen, dass Ihre ETL-Pipelines, Datenbankimporte und Analysewerkzeuge die Datei korrekt verarbeiten.
- Migration von Dateiformaten aus Altsystemen: wenn Sie Altsysteme mit UTF-16-, UTF-32- oder GB 18030-Kodierung auf moderne UTF-8-Standards migrieren, nutzen Sie die BOM-Erkennung, um festzustellen, welche Dateien konvertiert werden müssen. Die Empfehlungsfunktion gibt Hinweise zur besten Konvertierungsstrategie für jede Kodierungsart.
- QA und Dateivalidierung in CI/CD-Pipelines: integrieren Sie die BOM-Erkennung in Ihren Qualitätssicherungs-Workflow. Stellen Sie sicher, dass Quellcode, Konfigurationsdateien und Dokumentation den Kodierungsstandards Ihres Teams entsprechen. Erkennen und markieren Sie Dateien mit unerwarteten BOMs, bevor sie Produktionsprobleme verursachen.
- Informatik und Unicode-Schulung: lernen Sie interaktiv Unicode-Kodierung, Byte-Reihenfolge, Endianness und das BOM-Zeichen (U+FEFF) kennen. Laden Sie Dateien in verschiedenen Kodierungen hoch und beobachten Sie, wie sich die BOM-Signaturen unterscheiden. Ein praktisches Lehrwerkzeug für Kurse zu Internationalisierung und Zeichenkodierung.
Was ist ein Byte Order Mark (BOM)?
Ein Byte Order Mark (BOM) ist ein Unicode-Zeichen (U+FEFF), das am Anfang einer Textdatei platziert wird, um deren Kodierung und Byte-Reihenfolge anzugeben. Das BOM wurde entwickelt, um ein grundlegendes Problem bei Mehrbyte-Kodierungen zu lösen: verschiedene Computerarchitekturen speichern Mehrbyte-Werte in unterschiedlichen Byte-Reihenfolgen (Endianness). Durch das Lesen der ersten Bytes einer Datei kann ein Programm feststellen, ob der Text in UTF-8, UTF-16 Big Endian, UTF-16 Little Endian oder einem anderen Format kodiert ist, und die folgenden Bytes korrekt interpretieren. Das BOM ist im Unicode-Standard spezifiziert und wird von vielen Texteditoren, Webbrowsern und Laufzeitumgebungen von Programmiersprachen erkannt.
Wie unser BOM-Detektor funktioniert
- Datei einlesen: wenn Sie eine Datei hochladen, liest unser Tool die ersten 1024 Bytes über die FileReader-API des Browsers. Es wird nur der Kopf gelesen, wodurch der Erkennungsprozess auch bei großen Dateien schnell bleibt.
- Abgleich der BOM-Signaturen: die Bytes am Dateianfang werden mit einer Datenbank mit 10 bekannten BOM-Signaturen verglichen. Jede Signatur wird Byte für Byte auf exakte Übereinstimmung geprüft. Wird ein BOM gefunden, werden Kodierung, Byte-Reihenfolge und IANA-Zeichensatz identifiziert.
- Tiefenscan: zusätzlich zur Prüfung des Dateianfangs sucht das Tool tiefer (bis zu 128 Bytes) nach weiteren BOM-ähnlichen Mustern. Das hilft, zusammengefügte Dateien oder ungewöhnliche Dateistrukturen zu erkennen, die BOMs an Offsetpositionen ungleich null aufweisen.
- Empfehlungen erstellen: auf Basis der erkannten Kodierung gibt das Tool passgenaue Empfehlungen zu plattformübergreifender Kompatibilität, Speichereffizienz und Tool-Interoperabilität.
Wann BOMs verwendet werden sollten (und wann nicht)
- UTF-8 mit BOM (EF BB BF): unter Windows üblich, kann aber unter Unix/Linux Probleme verursachen. PHP-Skripte mit BOM lösen „headers already sent“-Fehler aus. Python-Skripte können an der Shebang-Zeile scheitern. Shell-Skripte können stillschweigend brechen. Empfohlen: Verwenden Sie UTF-8 ohne BOM für Webinhalte und Quellcode.
- UTF-16-BOMs (FE FF / FF FE): unerlässlich zur Bestimmung der Byte-Reihenfolge in UTF-16-Dateien. Von einigen Windows-APIs und .NET-Anwendungen gefordert. Allerdings sind UTF-16-Dateien mit Standard-Unix-Tools (grep, sed, awk) schwieriger zu verarbeiten und belegen bei ASCII-lastigem Inhalt mehr Speicher.
- UTF-32-BOMs (00 00 FE FF / FF FE 00 00): äußerst selten verwendet. UTF-32 vervierfacht die Speichergröße gegenüber UTF-8 für die meisten Texte und wird von sehr wenigen Anwendungen unterstützt. Für den allgemeinen Gebrauch nicht empfohlen.
- Nicht-Unicode-BOMs: das GB 18030-BOM wird in chinesischen Regierungssystemen verwendet. Andere Kodierungsmarker (UTF-7, SCSU, BOCU-1, UTF-1) sind in modernen Anwendungen veraltet oder extrem selten.
Datenschutz, Sicherheit und Einschränkungen
Unser BOM-Detektor verarbeitet alles vollständig in Ihrem Browser. Es werden nur die ersten 1024 Bytes jeder Datei gelesen - es werden niemals Daten an einen Server hochgeladen. Das Tool ist 100 % kostenlos, ohne Anmeldung, ohne Konto und ohne Nutzungslimits.
Unterstützte BOM-Signaturen: UTF-8, UTF-16 BE/LE, UTF-32 BE/LE, UTF-7, UTF-1, SCSU, BOCU-1 und GB 18030 - damit sind alle im Unicode-Standard und in verwandten Kodierungsspezifikationen definierten Standard-BOM-Signaturen abgedeckt.
Einschränkungen: die BOM-Erkennung identifiziert nur den Kodierungsmarker - sie prüft nicht, ob der Rest der Datei dieser Kodierung entspricht. Dateien ohne BOM (wie die meisten UTF-8-Dateien unter Unix/Linux) werden als „Kein BOM gefunden“ angezeigt. Binärdateien können zufällig mit Bytes beginnen, die BOM-Signaturen entsprechen, und so falsche Positive erzeugen. Das Tool liest nur die ersten 1024 Bytes; BOMs außerhalb dieses Bereichs werden nicht erkannt.
Häufig gestellte Fragen
Ein Byte Order Mark (BOM) ist ein Unicode-Zeichen (U+FEFF), das am Anfang einer Textdatei kodiert wird und die verwendete Kodierung sowie Byte-Reihenfolge angibt. Es hilft Software, die Textkodierung korrekt zu interpretieren, ohne raten zu müssen.
Unser BOM-Detektor unterstützt 10 BOM-Signaturen: UTF-8 mit BOM, UTF-16 Big Endian, UTF-16 Little Endian, UTF-32 Big Endian, UTF-32 Little Endian, UTF-7, UTF-1, SCSU, BOCU-1 und GB 18030.
Für plattformübergreifende Kompatibilität wird UTF-8 ohne BOM empfohlen, insbesondere in der Webentwicklung und bei Quellcode. Das BOM kann bei PHP, Python und Shell-Skripten auf Unix/Linux-Systemen Probleme verursachen.
Ja. Binärdateien können zufällig mit Bytes beginnen, die BOM-Signaturen entsprechen. Berücksichtigen Sie beim Interpretieren der Ergebnisse den Kontext des Dateityps.
Die ersten 1024 Bytes (1 KB) werden gelesen, was mehr als ausreichend ist, da BOMs höchstens 4 Bytes lang sind.
Ja. Es werden nur die ersten 1024 Bytes gelesen und die gesamte Verarbeitung findet im Browser statt - es werden niemals Daten hochgeladen.
Das Tool meldet „Kein BOM gefunden“ für Dateien ohne BOM. Die meisten UTF-8-Dateien unter Unix/Linux/macOS werden ohne BOM gespeichert, was die empfohlene Vorgehensweise ist.
Ja! 100 % kostenlos, ohne Anmeldung, ohne Konto, ohne API-Schlüssel und ohne Nutzungslimits.