Textkodierungsdetektor
Fügen Sie Text ein oder laden Sie eine Datei hoch, um deren Zeichenkodierung sofort zu erkennen. Der Text Encoding Detector prüft auf Byte Order Marks (BOM), validiert UTF-8-Bytesequenzen und verwendet statistische Analysen, um die Codierung anhand von Konfidenzwerten zu identifizieren. Erkennt UTF-8, UTF-16, UTF-32, ISO-8859-1 bis ISO-8859-15, Windows-1252, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437 und mehr – die gesamte Verarbeitung läuft lokal in Ihrem Browser, keine Uploads, keine Anmeldung, völlig kostenlos.
Paste text or upload a file to detect its character encoding. The tool checks for Byte Order Marks (BOM), validates UTF-8 sequences, and uses statistical analysis to identify the encoding with a confidence score. Detects UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, Big5, KOI8-R, and more - all processing runs locally in your browser.
Ctrl+Enter to detect encoding · 0 characters
Warum sollten Sie unseren Textkodierungsdetektor verwenden?
- Erkennt mehr als 15 Zeichenkodierungen: Der Textkodierungsdetektor erkennt UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), ISO-8859-1 bis ISO-8859-15, Windows-1252, Windows-1251, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437 und mehr. Zu jeder Erkennung gehört ein Konfidenzwert, der Ihnen bei der Auswahl der richtigen Kodierung hilft.
- Stückliste und statistische Analyse: Das Tool prüft zunächst auf Byte Order Marks (BOM) – die definitive Methode zur Identifizierung von UTF-Kodierungen. Wenn keine Stückliste gefunden wird, verwendet es eine statistische Analyse: UTF-8-Bytesequenzvalidierung, High-Byte-Mustervergleich, Zeichenhäufigkeitsanalyse und Null-Byte-Verteilung, um die Codierung mit hoher Genauigkeit zu identifizieren.
- Umfassende Kodierungsreferenz: Jede erkannte Kodierung enthält eine für Menschen lesbare Bezeichnung, eine Kategorie (Unicode, Westlich, Kyrillisch, Japanisch, Chinesisch usw.) und eine kurze Beschreibung. Das Tool zeigt auch alle Kodierungsaliase an (z. B. „latin1“, „cp1252“, „sjis“), sodass Sie in Ihrem Code oder Ihrer Datenbankkonfiguration den richtigen Namen verwenden können.
- 100 % private Browserverarbeitung: Ihre Texte und Dateien verlassen niemals Ihr Gerät. Die gesamte Codierungserkennung – vom Stücklistenscan bis zur statistischen Analyse – erfolgt lokal mithilfe des Browsers TextEncoder und typisierter Arrays. Keine Server-Uploads, keine Datenprotokollierung, keine Anmeldung erforderlich. Völlig kostenlos und privat.
Häufige Anwendungsfälle für den Textkodierungsdetektor
- Wiederherstellung des Datenbankexports: Wenn Datenbanken CSV- oder SQL-Dumps mit falschen Codierungsdeklarationen exportieren, verwenden Sie den Text Encoding Detector, um die tatsächliche Codierung der exportierten Daten zu ermitteln. Dies ist wichtig, wenn Sie ältere Daten importieren oder Inhalte aus falsch konfigurierten Exporten mit verstümmeltem Text wiederherstellen.
- Web Scraping und API-Integration: Wenn Sie Websites scrapen oder APIs verwenden, die ihren Zeichensatz nicht deklarieren, ermitteln Sie vor der Verarbeitung die Codierung des Antworttexts. Der Text Encoding Detector hilft Ihnen, UTF-8, Shift-JIS, GB2312 und andere Codierungen zu identifizieren, die häufig in internationalen Webinhalten verwendet werden.
- Konvertierung älterer Dokumente: Konvertieren Sie ältere Dokumente, die in Windows-1252, MacRoman, IBM437 oder anderen älteren Kodierungen gespeichert sind, in modernes UTF-8. Erkennen Sie zunächst die ursprüngliche Kodierung und verwenden Sie dann die Informationen, um die Datei korrekt zu transkodieren, ohne dass Akzentzeichen, Symbole oder spezielle Formatierungen verloren gehen.
- Debuggen von Mojibake (verstümmelter Text): Wenn Text als verstümmelte Zeichen angezeigt wird (Mojibake – wie „é“ anstelle von „é“), verwenden Sie den Text Encoding Detector für die Rohbytes, um die tatsächliche Codierung zu bestimmen. Vergleichen Sie die erkannte Codierung mit der deklarierten Codierung, um die Nichtübereinstimmung zu diagnostizieren und zu beheben.
- Mehrsprachige Inhaltsanalyse: Bei der Verarbeitung mehrsprachiger Inhalte mit gemischten Skripten – Kyrillisch, Japanisch, Chinesisch, Arabisch, Hebräisch, Koreanisch – identifiziert der Text Encoding Detector die für jedes Textsegment verwendete Codierung. Unverzichtbar für Lokalisierungsprojekte, Übersetzungsworkflows und internationale CMS-Migration.
- Validierung der Datei-Upload-Kodierung: Überprüfen Sie beim Erstellen von Anwendungen, die Datei-Uploads akzeptieren, vor der Verarbeitung, dass die hochgeladene Datei die erwartete Kodierung verwendet. Mit dem Text Encoding Detector kann überprüft werden, ob CSV-Dateien, Konfigurationsdateien oder Datenexporte UTF-8 oder eine andere erforderliche Codierung verwenden.
Was ist die Textkodierungserkennung?
Bei der Textkodierungserkennung wird ermittelt, welche Zeichenkodierung verwendet wurde, um eine Bytefolge in lesbaren Text zu kodieren. Wenn Text in einer Datei gespeichert wird, werden seine Zeichen gemäß einem Kodierungsschema – UTF-8, Windows-1252, Shift-JIS und andere – in Bytes umgewandelt. Der Text Encoding Detector analysiert Bytemuster, sucht nach Byte Order Marks (BOM), validiert UTF-8-Sequenzen und ermittelt mithilfe statistischer Analysen, welche Codierung am wahrscheinlichsten ist, und hilft Ihnen so, verstümmelten oder unbekannten Text richtig zu interpretieren.
So funktioniert unser Textkodierungsdetektor
- Text oder Datei eingeben – Fügen Sie Text direkt in den Textbereich ein oder laden Sie eine Datei hoch. Das Tool liest die Rohbytes mithilfe der FileReader-API des Browsers. Wenn Sie Text einfügen, wird dieser zur Analyse als UTF-8-Byte codiert. Die gesamte Verarbeitung erfolgt lokal – es wird nichts auf einen Server hochgeladen.
- Byte Order Mark (BOM)-Scan – Das Tool überprüft die ersten Bytes der Daten auf bekannte BOM-Signaturen. Wenn eine Stückliste gefunden wird (EF BB BF für UTF-8, FF FE für UTF-16LE, FE FF für UTF-16BE usw.), wird die Codierung mit nahezu Sicherheit identifiziert. Die Stücklistenerkennung ist die zuverlässigste Methode und hat Vorrang.
- Statistische Codierungsanalyse – Wenn keine BOM gefunden wird, führt das Tool eine mehrschichtige statistische Analyse durch: UTF-8-Bytesequenzvalidierung (Prüfung korrekter Multibyte-Sequenzen und Ablehnung überlanger/Ersatzcodierungen), Null-Byte-Verteilungsanalyse für die UTF-16/UTF-32-Erkennung, High-Byte-Mustervergleich für Einzelbyte-Codierungen (ISO-8859-1, Windows-1252, KOI8-R) und ASCII-Bereichsprüfung für 7-Bit-ASCII-Text.
Unterstützte Kodierungserkennungsmethoden
- BOM-Erkennung (Byte Order Mark): Identifiziert 11 BOM-Signaturen, darunter UTF-8 (EF BB BF), UTF-16BE/LE, UTF-32BE/LE, UTF-7, UTF-1, SCSU, BOCU-1 und GB-18030. Die Stücklistenerkennung bietet eine Zuverlässigkeit von >99 % und ist der Goldstandard für Unicode-Kodierungen.
- UTF-8-Validierung: Vollständige RFC 3629-konforme Validierung, die die richtigen Startbytes (0xC2-0xDF, 0xE0-0xEF, 0xF0-0xF4), gültige Fortsetzungsbytes (0x80-0xBF), die Ablehnung überlanger Sequenzen, Ersatzhälften (0xED 0xA0+) und Codepunkte über U+10FFFF (0xF4) überprüft 0x90+).
- Statistische UTF-16-Erkennung: Analysiert Null-Byte-Positionen, um Big-Endian von Little-Endian in UTF-16-codiertem Text zu unterscheiden. Sucht nach Zeichen im ASCII-Bereich (wobei ein Byte 0x00 und das andere 0x20-0x7E ist), um die Bytereihenfolge zu bestimmen.
- Einzelbyte-Kodierungserkennung: Verwendet Zeichenhäufigkeitsanalyse und Überprüfung des gültigen Bytebereichs für ISO-8859-Familien, Windows-Codepages (1250, 1251, 1252), KOI8-R/U, MacRoman und IBM437/850/866. Windows-1252 unterscheidet sich von ISO-8859-1 durch die Erkennung der Bytes 0x80-0x9F, die in Windows-1252, aber nicht in ISO-8859-1 gültig sind.
Datenschutz, Sicherheit und Verfügbarkeit
Der Text Encoding Detector verarbeitet alles lokal in Ihrem Browser. Es werden niemals Text- oder Dateidaten auf einen Server hochgeladen – das gesamte Stücklistenscannen, die UTF-8-Validierung und die statistische Analyse erfolgen auf Ihrem Gerät mithilfe des Browsers TextEncoder und typisierter Arrays. Es gibt keine Anmeldeanforderungen, keine Nutzungsbeschränkungen, keine Premium-Funktionen und keine Datenprotokollierung. Das Tool ist für jeden Zweck völlig kostenlos – zum Debuggen von Mojibake, zum Analysieren älterer Dateien oder zum Erlernen von Zeichenkodierungen.
Häufig gestellte Fragen
Ein Text Encoding Detector analysiert Rohbytes und ermittelt, welche Zeichenkodierung zum Erstellen des Textes verwendet wurde. Es erkennt UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, KOI8-R und mehr, indem es nach Byte Order Marks (BOM) sucht, UTF-8-Bytesequenzen validiert und High-Byte-Muster statistisch analysiert. Dies ist wichtig, um verstümmelten Text (Mojibake) zu reparieren und ältere Dateien korrekt zu interpretieren.
Das Tool erkennt über 30 Kodierungen: UTF-8, UTF-16BE/LE, UTF-32BE/LE, ASCII (7-Bit), ISO-8859-1 bis ISO-8859-15, Windows-1252, Windows-1251, Windows-1250, Shift-JIS, EUC-JP, ISO-2022-JP, GB2312, GBK, GB 18030, Big5, Big5-HKSCS, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437, IBM850 und IBM866. Für jede Erkennung werden ein Konfidenzwert und die verwendete Erkennungsmethode angezeigt.
Eine Byte Order Mark (BOM) ist eine spezielle Bytesequenz am Anfang einer Textdatei, die deren Codierung und Bytereihenfolge angibt. Beispielsweise steht EF BB BF für UTF-8, FE FF für UTF-16BE und FF FE für UTF-16LE. Stücklisten sind die zuverlässigste Möglichkeit, Codierungen zu identifizieren. Das Tool erkennt 11 verschiedene Stücklistensignaturen, darunter UTF-7, SCSU, BOCU-1 und GB-18030.
Die auf Stücklisten basierende Erkennung ist zu 99 % genau, da es sich bei Stücklisten um explizite Kodierungsmarkierungen handelt. Die statistische Erkennungsgenauigkeit hängt von der Textmenge und der Eindeutigkeit der Kodierung ab. Bei Texten mit vielen High-Byte-Zeichen ist die Genauigkeit sehr hoch. Für kurze reine ASCII-Texte können mehrere Kodierungen gültig erscheinen – das Tool zeigt alle Möglichkeiten nach Zuverlässigkeit sortiert an.
Ja – wechseln Sie zur Registerkarte „Datei hochladen“, um eine Datei von Ihrem Gerät auszuwählen. Das Tool liest die Datei mithilfe der FileReader-API des Browsers als Rohbytes und führt alle Analysen lokal durch. Dateien bis zu 1 MB werden unterstützt. Es werden niemals Daten an einen Server gesendet.
Die Byte-Statistiken zeigen: Anzahl und Prozentsatz druckbarer ASCII-Zeichen (Bytes 0x20-0x7E), Nullbyte-Anzahl (0x00 – hohe Zahlen deuten auf UTF-16- oder Binärdaten hin), hohe Byte-Anzahl (>0x7F – zeigt Nicht-ASCII-Inhalt an) und eine Text-/Binärklassifizierung. Das Byte-Histogramm kodiert außerdem jedes Byte farblich als druckbares ASCII-Byte (grün), High-Byte (blau) oder Null-Byte (rot) zur einfachen visuellen Analyse.
Das Tool führt eine vollständige RFC 3629-konforme UTF-8-Validierung durch und prüft die richtigen Startbytes (0xC2-0xF4), die korrekten Fortsetzungsbytes (0x80-0xBF), die Ablehnung überlanger Sequenzen, Ersatzhälften und Codepunkte über U+10FFFF. Wenn der gesamte Bytestrom alle Prüfungen besteht, wird UTF-8 mit einem hohen Konfidenzwert gemeldet.
ISO-8859-1 und Windows-1252 sind für die Bytes 0xA0-0xFF identisch, unterscheiden sich jedoch im Bereich 0x80-0x9F. In ISO-8859-1 sind diese Bytes Steuerzeichen. In Windows-1252 enthalten sie druckbare Zeichen wie Anführungszeichen, Bindestriche, das Eurozeichen (€) und Markensymbole. Das Tool erkennt Windows-1252-spezifische Bytes, um die beiden Codierungen zu unterscheiden.
Ja – 100 % kostenlos, für immer. Keine Anmeldung, kein Konto, keine Premium-Stufe, keine Nutzungsbeschränkungen und keine Werbung. Erkennen Sie die Codierung für so viel Text, wie Sie benötigen. Die gesamte Verarbeitung erfolgt lokal in Ihrem Browser, ohne Server-Uploads.