Détecteur d'encodage de texte
Collez du texte ou téléchargez un fichier pour détecter instantanément son encodage de caractères. Le détecteur d'encodage de texte vérifie les marques d'ordre d'octets (BOM), valide les séquences d'octets UTF-8 et utilise l'analyse statistique pour identifier l'encodage avec des scores de confiance. Détecte UTF-8, UTF-16, UTF-32, ISO-8859-1 à ISO-8859-15, Windows-1252, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437, et plus encore - tous les traitements s'exécutent localement dans votre navigateur, pas de téléchargement, pas d'inscription, entièrement gratuit.
Paste text or upload a file to detect its character encoding. The tool checks for Byte Order Marks (BOM), validates UTF-8 sequences, and uses statistical analysis to identify the encoding with a confidence score. Detects UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, Big5, KOI8-R, and more - all processing runs locally in your browser.
Ctrl+Enter to detect encoding · 0 characters
Pourquoi utiliser notre détecteur d'encodage de texte ?
- Détecte plus de 15 encodages de caractères : le détecteur d'encodage de texte identifie UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), ISO-8859-1 à ISO-8859-15, Windows-1252, Windows-1251, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437 et plus encore. Chaque détection comprend un score de confiance pour vous aider à choisir le bon encodage.
- Nomenclature et analyse statistique : l'outil vérifie d'abord les marques d'ordre d'octets (BOM) - le moyen définitif d'identifier les encodages UTF. Si aucune nomenclature n'est trouvée, il utilise une analyse statistique : validation de séquence d'octets UTF-8, correspondance de modèles d'octets de poids fort, analyse de fréquence de caractères et distribution d'octets nuls pour identifier l'encodage avec une grande précision.
- Référence complète d'encodage : chaque encodage détecté comprend une étiquette lisible par l'homme, une catégorie (Unicode, occidental, cyrillique, japonais, chinois, etc.) et une brève description. L'outil affiche également tous les alias d'encodage (par exemple, "latin1", "cp1252", "sjis") afin que vous puissiez utiliser le bon nom dans votre code ou dans la configuration de votre base de données.
- Traitement 100 % par navigateur privé : vos textes et fichiers ne quittent jamais votre appareil. Toute détection d'encodage - de l'analyse de nomenclature à l'analyse statistique - s'effectue localement à l'aide du navigateur TextEncoder et des tableaux typés. Aucun téléchargement de serveur, aucune journalisation de données, aucune inscription requise. Entièrement gratuit et privé.
Cas d'utilisation courants du détecteur d'encodage de texte
- Récupération d'exportation de base de données : lorsque les bases de données exportent des dumps CSV ou SQL avec des déclarations de codage incorrectes, utilisez le détecteur de codage de texte pour identifier le codage réel des données exportées. Ceci est essentiel lors de l’importation de données héritées ou de la récupération de contenu à partir d’exportations mal configurées avec du texte tronqué.
- Web Scraping et intégration d'API : lors du scraping de sites Web ou de la consommation d'API qui ne déclarent pas leur jeu de caractères, détectez l'encodage du corps de la réponse avant le traitement. Le détecteur d'encodage de texte vous aide à identifier UTF-8, Shift-JIS, GB2312 et d'autres encodages couramment utilisés dans le contenu Web international.
- Conversion de documents hérités : convertissez les documents hérités enregistrés sous Windows-1252, MacRoman, IBM437 ou d'autres encodages hérités en UTF-8 moderne. Détectez d’abord l’encodage d’origine, puis utilisez les informations pour transcoder correctement le fichier sans perdre les caractères accentués, les symboles ou le formatage spécial.
- Débogage de Mojibake (texte tronqué) : lorsque le texte s'affiche sous forme de caractères tronqués (mojibake - comme "é" au lieu de "é"), utilisez le détecteur d'encodage de texte sur les octets bruts pour déterminer l'encodage réel. Comparez l'encodage détecté avec l'encodage déclaré pour diagnostiquer et corriger l'incompatibilité.
- Analyse de contenu multilingue : lors du traitement de contenu multilingue mélangeant des scripts - cyrillique, japonais, chinois, arabe, hébreu, coréen - le détecteur d'encodage de texte identifie l'encodage utilisé pour chaque segment de texte. Indispensable pour les projets de localisation, les flux de traduction et la migration internationale vers un CMS.
- Validation du codage du téléchargement de fichiers : lors de la création d'applications qui acceptent les téléchargements de fichiers, vérifiez que le fichier téléchargé utilise le codage attendu avant le traitement. Le détecteur d'encodage de texte peut être utilisé pour vérifier que les fichiers CSV, les fichiers de configuration ou les exportations de données utilisent UTF-8 ou un autre encodage requis.
Qu’est-ce que la détection d’encodage de texte ?
La détection du codage de texte est le processus d'identification du codage de caractères utilisé pour coder une séquence d'octets en texte lisible. Lorsque le texte est enregistré dans un fichier, ses caractères sont convertis en octets selon un schéma de codage : UTF-8, Windows-1252, Shift-JIS et autres. Le détecteur d'encodage de texte analyse les modèles d'octets, recherche les marques d'ordre d'octets (BOM), valide les séquences UTF-8 et utilise l'analyse statistique pour déterminer quel encodage est le plus probable, vous aidant ainsi à interpréter correctement un texte tronqué ou inconnu.
Comment fonctionne notre détecteur d'encodage de texte
- Saisir du texte ou un fichier - Collez le texte directement dans la zone de texte ou téléchargez un fichier. L'outil lit les octets bruts à l'aide de l'API FileReader du navigateur. Si vous collez du texte, il le code en octets UTF-8 pour analyse. Tout le traitement est local - rien n'est téléchargé sur un serveur.
- Analyse des marques d'ordre d'octets (BOM) - L'outil vérifie les premiers octets des données pour les signatures de nomenclature connues. Si une nomenclature est trouvée (EF BB BF pour UTF-8, FF FE pour UTF-16LE, FE FF pour UTF-16BE, etc.), l'encodage est identifié avec une quasi-certitude. La détection de nomenclature est la méthode la plus fiable et est prioritaire.
- Analyse statistique du codage - Si aucune nomenclature n'est trouvée, l'outil effectue une analyse statistique multicouche : validation de la séquence d'octets UTF-8 (vérification des séquences multi-octets appropriées et rejet des codages trop longs/de substitution), analyse de la distribution des octets nuls pour la détection UTF-16/UTF-32, correspondance des modèles d'octets élevés pour les codages à un octet (ISO-8859-1, Windows-1252, KOI8-R) et vérification de la plage ASCII pour Texte ASCII 7 bits.
Méthodes de détection d'encodage prises en charge
- Détection BOM (Byte Order Mark) : identifie 11 signatures BOM, dont UTF-8 (EF BB BF), UTF-16BE/LE, UTF-32BE/LE, UTF-7, UTF-1, SCSU, BOCU-1 et GB-18030. La détection de nomenclature donne une confiance >99 % et constitue la référence en matière de codages Unicode.
- Validation UTF-8 : validation complète conforme à la RFC 3629 vérifiant les octets de démarrage appropriés (0xC2-0xDF, 0xE0-0xEF, 0xF0-0xF4), les octets de continuation valides (0x80-0xBF), le rejet des séquences trop longues, les moitiés de substitution (0xED 0xA0+) et les points de code supérieurs à U+10FFFF (0xF4 0x90+).
- Détection statistique UTF-16 : analyse les positions des octets nuls pour distinguer le gros-boutiste du petit-boutiste dans le texte codé en UTF-16. Analyse les caractères de plage ASCII (où un octet est 0x00 et l'autre est 0x20-0x7E) pour déterminer l'ordre des octets.
- Détection de codage sur un seul octet : utilise l'analyse de la fréquence des caractères et la vérification de la plage d'octets valide pour les familles ISO-8859, les pages de codes Windows (1250, 1251, 1252), KOI8-R/U, MacRoman et IBM437/850/866. Windows-1252 se distingue de l'ISO-8859-1 en détectant les octets 0x80-0x9F qui sont valides dans Windows-1252 mais pas dans ISO-8859-1.
Confidentialité, sécurité et disponibilité
Le détecteur d'encodage de texte traite tout localement dans votre navigateur. Aucune donnée de texte ou de fichier n'est jamais téléchargée sur un serveur - toutes les analyses de nomenclature, validation UTF-8 et analyses statistiques se produisent sur votre appareil à l'aide du navigateur TextEncoder et des tableaux saisis. Il n'y a aucune condition d'inscription, aucune limite d'utilisation, aucune fonctionnalité premium et aucune enregistrement de données. L'outil est entièrement gratuit pour tout usage : débogage de Mojibake, analyse de fichiers hérités ou apprentissage des encodages de caractères.
Foire aux questions
Un détecteur de codage de texte analyse les octets bruts et détermine quel codage de caractères a été utilisé pour créer le texte. Il détecte UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, KOI8-R, etc. en recherchant les marques d'ordre d'octets (BOM), en validant les séquences d'octets UTF-8 et en analysant statistiquement les modèles d'octets élevés. Ceci est essentiel pour corriger le texte tronqué (mojibake) et interpréter correctement les fichiers hérités.
L'outil détecte plus de 30 encodages : UTF-8, UTF-16BE/LE, UTF-32BE/LE, ASCII (7 bits), ISO-8859-1 à ISO-8859-15, Windows-1252, Windows-1251, Windows-1250, Shift-JIS, EUC-JP, ISO-2022-JP, GB2312, GBK, GB. 18030, Big5, Big5-HKSCS, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437, IBM850 et IBM866. Chaque détection affiche un score de confiance et la méthode de détection utilisée.
Une marque d'ordre d'octets (BOM) est une séquence d'octets spéciale au début d'un fichier texte qui déclare son encodage et son ordre d'octets. Par exemple, EF BB BF indique UTF-8, FE FF indique UTF-16BE et FF FE indique UTF-16LE. Les nomenclatures constituent le moyen le plus fiable d’identifier les encodages. L'outil détecte 11 signatures de nomenclature différentes, dont UTF-7, SCSU, BOCU-1 et GB-18030.
La détection basée sur les nomenclatures est précise à 99 % puisque les nomenclatures sont des marqueurs de codage explicites. La précision de la détection statistique dépend de la quantité de texte et du caractère distinctif du codage. Pour le texte comportant de nombreux caractères à octets de poids élevé, la précision est très élevée. Pour un texte court uniquement en ASCII, plusieurs encodages peuvent sembler valides : l'outil affiche toutes les possibilités classées par niveau de confiance.
Oui - passez à l'onglet "Télécharger un fichier" pour sélectionner un fichier sur votre appareil. L'outil lit le fichier sous forme d'octets bruts à l'aide de l'API FileReader du navigateur et effectue toutes les analyses localement. Les fichiers jusqu'à 1 Mo sont pris en charge. Aucune donnée n'est jamais envoyée à un serveur.
Les statistiques d'octets affichent : le nombre et le pourcentage de caractères imprimables ASCII (octets 0x20-0x7E), le nombre d'octets nuls (0x00 - un nombre élevé suggère des données UTF-16 ou binaires), un nombre d'octets élevé (> 0x7F - indique un contenu non-ASCII) et une classification texte/binaire. L'histogramme d'octets code également chaque octet en couleur ASCII imprimable (vert), octet de poids fort (bleu) ou octet nul (rouge) pour une analyse visuelle facile.
L'outil effectue une validation UTF-8 complète conforme à la RFC 3629 en vérifiant les octets de démarrage appropriés (0xC2-0xF4), les octets de continuation corrects (0x80-0xBF), le rejet des séquences trop longues, les moitiés de substitution et les points de code supérieurs à U+10FFFF. Si l'intégralité du flux d'octets réussit toutes les vérifications, UTF-8 est signalé avec un score de confiance élevé.
ISO-8859-1 et Windows-1252 sont identiques pour les octets 0xA0-0xFF mais diffèrent dans la plage 0x80-0x9F. Dans ISO-8859-1, ces octets sont des caractères de contrôle. Sous Windows-1252, ils contiennent des caractères imprimables tels que des guillemets intelligents, des tirets, le signe euro (€) et des symboles de marque. L'outil détecte les octets spécifiques à Windows 1252 pour distinguer les deux encodages.
Oui, 100 % gratuit, pour toujours. Pas d'inscription, pas de compte, pas de niveau premium, pas de limites d'utilisation et pas de publicité. Détectez l’encodage pour autant de texte que nécessaire. Tout le traitement est effectué localement dans votre navigateur sans aucun téléchargement sur le serveur.