Saltar al contenido
Aback Tools Logo

Detector de codificación de texto

Pegue texto o cargue un archivo para detectar instantáneamente su codificación de caracteres. El detector de codificación de texto comprueba las marcas de orden de bytes (BOM), valida secuencias de bytes UTF-8 y utiliza análisis estadístico para identificar la codificación con puntuaciones de confianza. Detecta UTF-8, UTF-16, UTF-32, ISO-8859-1 a ISO-8859-15, Windows-1252, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437 y más: todo el procesamiento se ejecuta localmente en su navegador, sin cargas, sin registro, completamente gratis.

Text Encoding Detector

Paste text or upload a file to detect its character encoding. The tool checks for Byte Order Marks (BOM), validates UTF-8 sequences, and uses statistical analysis to identify the encoding with a confidence score. Detects UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, Big5, KOI8-R, and more - all processing runs locally in your browser.

Ctrl+Enter to detect encoding · 0 characters

¿Por qué utilizar nuestro detector de codificación de texto?

  • Detecta más de 15 codificaciones de caracteres: el detector de codificación de texto identifica UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), ISO-8859-1 a ISO-8859-15, Windows-1252, Windows-1251, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437 y más. Cada detección incluye una puntuación de confianza para ayudarle a elegir la codificación correcta.
  • BOM y análisis estadístico: la herramienta primero verifica las marcas de orden de bytes (BOM), la forma definitiva de identificar codificaciones UTF. Si no se encuentra ninguna BOM, utiliza análisis estadístico: validación de secuencia de bytes UTF-8, coincidencia de patrones de bytes altos, análisis de frecuencia de caracteres y distribución de bytes nulos para identificar la codificación con alta precisión.
  • Referencia de codificación completa: cada codificación detectada incluye una etiqueta legible por humanos, una categoría (Unicode, occidental, cirílico, japonés, chino, etc.) y una breve descripción. La herramienta también muestra todos los alias de codificación (por ejemplo, "latin1", "cp1252", "sjis") para que pueda usar el nombre correcto en su código o configuración de base de datos.
  • Procesamiento de navegador 100% privado: su texto y archivos nunca salen de su dispositivo. Toda la detección de codificación, desde el escaneo de BOM hasta el análisis estadístico, se realiza localmente utilizando el navegador TextEncoder y matrices escritas. Sin cargas de servidor, sin registro de datos, no es necesario registrarse. Completamente gratis y privado.

Casos de uso comunes para el detector de codificación de texto

  • Recuperación de exportación de bases de datos: cuando las bases de datos exportan volcados CSV o SQL con declaraciones de codificación incorrectas, utilice el detector de codificación de texto para identificar la codificación real de los datos exportados. Esto es esencial al importar datos heredados o recuperar contenido de exportaciones mal configuradas con texto confuso.
  • Integración de API y raspado web: al raspar sitios web o consumir API que no declaran su conjunto de caracteres, detecte la codificación del cuerpo de la respuesta antes de procesar. El detector de codificación de texto lo ayuda a identificar UTF-8, Shift-JIS, GB2312 y otras codificaciones comúnmente utilizadas en contenido web internacional.
  • Conversión de documentos heredados: convierta documentos heredados guardados en Windows-1252, MacRoman, IBM437 u otras codificaciones heredadas a UTF-8 moderno. Primero detecte la codificación original y luego utilice la información para transcodificar correctamente el archivo sin perder caracteres acentuados, símbolos o formatos especiales.
  • Depuración de Mojibake (texto confuso): cuando el texto se muestra como caracteres confusos (mojibake, como "é" en lugar de "é"), utilice el detector de codificación de texto en los bytes sin formato para determinar la codificación real. Compare la codificación detectada con la codificación declarada para diagnosticar y corregir la discrepancia.
  • Análisis de contenido multilingüe: al procesar contenido multilingüe que mezcla escrituras (cirílico, japonés, chino, árabe, hebreo, coreano), el detector de codificación de texto identifica la codificación utilizada para cada segmento de texto. Esencial para proyectos de localización, flujos de trabajo de traducción y migración internacional de CMS.
  • Validación de codificación de carga de archivos: al crear aplicaciones que acepten cargas de archivos, valide que el archivo cargado utilice la codificación esperada antes de procesarlo. El detector de codificación de texto se puede utilizar para verificar que los archivos CSV, los archivos de configuración o las exportaciones de datos utilicen UTF-8 u otra codificación requerida.

¿Qué es la detección de codificación de texto?

La detección de codificación de texto es el proceso de identificar qué codificación de caracteres se utilizó para codificar una secuencia de bytes en texto legible. Cuando se guarda texto en un archivo, sus caracteres se convierten a bytes según un esquema de codificación: UTF-8, Windows-1252, Shift-JIS y otros. El detector de codificación de texto analiza patrones de bytes, busca marcas de orden de bytes (BOM), valida secuencias UTF-8 y utiliza análisis estadístico para determinar qué codificación es más probable, lo que le ayuda a interpretar correctamente texto confuso o desconocido.

Cómo funciona nuestro detector de codificación de texto

  1. Ingrese texto o archivo: pegue el texto directamente en el área de texto o cargue un archivo. La herramienta lee los bytes sin procesar utilizando la API FileReader del navegador. Si pega texto, lo codifica como bytes UTF-8 para su análisis. Todo el procesamiento es local: no se carga nada en ningún servidor.
  2. Escaneo de marca de orden de bytes (BOM): la herramienta verifica los primeros bytes de los datos en busca de firmas de BOM conocidas. Si se encuentra una lista de materiales (EF BB BF para UTF-8, FF FE para UTF-16LE, FE FF para UTF-16BE, etc.), la codificación se identifica casi con certeza. La detección de BOM es el método más fiable y tiene prioridad.
  3. Análisis de codificación estadística: si no se encuentra ninguna BOM, la herramienta realiza un análisis estadístico de múltiples capas: validación de secuencia de bytes UTF-8 (verificando secuencias de varios bytes adecuadas y rechazando codificaciones sustitutas/demasiado largas), análisis de distribución de bytes nulos para detección de UTF-16/UTF-32, coincidencia de patrones de bytes altos para codificaciones de un solo byte (ISO-8859-1, Windows-1252, KOI8-R) y verificación de rango ASCII para Texto ASCII de 7 bits.

Métodos de detección de codificación admitidos

  • Detección de BOM (marca de orden de bytes): identifica 11 firmas de BOM, incluidas UTF-8 (EF BB BF), UTF-16BE/LE, UTF-32BE/LE, UTF-7, UTF-1, SCSU, BOCU-1 y GB-18030. La detección de BOM ofrece >99 % de confianza y es el estándar de oro para las codificaciones Unicode.
  • Validación UTF-8: validación completa compatible con RFC 3629 que verifica los bytes de inicio adecuados (0xC2-0xDF, 0xE0-0xEF, 0xF0-0xF4), bytes de continuación válidos (0x80-0xBF), rechazo de secuencias demasiado largas, mitades sustitutas (0xED 0xA0+) y puntos de código superiores a U+10FFFF (0xF4). 0x90+).
  • Detección estadística UTF-16: analiza las posiciones de bytes nulos para distinguir big endian de little endian en texto codificado en UTF-16. Busca caracteres de rango ASCII (donde un byte es 0x00 y el otro es 0x20-0x7E) para determinar el orden de los bytes.
  • Detección de codificación de un solo byte: utiliza análisis de frecuencia de caracteres y verificación de rango de bytes válidos para familias ISO-8859, páginas de códigos de Windows (1250, 1251, 1252), KOI8-R/U, MacRoman e IBM437/850/866. Windows-1252 se distingue de ISO-8859-1 al detectar bytes 0x80-0x9F que son válidos en Windows-1252 pero no en ISO-8859-1.

Privacidad, seguridad y disponibilidad

El detector de codificación de texto procesa todo localmente en su navegador. Nunca se cargan datos de texto o archivos a ningún servidor: todo el escaneo de BOM, la validación UTF-8 y el análisis estadístico se realizan en su dispositivo utilizando el navegador TextEncoder y matrices escritas. No hay requisitos de registro, límites de uso, funciones premium ni registro de datos. La herramienta es completamente gratuita para cualquier propósito: depurar mojibake, analizar archivos heredados o aprender sobre codificaciones de caracteres.

Preguntas frecuentes

Un detector de codificación de texto analiza bytes sin procesar y determina qué codificación de caracteres se utilizó para crear el texto. Detecta UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, KOI8-R y más buscando marcas de orden de bytes (BOM), validando secuencias de bytes UTF-8 y analizando estadísticamente patrones de bytes altos. Esto es esencial para corregir texto confuso (mojibake) e interpretar correctamente archivos heredados.

La herramienta detecta más de 30 codificaciones: UTF-8, UTF-16BE/LE, UTF-32BE/LE, ASCII (7 bits), ISO-8859-1 a ISO-8859-15, Windows-1252, Windows-1251, Windows-1250, Shift-JIS, EUC-JP, ISO-2022-JP, GB2312, GBK, GB. 18030, Big5, Big5-HKSCS, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437, IBM850 e IBM866. Cada detección muestra una puntuación de confianza y el método de detección utilizado.

Una marca de orden de bytes (BOM) es una secuencia de bytes especial al comienzo de un archivo de texto que declara su codificación y orden de bytes. Por ejemplo, EF BB BF indica UTF-8, FE FF indica UTF-16BE y FF FE indica UTF-16LE. Las listas de materiales son la forma más confiable de identificar codificaciones. La herramienta detecta 11 firmas de BOM diferentes, incluidas UTF-7, SCSU, BOCU-1 y GB-18030.

La detección basada en BOM tiene una precisión del 99 % ya que las BOM son marcadores de codificación explícitos. La precisión de la detección estadística depende de la cantidad de texto y del carácter distintivo de la codificación. Para texto con muchos caracteres de bytes altos, la precisión es muy alta. Para texto breve solo en ASCII, pueden parecer válidas varias codificaciones: la herramienta muestra todas las posibilidades clasificadas por confianza.

Sí, cambie a la pestaña "Cargar archivo" para seleccionar un archivo de su dispositivo. La herramienta lee el archivo como bytes sin formato utilizando la API FileReader del navegador y realiza todos los análisis localmente. Se admiten archivos de hasta 1 MB. Nunca se envían datos a un servidor.

Las estadísticas de bytes muestran: recuento y porcentaje de caracteres imprimibles ASCII (bytes 0x20-0x7E), recuento de bytes nulos (0x00: los recuentos altos sugieren datos UTF-16 o binarios), recuento alto de bytes (>0x7F: indica contenido no ASCII) y una clasificación de texto/binario. El histograma de bytes también codifica con colores cada byte como ASCII imprimible (verde), byte alto (azul) o byte nulo (rojo) para facilitar el análisis visual.

La herramienta realiza una validación UTF-8 completa que cumple con RFC 3629, verificando los bytes de inicio adecuados (0xC2-0xF4), los bytes de continuación correctos (0x80-0xBF), el rechazo de secuencias demasiado largas, mitades sustitutas y puntos de código superiores a U+10FFFF. Si todo el flujo de bytes pasa todas las comprobaciones, se informa UTF-8 con una puntuación de confianza alta.

ISO-8859-1 y Windows-1252 son idénticos para los bytes 0xA0-0xFF pero difieren en el rango 0x80-0x9F. En ISO-8859-1, estos bytes son caracteres de control. En Windows-1252, contienen caracteres imprimibles como comillas tipográficas, guiones, el signo del euro (€) y símbolos de marcas comerciales. La herramienta detecta bytes específicos de Windows-1252 para distinguir las dos codificaciones.

Sí, 100% gratis, para siempre. Sin registro, sin cuenta, sin nivel premium, sin límites de uso y sin anuncios. Detecta la codificación de todo el texto que necesites. Todo el procesamiento se realiza localmente en su navegador sin cargas en el servidor.