Pular para o conteúdo
Aback Tools Logo

Detector de codificação de texto

Cole texto ou carregue um arquivo para detectar instantaneamente sua codificação de caracteres. O Detector de codificação de texto verifica marcas de ordem de bytes (BOM), valida sequências de bytes UTF-8 e usa análise estatística para identificar a codificação com pontuações de confiança. Detecta UTF-8, UTF-16, UTF-32, ISO-8859-1 até ISO-8859-15, Windows-1252, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437 e muito mais - todo o processamento é executado localmente em seu navegador, sem uploads, sem inscrição, completamente grátis.

Text Encoding Detector

Paste text or upload a file to detect its character encoding. The tool checks for Byte Order Marks (BOM), validates UTF-8 sequences, and uses statistical analysis to identify the encoding with a confidence score. Detects UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, Big5, KOI8-R, and more - all processing runs locally in your browser.

Ctrl+Enter to detect encoding · 0 characters

Por que usar nosso detector de codificação de texto?

  • Detecta mais de 15 codificações de caracteres: o detector de codificação de texto identifica UTF-8, UTF-16 (BE/LE), UTF-32 (BE/LE), ISO-8859-1 a ISO-8859-15, Windows-1252, Windows-1251, Shift-JIS, EUC-JP, GB2312, GBK, Big5, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437 e muito mais. Cada detecção inclui uma pontuação de confiança para ajudá-lo a escolher a codificação correta.
  • BOM e análise estatística: A ferramenta primeiro verifica as marcas de ordem de bytes (BOM) - a maneira definitiva de identificar codificações UTF. Se nenhuma lista técnica for encontrada, ele usa análise estatística: validação de sequência de bytes UTF-8, correspondência de padrões de bytes altos, análise de frequência de caracteres e distribuição de bytes nulos para identificar a codificação com alta precisão.
  • Referência abrangente de codificação: cada codificação detectada inclui um rótulo legível por humanos, categoria (Unicode, ocidental, cirílico, japonês, chinês, etc.) e uma breve descrição. A ferramenta também mostra todos os aliases de codificação (por exemplo, "latin1", "cp1252", "sjis") para que você possa usar o nome correto em seu código ou configuração de banco de dados.
  • Processamento 100% privado do navegador: seus textos e arquivos nunca saem do seu dispositivo. Toda a detecção de codificação - desde a verificação da lista de materiais até a análise estatística - acontece localmente usando o navegador TextEncoder e matrizes digitadas. Sem uploads de servidor, sem registro de dados, sem necessidade de inscrição. Totalmente gratuito e privado.

Casos de uso comuns para detector de codificação de texto

  • Recuperação de exportação de banco de dados: quando os bancos de dados exportam dumps CSV ou SQL com declarações de codificação incorretas, use o Detector de codificação de texto para identificar a codificação real dos dados exportados. Isso é essencial ao importar dados legados ou recuperar conteúdo de exportações mal configuradas com texto distorcido.
  • Web Scraping e integração de API: Ao copiar sites ou consumir APIs que não declaram seu conjunto de caracteres, detecte a codificação do corpo da resposta antes do processamento. O Detector de codificação de texto ajuda a identificar UTF-8, Shift-JIS, GB2312 e outras codificações comumente usadas em conteúdo da web internacional.
  • Conversão de documentos legados: Converta documentos legados salvos em Windows-1252, MacRoman, IBM437 ou outras codificações legadas para UTF-8 moderno. Primeiro detecte a codificação original e, em seguida, use as informações para transcodificar corretamente o arquivo sem perder caracteres acentuados, símbolos ou formatação especial.
  • Depurando Mojibake (texto ilegível): quando o texto é exibido como caracteres ilegíveis (mojibake - como "é" em vez de "é"), use o Detector de codificação de texto nos bytes brutos para determinar a codificação real. Compare a codificação detectada com a codificação declarada para diagnosticar e corrigir a incompatibilidade.
  • Análise de conteúdo multilíngue: Ao processar conteúdo multilíngue que mistura scripts - cirílico, japonês, chinês, árabe, hebraico, coreano - o Detector de codificação de texto identifica a codificação usada para cada segmento de texto. Essencial para projetos de localização, fluxos de trabalho de tradução e migração internacional de CMS.
  • Validação de codificação de upload de arquivo: ao criar aplicativos que aceitam uploads de arquivo, valide se o arquivo carregado usa a codificação esperada antes do processamento. O Detector de codificação de texto pode ser usado para verificar se arquivos CSV, arquivos de configuração ou exportações de dados usam UTF-8 ou outra codificação necessária.

O que é detecção de codificação de texto?

A detecção de codificação de texto é o processo de identificar qual codificação de caracteres foi usada para codificar uma sequência de bytes em texto legível. Quando o texto é salvo em um arquivo, seus caracteres são convertidos em bytes de acordo com um esquema de codificação - UTF-8, Windows-1252, Shift-JIS e outros. O Detector de codificação de texto analisa padrões de bytes, procura marcas de ordem de bytes (BOM), valida sequências UTF-8 e usa análise estatística para determinar qual codificação é mais provável, ajudando você a interpretar corretamente texto distorcido ou desconhecido.

Como funciona nosso detector de codificação de texto

  1. Insira texto ou arquivo - cole o texto diretamente na área de texto ou carregue um arquivo. A ferramenta lê os bytes brutos usando a API FileReader do navegador. Se você colar texto, ele será codificado como bytes UTF-8 para análise. Todo o processamento é local – nada é carregado em nenhum servidor.
  2. Varredura de marca de ordem de byte (BOM) - A ferramenta verifica os primeiros bytes dos dados em busca de assinaturas de BOM conhecidas. Se uma lista técnica for encontrada (EF BB BF para UTF-8, FF FE para UTF-16LE, FE FF para UTF-16BE, etc.), a codificação é identificada com quase certeza. A detecção de BOM é o método mais confiável e tem prioridade.
  3. Análise de codificação estatística - Se nenhuma BOM for encontrada, a ferramenta executa análise estatística multicamada: validação de sequência de bytes UTF-8 (verificando sequências multibyte adequadas e rejeitando codificações excessivamente longas/substitutas), análise de distribuição de byte nulo para detecção de UTF-16/UTF-32, correspondência de padrão de byte alto para codificações de byte único (ISO-8859-1, Windows-1252, KOI8-R) e verificação de intervalo ASCII para Texto ASCII de 7 bits.

Métodos de detecção de codificação suportados

  • Detecção de BOM (marca de ordem de byte): identifica 11 assinaturas de BOM, incluindo UTF-8 (EF BB BF), UTF-16BE/LE, UTF-32BE/LE, UTF-7, UTF-1, SCSU, BOCU-1 e GB-18030. A detecção de BOM oferece mais de 99% de confiança e é o padrão ouro para codificações Unicode.
  • Validação UTF-8: Validação completa em conformidade com RFC 3629, verificando bytes de início adequados (0xC2-0xDF, 0xE0-0xEF, 0xF0-0xF4), bytes de continuação válidos (0x80-0xBF), rejeição de sequências longas, metades substitutas (0xED 0xA0+) e pontos de código acima de U+10FFFF (0xF4 0x90+).
  • Detecção estatística UTF-16: analisa posições de bytes nulos para distinguir big-endian de little-endian em texto codificado em UTF-16. Verifica caracteres do intervalo ASCII (onde um byte é 0x00 e o outro é 0x20-0x7E) para determinar a ordem dos bytes.
  • Detecção de codificação de byte único: usa análise de frequência de caracteres e verificação de intervalo de bytes válidos para famílias ISO-8859, páginas de código do Windows (1250, 1251, 1252), KOI8-R/U, MacRoman e IBM437/850/866. O Windows-1252 se distingue do ISO-8859-1 ao detectar os bytes 0x80-0x9F que são válidos no Windows-1252, mas não no ISO-8859-1.

Privacidade, segurança e disponibilidade

O Detector de codificação de texto processa tudo localmente no seu navegador. Nenhum texto ou dado de arquivo é carregado em qualquer servidor - toda a verificação de BOM, validação UTF-8 e análise estatística acontecem em seu dispositivo usando o navegador TextEncoder e matrizes digitadas. Não há requisitos de inscrição, limites de uso, recursos premium e registro de dados. A ferramenta é totalmente gratuita para qualquer finalidade - depurar mojibake, analisar arquivos legados ou aprender sobre codificações de caracteres.

Perguntas frequentes

Um detector de codificação de texto analisa bytes brutos e determina qual codificação de caracteres foi usada para criar o texto. Ele detecta UTF-8, UTF-16, ISO-8859, Windows-1252, Shift-JIS, GB2312, KOI8-R e muito mais, procurando marcas de ordem de bytes (BOM), validando sequências de bytes UTF-8 e analisando estatisticamente padrões de bytes altos. Isso é essencial para corrigir texto distorcido (mojibake) e interpretar corretamente arquivos legados.

A ferramenta detecta mais de 30 codificações: UTF-8, UTF-16BE/LE, UTF-32BE/LE, ASCII (7 bits), ISO-8859-1 a ISO-8859-15, Windows-1252, Windows-1251, Windows-1250, Shift-JIS, EUC-JP, ISO-2022-JP, GB2312, GBK, GB 18030, Big5, Big5-HKSCS, EUC-KR, KOI8-R, KOI8-U, MacRoman, IBM437, IBM850 e IBM866. Cada detecção mostra uma pontuação de confiança e o método de detecção usado.

Uma marca de ordem de bytes (BOM) é uma sequência de bytes especial no início de um arquivo de texto que declara sua codificação e ordem de bytes. Por exemplo, EF BB BF indica UTF-8, FE FF indica UTF-16BE e FF FE indica UTF-16LE. BOMs são a maneira mais confiável de identificar codificações. A ferramenta detecta 11 assinaturas BOM diferentes, incluindo UTF-7, SCSU, BOCU-1 e GB-18030.

A detecção baseada em BOM é 99% precisa, pois os BOMs são marcadores de codificação explícitos. A precisão da detecção estatística depende da quantidade de texto e da distinção da codificação. Para texto com muitos caracteres de bytes altos, a precisão é muito alta. Para textos curtos somente ASCII, múltiplas codificações podem parecer válidas - a ferramenta mostra todas as possibilidades classificadas por confiança.

Sim - mude para a guia "Carregar arquivo" para selecionar um arquivo do seu dispositivo. A ferramenta lê o arquivo como bytes brutos usando a API FileReader do navegador e realiza todas as análises localmente. Arquivos de até 1 MB são suportados. Nenhum dado é enviado para um servidor.

As estatísticas de bytes mostram: contagem e porcentagem de caracteres imprimíveis ASCII (bytes 0x20-0x7E), contagem de bytes nulos (0x00 - contagens altas sugerem UTF-16 ou dados binários), contagem alta de bytes (>0x7F - indica conteúdo não ASCII) e uma classificação de texto/binário. O histograma de bytes também codifica cada byte por cores como ASCII imprimível (verde), byte alto (azul) ou byte nulo (vermelho) para facilitar a análise visual.

A ferramenta executa validação UTF-8 completa em conformidade com RFC 3629, verificando bytes de início adequados (0xC2-0xF4), bytes de continuação corretos (0x80-0xBF), rejeição de sequências longas, metades substitutas e pontos de código acima de U+10FFFF. Se todo o fluxo de bytes passar em todas as verificações, o UTF-8 será relatado com uma pontuação de confiança alta.

ISO-8859-1 e Windows-1252 são idênticos para os bytes 0xA0-0xFF, mas diferem no intervalo 0x80-0x9F. Na ISO-8859-1, esses bytes são caracteres de controle. No Windows-1252, eles contêm caracteres imprimíveis, como aspas inteligentes, travessões, o sinal do Euro (€) e símbolos de marca registrada. A ferramenta detecta bytes específicos do Windows-1252 para distinguir as duas codificações.

Sim - 100% grátis, para sempre. Sem inscrição, sem conta, sem nível premium, sem limites de uso e sem anúncios. Detecte a codificação de quanto texto você precisar. Todo o processamento é feito localmente em seu navegador, sem uploads de servidor.