Adivinhador de tipo de fragmento de arquivo
Carregue qualquer fragmento de arquivo (um pedaço de arquivo sem cabeçalho) e nossa ferramenta analisará padrões de bytes - entropia de Shannon, distribuição de frequência de bytes, porcentagem ASCII imprimível, densidade de zero bytes e detecção de marcador interno - para adivinhar o tipo de arquivo. Corresponde a mais de 20 perfis, incluindo imagens (JPEG, PNG, GIF, BMP, WebP), áudio (MP3, WAV), vídeo (MP4), documentos (PDF, Office XML, HTML, texto), arquivos (ZIP, GZIP), executáveis (ELF, PE), fontes e formatos de texto (JSON, CSV, Markdown). Todo o processamento é executado localmente no seu navegador - sem upload de dados, sem necessidade de inscrição.
Upload any file fragment (a piece of a file without its header/magic bytes) and our tool will analyze the byte patterns - frequency distribution, entropy, byte statistics, and internal markers - to guess the file type. Uses statistical analysis across 20+ file type profiles including images, audio, video, documents, archives, executables, fonts, and text formats. All processing runs locally in your browser.
Drop a file fragment here or click to browse
Any file type, up to 50 MB - the tool ignores headers and analyzes byte patterns only
The File Fragment Type Guesser analyzes byte patterns without relying on file headers or magic bytes. It computes a comprehensive byte profileincluding Shannon entropy (randomness), byte frequency distribution, printable ASCII percentage, zero-byte density, high-bit percentage, and statistical measures (mean, median, standard deviation). These metrics are matched against 20+ pre-computed file type profiles covering images (JPEG, PNG, GIF, BMP, WebP), audio (MP3, WAV), video (MP4), documents (PDF, Office XML, HTML), archives (ZIP, GZIP), executables (ELF, PE), fonts (TrueType), and text formats (plain text, JSON, CSV, Markdown). The tool also scans for internal byte markers - characteristic byte sequences that appear within the data of specific file types (e.g., PNG IHDR/IDAT chunks, JPEG marker segments, PDF stream keywords). Each candidate type receives a confidence score from 0-100% based on how closely the fragment matches its expected profile. All processing runs locally in your browser - no data is ever uploaded.
Por que usar nosso adivinhador de tipo de fragmento de arquivo?
- Análise independente de cabeçalho: Ao contrário das ferramentas tradicionais de identificação de arquivos que dependem de bytes mágicos (cabeçalhos de arquivos), nossa ferramenta funciona com análise de padrão de bytes puro. Isso significa que ele pode identificar tipos de arquivos mesmo quando o cabeçalho está ausente, corrompido ou removido – tornando-o inestimável para recuperação de dados, gravação de arquivos e análise forense de arquivos fragmentados ou danificados.
- Mais de 20 perfis de tipo de arquivo: a ferramenta compara características de fragmentos com mais de 20 perfis pré-computados, abrangendo imagem (JPEG, PNG, GIF, BMP, WebP), áudio (MP3, WAV), vídeo (MP4), documento (PDF, Office XML, HTML/XML, texto simples, JSON, CSV, Markdown), arquivo (ZIP, GZIP, Deflate stream), executável (ELF, PE), fonte (TrueType/OpenType) e criptografado dados. Cada perfil define intervalos esperados para entropia, ASCII imprimível, densidade de zero bytes e outras métricas.
- Detecção de marcador interno: além da análise estatística, a ferramenta verifica o fragmento em busca de marcadores de bytes internos - sequências de bytes características que aparecem em tipos de arquivo específicos, independentemente da posição. Por exemplo, os arquivos PNG contêm marcadores de pedaços IHDR e IDAT, os arquivos JPEG contêm segmentos de marcadores (FF DB, FF C0, FF DA), os PDFs contêm palavras-chave stream/endstream e os arquivos ZIP contêm assinaturas de cabeçalho de arquivo local.
- Perfil abrangente de bytes: cada análise produz um perfil de bytes detalhado, incluindo entropia de Shannon (bits por byte), valores médios/medianos/de bytes de modo, desvio padrão, contagem única de bytes, porcentagem ASCII imprimível, porcentagem de zero bytes, porcentagem de bits altos (0x80+), porcentagem de espaços em branco e detecção de execução nula. Juntas, essas métricas fornecem uma impressão digital exclusiva que distingue dados compactados de texto, dados criptografados de imagens e muito mais.
Casos de uso comuns para adivinhador de tipo de fragmento de arquivo
- Análise forense digital e resposta a incidentes: Os investigadores forenses podem analisar fragmentos de arquivos recuperados de imagens de disco, espaço não alocado ou despejos de memória. Quando os cabeçalhos dos arquivos estão faltando devido a exclusão ou danos à partição, o adivinhador do tipo de fragmento fornece pistas críticas sobre o tipo de arquivo original. Isso ajuda a priorizar os esforços de recuperação e a entender que tipo de dados foram armazenados em uma região, mesmo sem uma estrutura de arquivos completa.
- Recuperação de dados e gravação de arquivos: Os especialistas em recuperação de dados podem usar a ferramenta para identificar o tipo de fragmentos desconhecidos recuperados de mídias de armazenamento danificadas. Ao compreender o provável tipo de arquivo, as ferramentas de recuperação podem ser direcionadas para usar estratégias de escultura apropriadas. O perfil de bytes também ajuda a distinguir entre dados reais do arquivo e preenchimento ou espaço vazio.
- Análise de malware e engenharia reversa: Os analistas de malware geralmente encontram binários codificados, compactados ou fragmentados. O adivinhador de tipo de fragmento pode ajudar a identificar se uma região de dados suspeita contém código executável, cargas compactadas, dados de configuração criptografados ou recursos incorporados. Esta classificação orienta o analista sobre quais ferramentas e técnicas aplicar para análises posteriores.
- Análise de sistema de arquivos e armazenamento: Os engenheiros de armazenamento podem analisar blocos de sistemas de arquivos danificados onde as estruturas de diretório são perdidas. Ao digitalizar blocos brutos, a ferramenta identifica quais tipos de arquivos foram armazenados em diferentes regiões. Isso é útil para análise forense do sistema de arquivos, compreensão dos padrões de uso do disco e recuperação de dados de unidades formatadas ou reparticionadas.
- Análise de firmware e sistemas embarcados: Ao analisar dumps de firmware, imagens ROM ou memória de sistema embarcada, o adivinhador de tipo de fragmento pode identificar regiões de código, tabelas de dados, blocos de configuração, seções de firmware compactadas e imagens de sistema de arquivos. Isso ajuda os engenheiros reversos a mapear a estrutura de imagens de firmware desconhecidas sem documentação.
- Educação e pesquisa em segurança cibernética: Estudantes e pesquisadores em análise forense digital e engenharia reversa podem usar a ferramenta para entender a aparência dos diferentes tipos de arquivo no nível de byte. O perfil estatístico fornece insights educacionais sobre por que os arquivos compactados têm alta entropia, por que os arquivos de texto têm baixa entropia e como os algoritmos de classificação de tipo de arquivo funcionam na prática.
O que o tipo de fragmento de arquivo está adivinhando?
A adivinhação do tipo de fragmento de arquivo é o processo de identificação do provável formato de arquivo de um fragmento de dados, analisando suas características em nível de byte, sem depender de cabeçalhos de arquivo (bytes mágicos) ou extensões de arquivo. Cada tipo de arquivo tem propriedades estatísticas distintas - imagens como JPEG e PNG têm entropia média a alta com padrões de bytes específicos, arquivos de texto têm baixa entropia com altas porcentagens ASCII imprimíveis, arquivos compactados têm entropia quase máxima com distribuições uniformes de bytes e os dados criptografados são estatisticamente indistinguíveis dos aleatórios. Ao calcular um perfil de bytes (entropia, distribuição de frequência de bytes, porcentagem ASCII imprimível, densidade de zero bytes, medidas estatísticas) e compará-lo com perfis pré-computados de tipos de arquivos conhecidos, a ferramenta produz uma lista classificada de possíveis correspondências com pontuações de confiança. Essa técnica também é conhecida como identificação estatística do tipo de arquivo ou classificação do tipo de arquivo por conteúdo.
Como os tipos de arquivo diferem no nível de byte
- Arquivos de texto (TXT, HTML, JSON, CSV, Markdown): caracterizados por baixa entropia (3,5-6 bits/byte), ASCII imprimível muito alto (70-100%), quase zero bytes nulos e alto conteúdo de espaços em branco (10-40%). Os valores de bytes agrupam-se em torno de valores ASCII comuns (letras, dígitos, pontuação). Os valores médios normalmente ficam entre 50 e 100, e as contagens de bytes exclusivos geralmente ficam abaixo de 100 entre 256 valores possíveis.
- Arquivos de imagem (JPEG, PNG, GIF, BMP, WebP): Entropia média a alta (5-8 bits/byte) dependendo da compactação. Os dados de pixel contêm uma ampla variedade de valores de bytes, resultando em mais de 200 bytes exclusivos. A porcentagem de zero bytes varia significativamente (5-45%). Os arquivos BMP tendem a ter mais zeros devido ao preenchimento, enquanto os arquivos JPEG têm uma estrutura de marcador distinta (bytes FF seguidos de códigos de marcador).
- Dados compactados e criptografados: entropia máxima (7,5-8 bits/byte), ASCII imprimível próximo de zero (0-5%), distribuição uniforme de bytes com mais de 250 valores exclusivos e espaços em branco muito baixos. Os dados criptografados têm a propriedade adicional de frequências de bytes quase iguais (cada valor de byte aparece aproximadamente n/256 vezes), enquanto os fluxos zlib/deflate podem ter leves distorções. Estes são os mais difíceis de distinguir uns dos outros sem análise criptográfica.
- Formatos de arquivo (ZIP, GZIP): Os arquivos ZIP têm uma estrutura distinta com cabeçalhos de arquivo locais incorporados (PK\x03\x04) em todo o arquivo, intercalados com dados compactados. Isso cria um padrão característico de cabeçalhos de baixa entropia misturados com dados compactados de alta entropia. Os arquivos GZIP têm uma estrutura mais simples com cabeçalho, dados compactados e trailer.
- Executáveis (ELF, PE): Executáveis binários têm entropia moderada (5-7,5 bits/byte) com seções estruturadas. Os segmentos de código contêm instruções de máquina com frequências de bytes características, enquanto os segmentos de dados contêm strings incorporadas, tabelas de importação e dados de recursos. O preenchimento de zero byte é comum para alinhamento.
Como funciona nosso adivinhador de tipo de fragmento
- Computação de perfil de bytes: A ferramenta lê cada byte do fragmento carregado e constrói uma tabela de frequência completa (contagem de cada valor de byte de 0 a 255). A partir desta tabela, ele calcula: entropia de Shannon (medida de aleatoriedade/compressibilidade), valores médios/medianos/de bytes de modo, desvio padrão (quão dispersos são os valores de bytes), contagem de bytes exclusivos, porcentagem de bytes ASCII imprimíveis (0x20-0x7E), porcentagem de zero bytes (0x00), porcentagem de bytes com conjunto de bits altos (0x80-0xFF), porcentagem de espaço em branco (espaço, tabulação, CR, LF, FF) e detecção de execução nula (execuções de 4+ zeros).
- Verificação de marcador interno: a ferramenta verifica o fragmento em busca de sequências de bytes conhecidas que são características de tipos de arquivo específicos, mas não necessariamente no início do arquivo. Por exemplo, ele procura identificadores de pedaços PNG (IHDR, IDAT, IEND), segmentos de marcadores JPEG (SOI, APP0, DQT, SOF0, DHT, SOS), palavras-chave estruturais de PDF (stream, endstream, obj), cabeçalhos de arquivos locais ZIP (PK\x03\x04) e muito mais. Encontrar marcadores internos aumenta significativamente a pontuação de confiança para o tipo de arquivo correspondente.
- Correspondência e pontuação de perfis: cada um dos mais de 20 perfis de tipo de arquivo define intervalos esperados para entropia, ASCII imprimível, zero bytes, bits altos, espaço em branco e valor mediano. A ferramenta calcula o quão próximas as métricas do fragmento correspondem a cada perfil usando um sistema de pontuação ponderada (25 pontos para entropia, 20 para ASCII imprimível, 15 para zero bytes, 10 para bits altos, espaço em branco e mediana, além de até 20 pontos de bônus para marcadores internos e 5 pontos para padrões de execução nulos). Os resultados são classificados por pontuação, produzindo uma lista classificada de suposições de tipo de arquivo com porcentagens de confiança.
Limitações e privacidade
Não substitui a detecção de bytes mágicos: o adivinhador de tipo de fragmento foi projetado para cenários onde os cabeçalhos estão ausentes ou inacessíveis. Quando os cabeçalhos dos arquivos estão intactos, a detecção de bytes mágicos (como nosso File Magic Byte Detector) é muito mais precisa. A confiança varia: fragmentos muito pequenos (<100 bytes) fornecem dados estatísticos limitados e produzem estimativas de confiança mais baixas. Fragmentos de 1 KB ou mais produzem resultados confiáveis. Perfis semelhantes: alguns tipos de arquivo têm perfis de bytes muito semelhantes (por exemplo, fluxos compactados versus dados criptografados ou formatos de imagem diferentes). Limite de tamanho de arquivo: São suportados fragmentos de até 50 MB. 100% privado: todo o processamento é feito inteiramente no seu navegador. Os arquivos nunca saem do seu dispositivo - sem uploads, sem inscrição, sem coleta de dados, sem rastreamento de uso.
Perguntas frequentes
A ferramenta usa análise estatística dos dados em nível de byte para identificar padrões característicos associados a diferentes tipos de arquivo. Ele calcula um perfil de bytes incluindo entropia de Shannon, distribuição de frequência de bytes, porcentagem ASCII imprimível, densidade de zero bytes e medidas estatísticas. Essas métricas são comparadas com mais de 20 perfis pré-computados de tipos de arquivos conhecidos. Cada tipo de arquivo possui uma impressão digital exclusiva - por exemplo, arquivos de texto têm baixa entropia e alto ASCII, arquivos compactados têm alta entropia e distribuição uniforme e arquivos JPEG têm entropia média a alta com bytes de marcadores específicos.
A precisão depende do tamanho do fragmento e do tipo de arquivo. Para fragmentos maiores que 1 KB com perfis de bytes distintos (texto simples, HTML, ZIP, JPEG), a precisão é normalmente de 80 a 95%. Para arquivos com perfis semelhantes (diferentes formatos de imagem, dados compactados versus dados criptografados), a precisão é de 40-70%. Fragmentos com menos de 100 bytes fornecem dados estatísticos limitados e podem produzir resultados não confiáveis. A ferramenta sempre exibe pontuações de confiança para que você possa avaliar a confiabilidade de cada suposição.
A entropia de Shannon, medida em bits por byte (0-8), quantifica a aleatoriedade dos dados. Arquivos de texto normalmente têm entropia de 3,5-5,5 bits/byte. Dados compactados ou criptografados têm entropia de 7,5 a 8 bits/byte. Os arquivos de imagem e áudio ficam no meio (5-8 bits/byte). A entropia é um dos discriminadores mais poderosos para classificação de tipos de arquivos porque diferentes tipos de arquivos processam dados de maneira muito diferente.
A ferramenta inclui perfis para JPEG, PNG, GIF, BMP, WebP, MP3, WAV, MP4, PDF, Office Open XML (DOCX/XLSX/PPTX), HTML/XML, ZIP, GZIP, fluxos Deflate, executáveis ELF, executáveis PE (EXE/DLL), fontes TrueType/OpenType, texto simples, JSON, CSV/TSV, Markdown e dados criptografados. Ele também verifica marcadores de bytes internos (IDs de blocos PNG, marcadores JPEG, palavras-chave PDF, etc.) para obter confiança adicional.
Alguns tipos de arquivos têm perfis de bytes muito semelhantes e são mais difíceis de distinguir. Por exemplo, diferentes formatos de imagem parecem semelhantes no nível de byte. JPEG e MP3 contêm dados compactados de alta entropia com marcadores intercalados. Dados criptografados e dados compactados têm entropia quase máxima. Nestes casos, a ferramenta depende da detecção de marcadores internos – encontrando sequências de bytes específicas dentro do fragmento – para diferenciar tipos semelhantes.
Para melhores resultados, os fragmentos devem ter pelo menos 1 KB (1024 bytes). Nesta dimensão, as medidas estatísticas estabilizam-se e tornam-se discriminadores fiáveis. Fragmentos de 100 a 1024 bytes ainda podem fornecer dicas úteis, mas com menor confiança. Fragmentos com menos de 100 bytes podem não conter dados suficientes para uma análise estatística significativa.
Absolutamente. Todas as análises acontecem inteiramente no seu navegador usando arrays digitados. Seus arquivos nunca são enviados para nenhum servidor - eles nunca saem do seu dispositivo. Sem inscrição, sem conta, sem coleta de dados, sem rastreamento de uso. A ferramenta funciona offline após o carregamento inicial da página.
A detecção mágica de bytes lê os primeiros bytes de um arquivo para identificar seu formato (por exemplo, JPEG começa com FF D8 FF). Isso é rápido e extremamente preciso quando há cabeçalhos presentes. A adivinhação do tipo de fragmento analisa estatisticamente todo o conteúdo dos dados para inferir o tipo de arquivo sem depender de cabeçalhos. Ele foi projetado para cenários em que faltam cabeçalhos - recuperação de dados, gravação de arquivos, arquivos fragmentados ou cabeçalhos corrompidos.
Sim - 100% grátis, para sempre. Sem inscrição, sem conta, sem nível premium, sem limites de uso e sem anúncios. Analise quantos fragmentos você precisar. Todo o processamento é feito localmente em seu navegador, sem uploads de servidor.