Угадывание типа фрагмента файла
Загрузите любой фрагмент файла (часть файла без заголовка), и наш инструмент проанализирует шаблоны байтов — энтропию Шеннона, распределение частот байтов, процент печатаемого ASCII, плотность нулевых байтов и обнаружение внутренних маркеров — чтобы угадать тип файла. Соответствует более чем 20 профилям, включая изображения (JPEG, PNG, GIF, BMP, WebP), аудио (MP3, WAV), видео (MP4), документы (PDF, Office XML, HTML, текст), архивы (ZIP, GZIP), исполняемые файлы (ELF, PE), шрифты и текстовые форматы (JSON, CSV, Markdown). Вся обработка выполняется локально в вашем браузере — данные не загружаются, регистрация не требуется.
Upload any file fragment (a piece of a file without its header/magic bytes) and our tool will analyze the byte patterns - frequency distribution, entropy, byte statistics, and internal markers - to guess the file type. Uses statistical analysis across 20+ file type profiles including images, audio, video, documents, archives, executables, fonts, and text formats. All processing runs locally in your browser.
Drop a file fragment here or click to browse
Any file type, up to 50 MB - the tool ignores headers and analyzes byte patterns only
The File Fragment Type Guesser analyzes byte patterns without relying on file headers or magic bytes. It computes a comprehensive byte profileincluding Shannon entropy (randomness), byte frequency distribution, printable ASCII percentage, zero-byte density, high-bit percentage, and statistical measures (mean, median, standard deviation). These metrics are matched against 20+ pre-computed file type profiles covering images (JPEG, PNG, GIF, BMP, WebP), audio (MP3, WAV), video (MP4), documents (PDF, Office XML, HTML), archives (ZIP, GZIP), executables (ELF, PE), fonts (TrueType), and text formats (plain text, JSON, CSV, Markdown). The tool also scans for internal byte markers - characteristic byte sequences that appear within the data of specific file types (e.g., PNG IHDR/IDAT chunks, JPEG marker segments, PDF stream keywords). Each candidate type receives a confidence score from 0-100% based on how closely the fragment matches its expected profile. All processing runs locally in your browser - no data is ever uploaded.
Зачем использовать нашу программу угадывания типов фрагментов файлов?
- Независимый от заголовка анализ. В отличие от традиционных инструментов идентификации файлов, которые полагаются на магические байты (заголовки файлов), наш инструмент работает на чистом анализе шаблонов байтов. Это означает, что он может идентифицировать типы файлов, даже если заголовок отсутствует, поврежден или удален, что делает его бесценным для восстановления данных, вырезания файлов и судебно-медицинского анализа фрагментированных или поврежденных файлов.
- Более 20 профилей типов файлов: инструмент сравнивает характеристики фрагментов с более чем 20 заранее рассчитанными профилями, охватывающими изображение (JPEG, PNG, GIF, BMP, WebP), аудио (MP3, WAV), видео (MP4), документ (PDF, Office XML, HTML/XML, обычный текст, JSON, CSV, Markdown), архив (ZIP, GZIP, поток Deflate), исполняемый файл (ELF, PE), шрифт (TrueType/OpenType) и Зашифрованные данные. Каждый профиль определяет ожидаемые диапазоны энтропии, печатного ASCII, плотности нулевых байтов и других показателей.
- Обнаружение внутренних маркеров. Помимо статистического анализа, инструмент сканирует фрагмент на наличие внутренних байтовых маркеров — характерных последовательностей байтов, которые появляются в файлах определенных типов независимо от их положения. Например, файлы PNG содержат маркеры блоков IHDR и IDAT, файлы JPEG содержат сегменты маркеров (FF DB, FF C0, FF DA), файлы PDF содержат ключевые слова потока/конечного потока, а файлы ZIP содержат подписи локальных заголовков файлов.
- Комплексный байтовый профиль: каждый анализ создает подробный байтовый профиль, включая энтропию Шеннона (биты на байт), средние/медианные/режимные значения байтов, стандартное отклонение, уникальное количество байтов, процент печатаемого ASCII, процент нулевых байтов, процент высоких битов (0x80+), процент пробелов и обнаружение нулевых запусков. Вместе эти метрики образуют уникальный «отпечаток пальца», который отличает сжатые данные от текста, зашифрованные данные от изображений и многое другое.
Распространенные случаи использования функции угадывания типов фрагментов файлов
- Цифровая криминалистика и реагирование на инциденты: следователи-криминалисты могут анализировать фрагменты файлов, восстановленные из образов дисков, нераспределенного пространства или дампов памяти. Если заголовки файлов отсутствуют из-за удаления или повреждения раздела, угадыватель типа фрагмента предоставляет важную информацию об исходном типе файла. Это помогает расставить приоритеты в усилиях по восстановлению и понять, какой тип данных хранился в регионе, даже без полной файловой структуры.
- Восстановление данных и вырезание файлов: специалисты по восстановлению данных могут использовать этот инструмент для определения типа неизвестных фрагментов, восстановленных с поврежденного носителя. Понимая вероятный тип файла, инструменты восстановления могут быть направлены на использование соответствующих стратегий вырезания. Профиль байта также помогает отличать фактические данные файла от заполнения или пустого пространства.
- Анализ вредоносного ПО и обратное проектирование. Аналитики вредоносного ПО часто сталкиваются с закодированными, упакованными или фрагментированными двоичными файлами. Средство определения типа фрагмента может помочь определить, содержит ли подозрительная область данных исполняемый код, сжатые полезные данные, зашифрованные данные конфигурации или встроенные ресурсы. Эта классификация помогает аналитику определить, какие инструменты и методы следует применять для дальнейшего анализа.
- Анализ файловой системы и хранилища. Инженеры по системам хранения данных могут анализировать блоки из поврежденных файловых систем, в которых структура каталогов утеряна. Сканируя необработанные блоки, инструмент определяет, какие типы файлов хранились в разных регионах. Это полезно для анализа файловой системы, понимания закономерностей использования диска и восстановления данных с отформатированных или перераспределенных дисков.
- Анализ встроенного ПО и встроенных систем. При анализе дампов встроенного ПО, образов ПЗУ или встроенной системной памяти средство определения типа фрагмента может идентифицировать области кода, таблицы данных, блоки конфигурации, сжатые разделы встроенного ПО и образы файловой системы. Это помогает реверс-инженерам наметить структуру неизвестных образов прошивки без документации.
- Образование и исследования в области кибербезопасности. Студенты и исследователи в области цифровой криминалистики и обратного проектирования могут использовать этот инструмент, чтобы понять, как различные типы файлов выглядят на уровне байтов. Статистический профиль дает полезную информацию о том, почему сжатые файлы имеют высокую энтропию, почему текстовые файлы имеют низкую энтропию и как алгоритмы классификации типов файлов работают на практике.
Что такое угадывание типа фрагмента файла?
Угадывание типа фрагмента файла — это процесс определения вероятного формата файла фрагмента данных путем анализа его характеристик на уровне байтов без использования заголовков файлов (магических байтов) или расширений файлов. Каждый тип файла имеет отличительные статистические свойства: изображения, такие как JPEG и PNG, имеют энтропию от средней до высокой с определенными шаблонами байтов, текстовые файлы имеют низкую энтропию с высоким процентом печатаемого ASCII, сжатые архивы имеют энтропию, близкую к максимальной, с равномерным распределением байтов, а зашифрованные данные статистически неотличимы от случайных. Вычисляя профиль байтов (энтропия, распределение частот байтов, процент печатаемого ASCII, плотность нулевых байтов, статистические показатели) и сравнивая его с предварительно вычисленными профилями известных типов файлов, инструмент создает ранжированный список возможных совпадений с оценками достоверности. Этот метод также известен как статистическая идентификация типов файлов или классификация типов файлов по содержимому.
Как типы файлов различаются на уровне байтов
- Текстовые файлы (TXT, HTML, JSON, CSV, Markdown): характеризуются низкой энтропией (3,5–6 бит/байт), очень высоким печатным ASCII (70–100%), почти нулевыми нулевыми байтами и высоким содержанием пробелов (10–40%). Значения байтов группируются вокруг общих значений ASCII (буквы, цифры, знаки препинания). Средние значения обычно находятся в диапазоне 50–100, а количество уникальных байтов обычно ниже 100 из 256 возможных значений.
- Файлы изображений (JPEG, PNG, GIF, BMP, WebP): от средней до высокой энтропии (5–8 бит/байт) в зависимости от сжатия. Пиксельные данные содержат широкий диапазон байтовых значений, в результате чего получается более 200 уникальных байтов. Процент нулевых байтов значительно варьируется (5-45%). Файлы BMP, как правило, содержат больше нулей из-за заполнения, тогда как файлы JPEG имеют особую структуру маркеров (байты FF, за которыми следуют коды маркеров).
- Сжатые и зашифрованные данные: максимальная энтропия (7,5–8 бит/байт), практически нулевой печатный ASCII (0–5%), равномерное распределение байтов с более чем 250 уникальными значениями и очень малое количество пробелов. Зашифрованные данные обладают дополнительным свойством почти одинаковой частоты байтов (каждое значение байта появляется примерно n/256 раз), в то время как потоки zlib/deflate могут иметь небольшие смещения. Их труднее всего отличить друг от друга без криптографического анализа.
- Форматы архивов (ZIP, GZIP). ZIP-файлы имеют четкую структуру со встроенными локальными заголовками файлов (PK\x03\x04) по всему архиву, перемежающимися сжатыми данными. Это создает характерный шаблон заголовков с низкой энтропией, смешанных со сжатыми данными с высокой энтропией. Файлы GZIP имеют более простую структуру с заголовком, сжатыми данными и трейлером.
- Исполняемые файлы (ELF, PE). Двоичные исполняемые файлы имеют умеренную энтропию (5–7,5 бит/байт) и структурированные разделы. Сегменты кода содержат машинные инструкции с характерными частотами байтов, а сегменты данных содержат встроенные строки, таблицы импорта и данные ресурсов. Заполнение нулевыми байтами обычно используется для выравнивания.
Как работает наша система угадывания типов фрагментов
- Вычисление профиля байта: инструмент считывает каждый байт загруженного фрагмента и строит полную таблицу частот (количество значений каждого байта 0–255). Из этой таблицы он вычисляет: энтропию Шеннона (мера случайности/сжимаемости), средние/медианные значения/режимные значения байтов, стандартное отклонение (насколько распределены значения байтов), количество уникальных байтов, процент печатаемых байтов ASCII (0x20-0x7E), процент нулевых байтов (0x00), процент байтов с верхними битами (0x80-0xFF), процент пробелов (пробел, табуляция, CR, LF, FF) и обнаружение нулевой серии (серии из 4+ нулей).
- Сканирование внутренних маркеров: инструмент сканирует фрагмент на наличие известных последовательностей байтов, которые характерны для определенных типов файлов, но не обязательно в начале файла. Например, он ищет идентификаторы фрагментов PNG (IHDR, IDAT, IEND), сегменты маркеров JPEG (SOI, APP0, DQT, SOF0, DHT, SOS), структурные ключевые слова PDF (stream, endstream, obj), заголовки локальных файлов ZIP (PK\x03\x04) и многое другое. Обнаружение внутренних маркеров значительно повышает оценку достоверности для соответствующего типа файла.
- Сопоставление профилей и оценка: каждый из более чем 20 профилей типов файлов определяет ожидаемые диапазоны энтропии, печатного ASCII, нулевых байтов, старших битов, пробелов и медианного значения. Инструмент вычисляет, насколько точно метрики фрагмента соответствуют каждому профилю, используя взвешенную систему оценок (25 баллов за энтропию, 20 за печатный ASCII, 15 за нулевые байты, по 10 за старшие биты, пробелы и медиану, плюс до 20 бонусных баллов за внутренние маркеры и 5 баллов за шаблоны нулевых запусков). Результаты сортируются по баллам, в результате чего формируется ранжированный список предположений о типах файлов с процентами достоверности.
Ограничения и конфиденциальность
Не заменяет обнаружение магических байтов: средство определения типа фрагмента предназначено для сценариев, в которых заголовки отсутствуют или недоступны. Когда заголовки файлов не повреждены, обнаружение магических байтов (например, наш детектор магических байтов файлов) происходит гораздо точнее. Достоверность варьируется: очень маленькие фрагменты (<100 байт) предоставляют ограниченные статистические данные и дают менее достоверные предположения. Фрагменты размером 1 КБ и более дают надежные результаты. Похожие профили. Некоторые типы файлов имеют очень похожие байтовые профили (например, сжатые потоки и зашифрованные данные или разные форматы изображений). Ограничение размера файла: поддерживаются фрагменты размером до 50 МБ. 100% конфиденциальность: вся обработка осуществляется исключительно в вашем браузере. Файлы никогда не покидают ваше устройство — ни загрузки, ни регистрации, ни сбора данных, ни отслеживания использования.
Часто задаваемые вопросы
Инструмент использует статистический анализ данных на уровне байтов для выявления характерных закономерностей, связанных с различными типами файлов. Он вычисляет профиль байтов, включая энтропию Шеннона, распределение частот байтов, процент печатаемого ASCII, плотность нулевых байтов и статистические показатели. Эти показатели сравниваются с более чем 20 заранее рассчитанными профилями известных типов файлов. Каждый тип файла имеет уникальный отпечаток — например, текстовые файлы имеют низкую энтропию и высокий ASCII, сжатые файлы имеют высокую энтропию и равномерное распределение, а файлы JPEG имеют среднюю и высокую энтропию с определенными байтами маркера.
Точность зависит от размера фрагмента и типа файла. Для фрагментов размером более 1 КБ с отличительными профилями байтов (обычный текст, HTML, ZIP, JPEG) точность обычно составляет 80–95%. Для файлов со схожими профилями (разные форматы изображений, сжатые и зашифрованные данные) точность составляет 40–70%. Фрагменты размером менее 100 байт предоставляют ограниченные статистические данные и могут давать ненадежные результаты. Инструмент всегда отображает оценки достоверности, чтобы вы могли оценить надежность каждого предположения.
Энтропия Шеннона, измеряемая в битах на байт (0–8), количественно определяет случайность данных. Текстовые файлы обычно имеют энтропию 3,5–5,5 бит/байт. Энтропия сжатых или зашифрованных данных составляет 7,5–8 бит/байт. Файлы изображений и аудио находятся между ними (5–8 бит/байт). Энтропия — один из самых мощных дискриминаторов для классификации типов файлов, поскольку разные типы файлов обрабатывают данные по-разному.
Инструмент включает профили для потоков JPEG, PNG, GIF, BMP, WebP, MP3, WAV, MP4, PDF, Office Open XML (DOCX/XLSX/PPTX), HTML/XML, ZIP, GZIP, Deflate, исполняемых файлов ELF, исполняемых файлов PE (EXE/DLL), шрифтов TrueType/OpenType, обычного текста, JSON, CSV/TSV, Markdown и зашифрованных данных. Он также сканирует внутренние байтовые маркеры (идентификаторы фрагментов PNG, маркеры JPEG, ключевые слова PDF и т. д.) для дополнительной уверенности.
Некоторые типы файлов имеют очень похожие профили байтов, и их труднее различить. Например, разные форматы изображений выглядят одинаково на уровне байтов. JPEG и MP3 содержат высокоэнтропийные сжатые данные с вкраплениями маркеров. И зашифрованные, и сжатые данные имеют энтропию, близкую к максимальной. В этих случаях инструмент полагается на обнаружение внутренних маркеров — нахождение определенных последовательностей байтов внутри фрагмента — чтобы различать похожие типы.
Для достижения наилучших результатов фрагменты должны иметь размер не менее 1 КБ (1024 байта). При таком размере статистические показатели стабилизируются и становятся надежными дискриминаторами. Фрагменты размером 100–1024 байта все еще могут давать полезные подсказки, но с меньшей достоверностью. Фрагменты размером менее 100 байт могут не содержать достаточно данных для значимого статистического анализа.
Абсолютно. Весь анализ происходит полностью в вашем браузере с использованием типизированных массивов. Ваши файлы никогда не загружаются ни на какой сервер и никогда не покидают ваше устройство. Никакой регистрации, никакой учетной записи, никакого сбора данных, никакого отслеживания использования. Инструмент работает в автономном режиме после начальной загрузки страницы.
Обнаружение магических байтов считывает первые несколько байтов файла для определения его формата (например, JPEG начинается с FF D8 FF). Это быстро и чрезвычайно точно при наличии заголовков. Угадывание типа фрагмента статистически анализирует все содержимое данных, чтобы определить тип файла, не полагаясь на заголовки. Он предназначен для сценариев, в которых отсутствуют заголовки — восстановление данных, вырезание файлов, фрагментированные файлы или поврежденные заголовки.
Да – 100% бесплатно, навсегда. Без регистрации, без учетной записи, без премиум-уровня, без ограничений на использование и без рекламы. Анализируйте столько фрагментов, сколько вам нужно. Вся обработка выполняется локально в вашем браузере без загрузки на сервер.