Перейти к содержимому
Aback Tools Logo

Экстрактор метаданных PDF

Загрузите любой PDF-файл, чтобы извлечь все встроенные метаданные. Средство извлечения метаданных PDF считывает как словарь информации о документе (название, автор, тема, ключевые слова, создатель, производитель, даты создания/изменения), так и метаданные XMP (элементы Dublin Core, свойства Adobe XMP, информацию о правах, идентификаторы документов, язык и пользовательские свойства) с помощью pdf-lib и pdfjs-dist. Поля организованы по исходным группам (информация о файле, информация о документе, метаданные XMP) и классифицированы по типу (идентификация, контент, даты, статистика, программное обеспечение). Благодаря фильтрации на основе вкладок, экспорту в виде текста, описаний для каждого поля и индикатора работоспособности — вся обработка выполняется локально в вашем браузере без загрузки. Бесплатно, регистрация не требуется.

PDF Metadata Extractor

Upload any PDF to extract all embedded metadata, including the Document Info Dictionary (title, author, subject, keywords, creator, producer, creation/ modification dates) and XMP metadata when available. The tool uses pdf-lib and pdfjs-dist to read metadata locally - all processing runs entirely in your browser with zero uploads. No signup required.

Drop a PDF here or click to browse

Upload any PDF to extract its metadata - no file upload, all processing is local

Понимание извлечения метаданных PDF

  • Что такое метаданные PDF? Метаданные PDF — это описательная информация, встроенная в файлы PDF, которая документирует свойства файла: кто его создал, когда он был создан, какое программное обеспечение использовалось, а также ключевые слова для категоризации. Эти метаданные хранятся в двух основных местах: словаре информации о документе (простая структура «ключ-значение», заданная стандартом PDF) и метаданные XMP (расширяемая платформа метаданных), стандарт на основе Adobe XML, который предоставляет более богатые и расширяемые метаданные, включая элементы Dublin Core, информацию о правах и настраиваемые свойства.
  • Как работает извлечение метаданных PDF Программа извлечения метаданных PDF использует две взаимодополняющие библиотеки PDF для максимального охвата. pdf-lib считывает словарь информации о документе напрямую, чтобы извлечь автора, название, тему, ключевые слова, создателя, производителя и даты создания/изменения. pdfjs-dist (библиотека рендеринга PDF-файлов Mozilla) затем извлекает метаданные XMP путем анализа встроенного потока метаданных XML, обеспечивая доступ к элементам Dublin Core (dc:title, dc:creator, dc:description), свойствам Adobe XMP (xmp:CreateDate, xmp:ModifyDate, xmp:CreatorTool) и информации об управлении правами (dc:rights). Результаты из обоих источников объединены и для ясности организованы по группам источников.
  • Информация о документе и метаданные XMP Словарь информации о документе — это более старая и простая система метаданных, определенная в спецификации PDF. Он поддерживает фиксированный набор полей: Название, Автор, Тема, Ключевые слова, Создатель, Производитель, CreationDate и ModDate. Метаданные XMP, представленные в PDF 1.4 (Adobe Acrobat 5.0), обеспечивают более полную и расширяемую структуру с использованием XML. XMP может включать метаданные Dublin Core (название, создатель, описание, тема, права, язык), свойства Adobe PDF (производитель, PDFVersion) и пользовательские пространства имен. Современные PDF-файлы часто содержат оба, тогда как более старые PDF-файлы могут содержать только словарь информации о документе.
  • На основе браузера и конфиденциальность Вся обработка PDF-файлов полностью выполняется в вашем браузере — ваши документы никогда не загружаются на какой-либо сервер. Инструмент использует pdf-lib для чтения словаря информации о документе и pdfjs-dist для извлечения метаданных XMP, оба выполняются локально через WebAssembly и JavaScript. Это делает его пригодным для анализа конфиденциальных PDF-файлов, юридических документов, контрактов и конфиденциальных деловых файлов без каких-либо проблем с конфиденциальностью. Никакой регистрации, никакого сбора данных и никакого отслеживания использования.

Часто задаваемые вопросы

PDF Metadata Extractor считывает скрытые метаданные, встроенные в PDF-файлы, и отображает их в читаемом формате. Сюда входит словарь информации о документе (название, автор, тема, ключевые слова, создатель, производитель, даты создания/изменения) и метаданные XMP (элементы Dublin Core, свойства Adobe XMP, информация о правах). Эти метаданные не видны при просмотре содержимого PDF-файла и могут раскрыть ценную информацию о происхождении и истории документа.

Словарь информации о документе — это простое хранилище метаданных «ключ-значение», определенное в спецификации PDF, поддерживающее фиксированный набор полей, таких как «Заголовок», «Автор», «Тема» и «Ключевые слова». XMP (Расширяемая платформа метаданных) — это стандарт на основе XML, который предоставляет более широкие и расширяемые метаданные, включая элементы Dublin Core, пользовательские свойства, управление правами и информацию о происхождении. Современные PDF-файлы часто содержат и то, и другое, причем XMP предоставляет более полные метаданные.

Из словаря информации о документе: название, автор, тема, ключевые слова, приложение-создатель, приложение-производитель, дата создания и дата изменения. Из метаданных XMP: название, автор, описание, тема, инструмент создания, даты создания/изменения/метаданных, идентификатор документа, язык, права/информация об авторских правах, исходный URL-адрес и любые пользовательские свойства пространства имен. Инструмент также извлекает основную информацию о файле: имя файла, размер файла, версию PDF, количество страниц и статус шифрования.

Инструмент пытается прочитать метаданные из зашифрованных PDF-файлов, используя опцию ignoreEncryption в pdf-lib, которая иногда может получить доступ к словарю информации о документе без пароля. Однако сильно зашифрованные PDF-файлы (AES-256) с ограниченным доступом к метаданным могут оказаться недоступными для чтения. Для извлечения метаданных XMP из зашифрованных PDF-файлов обычно требуется правильный пароль. Инструмент четко сообщит, зашифрован ли PDF-файл.

Нет. Вся обработка происходит исключительно в вашем браузере. PDF-файл считывается локально с помощью File API и обрабатывается в памяти с помощью pdf-lib и pdfjs-dist. Ваши документы никогда не покидают ваше устройство — ни загрузка, ни сбор данных, ни запросы стороннего сервера.

Поля метаданных могут отсутствовать, поскольку создатель PDF-файла не заполнил их, метаданные были удалены по соображениям конфиденциальности или PDF-файл был создан с помощью инструмента, который не заполняет определенные поля. Инструмент наглядно показывает, какие поля имеют значения, а какие пусты. Индикатор работоспособности (Полное/Частичное/Минимальное) обеспечивает быструю оценку того, сколько метаданных было найдено.

Инструмент поддерживает файлы PDF всех версий, от PDF 1.0 до последней версии PDF 2.0. Версия PDF определяется по заголовку файла. Метаданные XMP поддерживаются начиная с PDF 1.4. Более старые PDF-файлы могут содержать только метаданные Document Info Dictionary, которые полностью поддерживаются.

Да – 100% бесплатно, навсегда. Без регистрации, без учетной записи, без премиум-уровня, без ограничений на использование и без рекламы. Анализируйте столько PDF-файлов, сколько вам нужно. Вся обработка выполняется локально в вашем браузере без затрат на сервер.