Pular para o conteúdo
Aback Tools Logo

Extrator de metadados PDF

Carregue qualquer PDF para extrair todos os metadados incorporados. O PDF Metadata Extractor lê o Dicionário de informações do documento (título, autor, assunto, palavras-chave, criador, produtor, datas de criação/modificação) e metadados XMP (elementos Dublin Core, propriedades Adobe XMP, informações de direitos, identificadores de documentos, idioma e propriedades personalizadas) usando pdf-lib e pdfjs-dist. Os campos são organizados por grupo de origem (Informações do arquivo, Informações do documento, Metadados XMP) e categorizados por tipo (Identidade, Conteúdo, Datas, Estatísticas, Software). Com filtragem baseada em guias, exportação como texto, descrições por campo e um indicador de integridade – todo o processamento é executado localmente em seu navegador, sem uploads. Gratuito, sem necessidade de inscrição.

PDF Metadata Extractor

Upload any PDF to extract all embedded metadata, including the Document Info Dictionary (title, author, subject, keywords, creator, producer, creation/ modification dates) and XMP metadata when available. The tool uses pdf-lib and pdfjs-dist to read metadata locally - all processing runs entirely in your browser with zero uploads. No signup required.

Drop a PDF here or click to browse

Upload any PDF to extract its metadata - no file upload, all processing is local

Compreendendo a extração de metadados de PDF

  • O que são metadados PDF? Metadados PDF são informações descritivas incorporadas em arquivos PDF que documentam as propriedades do arquivo – quem o criou, quando foi criado, qual software foi usado e palavras-chave para categorização. Esses metadados são armazenados em dois locais principais: o Dicionário de informações do documento (uma estrutura simples de valores-chave especificada pelo padrão PDF) e os metadados XMP (Extensible Metadata Platform), um padrão baseado em Adobe XML que fornece metadados mais ricos e extensíveis, incluindo elementos Dublin Core, informações de direitos e propriedades personalizadas.
  • Como funciona a extração de metadados de PDF O PDF Metadata Extractor usa duas bibliotecas PDF complementares para cobertura máxima. pdf-lib lê o Dicionário de Informações do Documento diretamente para extrair autor, título, assunto, palavras-chave, criador, produtor e datas de criação/modificação. pdfjs-dist (biblioteca de renderização de PDF da Mozilla) extrai metadados XMP analisando o fluxo de metadados XML incorporado, fornecendo acesso aos elementos Dublin Core (dc:title, dc:creator, dc:description), propriedades Adobe XMP (xmp:CreateDate, xmp:ModifyDate, xmp:CreatorTool) e informações de gerenciamento de direitos (dc:rights). Os resultados de ambas as fontes são mesclados e organizados por grupo de fontes para maior clareza.
  • Informações do documento versus metadados XMP O Dicionário de informações do documento é o sistema de metadados mais antigo e mais simples definido na especificação PDF. Ele suporta um conjunto fixo de campos: Título, Autor, Assunto, Palavras-chave, Criador, Produtor, CreationDate e ModDate. Os metadados XMP, introduzidos no PDF 1.4 (Adobe Acrobat 5.0), fornecem uma estrutura mais abrangente e extensível usando XML. O XMP pode incluir metadados Dublin Core (título, criador, descrição, assunto, direitos, idioma), propriedades Adobe PDF (produtor, PDFVersion) e namespaces personalizados. Os PDFs modernos geralmente contêm ambos, enquanto os PDFs mais antigos podem ter apenas o Dicionário de informações do documento.
  • Baseado em navegador e privado Todo o processamento de PDF é executado inteiramente em seu navegador - seus documentos nunca são carregados em nenhum servidor. A ferramenta usa pdf-lib para ler o Document Info Dictionary e pdfjs-dist para extrair metadados XMP, ambos executados localmente por meio de WebAssembly e JavaScript. Isso o torna adequado para analisar PDFs confidenciais, documentos jurídicos, contratos e arquivos comerciais confidenciais sem qualquer preocupação com privacidade. Sem inscrição, sem coleta de dados, sem rastreamento de uso.

Perguntas frequentes

Um PDF Metadata Extractor lê os metadados ocultos incorporados em arquivos PDF e os exibe em um formato legível. Isso inclui o Dicionário de informações do documento (título, autor, assunto, palavras-chave, criador, produtor, datas de criação/modificação) e metadados XMP (elementos Dublin Core, propriedades Adobe XMP, informações de direitos). Esses metadados não são visíveis durante a visualização do conteúdo do PDF e podem revelar informações valiosas sobre a origem e o histórico do documento.

O Document Info Dictionary é um armazenamento simples de metadados de valores-chave definidos na especificação PDF, suportando um conjunto fixo de campos como Título, Autor, Assunto e Palavras-chave. XMP (Extensible Metadata Platform) é um padrão baseado em XML que fornece metadados mais ricos e extensíveis, incluindo elementos Dublin Core, propriedades personalizadas, gerenciamento de direitos e informações de procedência. Os PDFs modernos geralmente contêm ambos, com o XMP fornecendo metadados mais abrangentes.

Do Dicionário de Informações do Documento: título, autor, assunto, palavras-chave, aplicação do criador, aplicação do produtor, data de criação e data de modificação. Dos metadados XMP: título, autor, descrição, assunto, ferramenta de criação, datas de criação/modificação/metadados, identificador do documento, idioma, informações de direitos/direitos autorais, URL de origem e quaisquer propriedades de namespace personalizadas. A ferramenta também extrai informações básicas do arquivo: nome do arquivo, tamanho do arquivo, versão do PDF, contagem de páginas e status de criptografia.

A ferramenta tenta ler metadados de PDFs criptografados usando a opção ignoreEncryption do pdf-lib, que às vezes pode acessar o Dicionário de informações do documento sem a senha. No entanto, PDFs fortemente criptografados (AES-256) com acesso restrito a metadados podem não ser legíveis. A extração de metadados XMP de PDFs criptografados normalmente requer a senha correta. A ferramenta informará claramente se um PDF está criptografado.

Não. Todo o processamento acontece inteiramente no seu navegador. O arquivo PDF é lido localmente usando a API File e processado na memória por pdf-lib e pdfjs-dist. Seus documentos nunca saem do seu dispositivo - sem uploads, sem coleta de dados, sem solicitações de servidores de terceiros.

Os campos de metadados podem estar faltando porque o criador do PDF não os preencheu, os metadados foram removidos por motivos de privacidade ou o PDF foi criado com uma ferramenta que não preenche determinados campos. A ferramenta mostra claramente quais campos possuem valores e quais estão vazios. O indicador de integridade (Completo/Parcial/Mínimo) fornece uma avaliação rápida da quantidade de metadados encontrados.

A ferramenta oferece suporte a arquivos PDF de todas as versões, desde PDF 1.0 até a especificação PDF 2.0 mais recente. A versão PDF é detectada no cabeçalho do arquivo. Os metadados XMP são suportados a partir do PDF 1.4. PDFs mais antigos podem ter apenas metadados do Document Info Dictionary, que são totalmente suportados.

Sim - 100% grátis, para sempre. Sem inscrição, sem conta, sem nível premium, sem limites de uso e sem anúncios. Analise quantos PDFs você precisar. Todo o processamento é feito localmente no seu navegador, sem custos de servidor.