Aller au contenu
Aback Tools Logo

Extracteur de métadonnées PDF

Téléchargez n'importe quel PDF pour extraire toutes les métadonnées intégrées. L'extracteur de métadonnées PDF lit à la fois le dictionnaire d'informations sur le document (titre, auteur, sujet, mots-clés, créateur, producteur, dates de création/modification) et les métadonnées XMP (éléments Dublin Core, propriétés Adobe XMP, informations sur les droits, identifiants de document, langue et propriétés personnalisées) à l'aide de pdf-lib et pdfjs-dist. Les champs sont organisés par groupe source (Informations sur le fichier, Informations sur le document, Métadonnées XMP) et classés par type (Identité, Contenu, Dates, Statistiques, Logiciel). Avec un filtrage par onglets, exportez sous forme de texte, de descriptions par champ et d'un indicateur de santé : tous les traitements s'exécutent localement dans votre navigateur sans aucun téléchargement. Gratuit, aucune inscription requise.

PDF Metadata Extractor

Upload any PDF to extract all embedded metadata, including the Document Info Dictionary (title, author, subject, keywords, creator, producer, creation/ modification dates) and XMP metadata when available. The tool uses pdf-lib and pdfjs-dist to read metadata locally - all processing runs entirely in your browser with zero uploads. No signup required.

Drop a PDF here or click to browse

Upload any PDF to extract its metadata - no file upload, all processing is local

Comprendre l'extraction de métadonnées PDF

  • Que sont les métadonnées PDF ? Les métadonnées PDF sont des informations descriptives intégrées dans les fichiers PDF qui documentent les propriétés du fichier : qui l'a créé, quand il a été créé, quel logiciel a été utilisé et les mots-clés de catégorisation. Ces métadonnées sont stockées dans deux emplacements principaux : le Document Info Dictionary (une structure clé-valeur simple spécifiée par la norme PDF) et les métadonnées XMP (Extensible Metadata Platform), une norme basée sur Adobe XML qui fournit des métadonnées plus riches et plus extensibles, notamment des éléments Dublin Core, des informations sur les droits et des propriétés personnalisées.
  • Comment fonctionne l'extraction de métadonnées PDF L'extracteur de métadonnées PDF utilise deux bibliothèques PDF complémentaires pour une couverture maximale. pdf-lib lit directement le dictionnaire d'informations sur le document pour extraire l'auteur, le titre, le sujet, les mots-clés, le créateur, le producteur et les dates de création/modification. pdfjs-dist (la bibliothèque de rendu PDF de Mozilla) extrait ensuite les métadonnées XMP en analysant le flux de métadonnées XML intégré, donnant accès aux éléments Dublin Core (dc:title, dc:creator, dc:description), aux propriétés Adobe XMP (xmp:CreateDate, xmp:ModifyDate, xmp:CreatorTool) et aux informations de gestion des droits (dc:rights). Les résultats des deux sources sont fusionnés et organisés par groupe de sources pour plus de clarté.
  • Informations sur le document et métadonnées XMP Le dictionnaire d'informations sur le document est le système de métadonnées le plus ancien et le plus simple défini dans la spécification PDF. Il prend en charge un ensemble fixe de champs : Titre, Auteur, Sujet, Mots-clés, Créateur, Producteur, CreationDate et ModDate. Les métadonnées XMP, introduites avec PDF 1.4 (Adobe Acrobat 5.0), fournissent une structure plus complète et extensible utilisant XML. XMP peut inclure des métadonnées Dublin Core (titre, créateur, description, sujet, droits, langue), des propriétés Adobe PDF (producteur, PDFVersion) et des espaces de noms personnalisés. Les PDF modernes contiennent souvent les deux, tandis que les PDF plus anciens ne contiennent que le dictionnaire d'informations sur le document.
  • Basé sur un navigateur et privé Tous les traitements PDF s'exécutent entièrement dans votre navigateur - vos documents ne sont jamais téléchargés sur un serveur. L'outil utilise pdf-lib pour lire le dictionnaire d'informations sur le document et pdfjs-dist pour extraire les métadonnées XMP, tous deux exécutés localement via WebAssembly et JavaScript. Cela le rend approprié pour analyser des PDF confidentiels, des documents juridiques, des contrats et des fichiers professionnels sensibles sans aucun problème de confidentialité. Pas d'inscription, pas de collecte de données, pas de suivi d'utilisation.

Foire aux questions

Un extracteur de métadonnées PDF lit les métadonnées cachées intégrées dans les fichiers PDF et les affiche dans un format lisible. Cela inclut le dictionnaire d'informations sur le document (titre, auteur, sujet, mots-clés, créateur, producteur, dates de création/modification) et les métadonnées XMP (éléments Dublin Core, propriétés Adobe XMP, informations sur les droits). Ces métadonnées ne sont pas visibles lors de la visualisation du contenu PDF et peuvent révéler des informations précieuses sur l'origine et l'historique du document.

Le Document Info Dictionary est un simple magasin de métadonnées clé-valeur défini dans la spécification PDF, prenant en charge un ensemble fixe de champs tels que Titre, Auteur, Sujet et Mots-clés. XMP (Extensible Metadata Platform) est une norme basée sur XML qui fournit des métadonnées plus riches et extensibles, notamment des éléments Dublin Core, des propriétés personnalisées, la gestion des droits et des informations de provenance. Les PDF modernes contiennent souvent les deux, XMP fournissant des métadonnées plus complètes.

Depuis le Dictionnaire d'informations sur le document : titre, auteur, sujet, mots-clés, application de créateur, application de producteur, date de création et date de modification. À partir des métadonnées XMP : titre, auteur, description, sujet, outil de création, dates de création/modification/métadonnées, identifiant du document, langue, informations sur les droits/copyright, URL source et toutes propriétés d'espace de noms personnalisées. L'outil extrait également les informations de base sur le fichier : nom du fichier, taille du fichier, version PDF, nombre de pages et état de cryptage.

L'outil tente de lire les métadonnées des PDF cryptés à l'aide de l'option ignoreEncryption de pdf-lib, qui peut parfois accéder au dictionnaire d'informations sur le document sans le mot de passe. Cependant, les PDF fortement chiffrés (AES-256) avec un accès restreint aux métadonnées peuvent ne pas être lisibles. L'extraction de métadonnées XMP à partir de PDF cryptés nécessite généralement le mot de passe correct. L'outil signalera clairement si un PDF est crypté.

Non. Tout le traitement s’effectue entièrement dans votre navigateur. Le fichier PDF est lu localement à l'aide de l'API File et traité en mémoire par pdf-lib et pdfjs-dist. Vos documents ne quittent jamais votre appareil : pas de téléchargement, pas de collecte de données, pas de requêtes de serveur tiers.

Les champs de métadonnées peuvent être manquants parce que le créateur du PDF ne les a pas renseignés, les métadonnées ont été supprimées pour des raisons de confidentialité ou le PDF a été créé avec un outil qui ne remplit pas certains champs. L'outil montre clairement quels champs ont des valeurs et lesquels sont vides. L'indicateur de santé (Complet/Partiel/Minimal) fournit une évaluation rapide de la quantité de métadonnées trouvées.

L'outil prend en charge les fichiers PDF de toutes les versions, de PDF 1.0 à la dernière spécification PDF 2.0. La version PDF est détectée à partir de l'en-tête du fichier. Les métadonnées XMP sont prises en charge à partir de PDF 1.4. Les fichiers PDF plus anciens ne peuvent contenir que des métadonnées du dictionnaire d'informations sur le document, qui sont entièrement prises en charge.

Oui, 100 % gratuit, pour toujours. Pas d'inscription, pas de compte, pas de niveau premium, pas de limites d'utilisation et pas de publicité. Analysez autant de PDF que nécessaire. Tout le traitement est effectué localement dans votre navigateur sans frais de serveur.