PDF-Metadaten-Extraktor
Laden Sie ein beliebiges PDF hoch, um alle eingebetteten Metadaten zu extrahieren. Der PDF Metadata Extractor liest sowohl das Document Info Dictionary (Titel, Autor, Betreff, Schlüsselwörter, Ersteller, Produzent, Erstellungs-/Änderungsdaten) als auch XMP-Metadaten (Dublin Core-Elemente, Adobe XMP-Eigenschaften, Rechteinformationen, Dokumentkennungen, Sprache und benutzerdefinierte Eigenschaften) mithilfe von pdf-lib und pdfjs-dist. Felder sind nach Quellgruppe (Dateiinformationen, Dokumentinformationen, XMP-Metadaten) organisiert und nach Typ (Identität, Inhalt, Daten, Statistiken, Software) kategorisiert. Mit Tab-basierter Filterung, Export als Text, feldspezifischen Beschreibungen und einer Zustandsanzeige – die gesamte Verarbeitung wird lokal in Ihrem Browser ausgeführt, ohne dass Uploads erforderlich sind. Kostenlos, keine Anmeldung erforderlich.
Upload any PDF to extract all embedded metadata, including the Document Info Dictionary (title, author, subject, keywords, creator, producer, creation/ modification dates) and XMP metadata when available. The tool uses pdf-lib and pdfjs-dist to read metadata locally - all processing runs entirely in your browser with zero uploads. No signup required.
Drop a PDF here or click to browse
Upload any PDF to extract its metadata - no file upload, all processing is local
Grundlegendes zur PDF-Metadatenextraktion
- Was sind PDF-Metadaten? PDF-Metadaten sind beschreibende Informationen, die in PDF-Dateien eingebettet sind und die Eigenschaften der Datei dokumentieren – wer sie erstellt hat, wann sie erstellt wurde, welche Software verwendet wurde und Schlüsselwörter zur Kategorisierung. Diese Metadaten werden an zwei Hauptorten gespeichert: im Document Info Dictionary (einer einfachen Schlüsselwertstruktur, die durch den PDF-Standard spezifiziert wird) und in XMP-Metadaten (Extensible Metadata Platform), einem auf Adobe XML basierenden Standard, der umfangreichere, erweiterbarere Metadaten einschließlich Dublin Core-Elementen, Rechteinformationen und benutzerdefinierten Eigenschaften bereitstellt.
- So funktioniert die PDF-Metadatenextraktion Der PDF-Metadatenextraktor verwendet zwei komplementäre PDF-Bibliotheken für maximale Abdeckung. pdf-lib liest das Document Info Dictionary direkt, um Autor, Titel, Betreff, Schlüsselwörter, Ersteller, Produzent und Erstellungs-/Änderungsdaten zu extrahieren. pdfjs-dist (Mozillas PDF-Rendering-Bibliothek) extrahiert dann XMP-Metadaten durch Parsen des eingebetteten XML-Metadatenstroms und bietet Zugriff auf Dublin Core-Elemente (dc:title, dc:creator, dc:description), Adobe XMP-Eigenschaften (xmp:CreateDate, xmp:ModifyDate, xmp:CreatorTool) und Rechteverwaltungsinformationen (dc:rights). Aus Gründen der Übersichtlichkeit werden die Ergebnisse beider Quellen zusammengeführt und nach Quellengruppen geordnet.
- Dokumentinfo vs. XMP-Metadaten Das Document Info Dictionary ist das ältere, einfachere Metadatensystem, das in der PDF-Spezifikation definiert ist. Es unterstützt einen festen Satz von Feldern: Titel, Autor, Betreff, Schlüsselwörter, Ersteller, Produzent, Erstellungsdatum und ModDate. XMP-Metadaten, eingeführt mit PDF 1.4 (Adobe Acrobat 5.0), bieten eine umfassendere und erweiterbare Struktur mithilfe von XML. XMP kann Dublin Core-Metadaten (Titel, Ersteller, Beschreibung, Betreff, Rechte, Sprache), Adobe PDF-Eigenschaften (Produzent, PDFVersion) und benutzerdefinierte Namespaces enthalten. Moderne PDFs enthalten häufig beides, während ältere PDFs möglicherweise nur über das Document Info Dictionary verfügen.
- Browserbasiert und privat Die gesamte PDF-Verarbeitung läuft vollständig in Ihrem Browser – Ihre Dokumente werden niemals auf einen Server hochgeladen. Das Tool verwendet pdf-lib zum Lesen des Document Info Dictionary und pdfjs-dist zum Extrahieren von XMP-Metadaten. Beide werden lokal über WebAssembly und JavaScript ausgeführt. Dadurch eignet es sich für die Analyse vertraulicher PDFs, juristischer Dokumente, Verträge und sensibler Geschäftsdateien ohne Bedenken hinsichtlich des Datenschutzes. Keine Anmeldung, keine Datenerfassung, keine Nutzungsverfolgung.
Häufig gestellte Fragen
Ein PDF-Metadaten-Extraktor liest die versteckten Metadaten, die in PDF-Dateien eingebettet sind, und zeigt sie in einem lesbaren Format an. Dazu gehören das Document Info Dictionary (Titel, Autor, Betreff, Schlüsselwörter, Ersteller, Produzent, Erstellungs-/Änderungsdaten) und XMP-Metadaten (Dublin Core-Elemente, Adobe XMP-Eigenschaften, Rechteinformationen). Diese Metadaten sind beim Betrachten des PDF-Inhalts nicht sichtbar und können wertvolle Informationen über die Herkunft und den Verlauf des Dokuments preisgeben.
Das Document Info Dictionary ist ein einfacher Schlüsselwert-Metadatenspeicher, der in der PDF-Spezifikation definiert ist und einen festen Satz von Feldern wie Titel, Autor, Betreff und Schlüsselwörter unterstützt. XMP (Extensible Metadata Platform) ist ein XML-basierter Standard, der umfangreichere, erweiterbare Metadaten einschließlich Dublin Core-Elementen, benutzerdefinierten Eigenschaften, Rechteverwaltung und Herkunftsinformationen bereitstellt. Moderne PDFs enthalten häufig beides, wobei XMP umfassendere Metadaten bereitstellt.
Aus dem Document Info Dictionary: Titel, Autor, Betreff, Schlüsselwörter, Antrag des Erstellers, Antrag des Produzenten, Erstellungsdatum und Änderungsdatum. Aus XMP-Metadaten: Titel, Autor, Beschreibung, Betreff, Erstellungstool, Erstellungs-/Änderungs-/Metadatendaten, Dokument-ID, Sprache, Rechte-/Copyright-Informationen, Quell-URL und alle benutzerdefinierten Namespace-Eigenschaften. Das Tool extrahiert außerdem grundlegende Dateiinformationen: Dateiname, Dateigröße, PDF-Version, Seitenzahl und Verschlüsselungsstatus.
Das Tool versucht, Metadaten aus verschlüsselten PDFs mithilfe der Option „ignoreEncryption“ von pdf-lib zu lesen, wodurch manchmal ohne Kennwort auf das Document Info Dictionary zugegriffen werden kann. Allerdings sind stark verschlüsselte PDFs (AES-256) mit eingeschränktem Metadatenzugriff möglicherweise nicht lesbar. Für die XMP-Metadatenextraktion aus verschlüsselten PDFs ist normalerweise das richtige Passwort erforderlich. Das Tool meldet deutlich, ob ein PDF verschlüsselt ist.
Nein. Die gesamte Verarbeitung erfolgt vollständig in Ihrem Browser. Die PDF-Datei wird lokal mithilfe der Datei-API gelesen und im Speicher von pdf-lib und pdfjs-dist verarbeitet. Ihre Dokumente verlassen nie Ihr Gerät – keine Uploads, keine Datenerfassung, keine Serveranfragen Dritter.
Möglicherweise fehlen Metadatenfelder, weil der PDF-Ersteller sie nicht ausgefüllt hat, die Metadaten aus Datenschutzgründen entfernt wurden oder die PDF-Datei mit einem Tool erstellt wurde, das bestimmte Felder nicht ausfüllt. Das Tool zeigt deutlich an, welche Felder Werte haben und welche leer sind. Der Gesundheitsindikator (vollständig/teilweise/minimal) bietet eine schnelle Einschätzung, wie viele Metadaten gefunden wurden.
Das Tool unterstützt PDF-Dateien aller Versionen von PDF 1.0 bis zur neuesten PDF 2.0-Spezifikation. Die PDF-Version wird anhand des Dateikopfes erkannt. XMP-Metadaten werden ab PDF 1.4 unterstützt. Ältere PDFs verfügen möglicherweise nur über Document Info Dictionary-Metadaten, die vollständig unterstützt werden.
Ja – 100 % kostenlos, für immer. Keine Anmeldung, kein Konto, keine Premium-Stufe, keine Nutzungsbeschränkungen und keine Werbung. Analysieren Sie so viele PDFs, wie Sie benötigen. Die gesamte Verarbeitung erfolgt lokal in Ihrem Browser ohne Serverkosten.