Convertisseur PDF en JSON
Extrayez la structure complète du contenu de n’importe quel fichier PDF en JSON propre et structuré. Obtenez des éléments de texte avec des coordonnées, des lignes groupées, des dimensions de page et des métadonnées de document, le tout traité localement dans votre navigateur sans téléchargement sur le serveur. Choisissez parmi trois modes de sortie et téléchargez ou copiez le résultat.
No PDF loaded
Upload a PDF above to extract its content as JSON.
Qu'est-ce que la conversion PDF en JSON ?
La conversion PDF en JSON transforme chaque page PDF sélectionnée en un fichier json qui peut être ouvert, modifié, partagé ou intégré partout où les fichiers image sont pris en charge. Notre convertisseur PDF en JSON est conçu pour une exportation rapide de pages sans logiciel de conversion de bureau.
Comment fonctionne notre convertisseur PDF en JSON
Le convertisseur charge votre PDF dans le navigateur, restitue les pages à la résolution sélectionnée et prépare la sortie json téléchargeable. Le traitement reste local à votre session, ce qui évite de télécharger des documents vers un service de conversion à distance.
Options de qualité d'exportation
Les outils de transformation PDF en image peuvent exposer des paramètres tels que le DPI, la qualité de l'image et les téléchargements groupés. Des paramètres plus élevés produisent une sortie plus nette pour l'impression et la révision détaillée, tandis que des paramètres plus faibles créent des fichiers plus petits pour un partage rapide.
Structure du fichier JSON de sortie
Chaque fichier exporté représente une page PDF rendue sous forme d'image JSON autonome. Cela rend le résultat utile pour les vignettes, les aperçus, les captures d'écran, la révision visuelle, la réutilisation du contenu et les systèmes qui n'acceptent pas les téléchargements PDF complets.
Comment ouvrir des fichiers JSON : les fichiers JSON peuvent être ouverts dans les onglets du navigateur, les visionneuses d'images, les outils de conception, les flux de téléchargement CMS, les aperçus du système d'exploitation et de nombreux flux de travail de documents. Utilisez l'exportation ZIP lorsque vous avez besoin de toutes les pages ensemble en un seul téléchargement.
Foire aux questions
L'outil extrait la structure complète du contenu de votre PDF dans un document JSON. En mode structuré, cela inclut : les métadonnées du document (titre, auteur, dates), les dimensions par page, les éléments de texte individuels avec les coordonnées X/Y et les tailles de police, les lignes de texte groupées et une transcription en texte brut. Les modes compacts génèrent uniquement des lignes ou uniquement du texte.
"Structuré" fournit le plus de détails : métadonnées, éléments par page avec coordonnées, lignes groupées et texte. "Lignes uniquement" est plus compact, produisant des lignes de texte groupées en Y par page. « Texte uniquement » est le plus minimal, fournissant simplement une chaîne de texte brut par page. Utilisez Structuré pour les développeurs ayant besoin de données de mise en page précises, et Text pour une extraction simple du contenu.
Oui. Utilisez le champ Plage de pages pour spécifier les pages à extraire. Entrez « tout » pour chaque page, un numéro de page unique comme « 3 », des pages séparées par des virgules comme « 1,3,7 » ou des plages comme « 2-5 ». Vous pouvez les combiner : "1,3-5,8" extrait les pages 1, 3, 4, 5 et 8.
Non. Toutes les extractions s'exécutent entièrement dans votre navigateur Web à l'aide de JavaScript côté client (pdfjs-dist). Votre fichier PDF n’est jamais téléchargé ni transmis à aucun serveur.
Lorsqu'il est activé en mode structuré, chaque élément de texte dans la sortie JSON inclut sa position X et Y sur la page (en points, à partir de l'origine en bas à gauche), ainsi que la largeur, la hauteur et la taille de la police. Ceci est utile pour une analyse précise de la mise en page, la détection du cadre de délimitation ou la réplication de la mise en page PDF par programme.
Oui. Choisissez entre un retrait de 2 espaces (par défaut), un retrait de 4 espaces ou Minified (pas d'espace) dans le paramètre Format JSON. La sortie réduite est idéale pour la consommation programmatique ; la sortie en retrait est plus facile à examiner par un humain.
Seulement partiellement : l'outil extrait le texte numérique intégré. Si un PDF est une image numérisée, ses pages apparaîtront dans la sortie avec des tableaux d'éléments vides et sans texte. Exécutez d'abord le PDF via un outil OCR pour générer du texte intégré avant de le convertir en JSON.