Extracteur d'URL intégré
Téléchargez des documents Office (DOCX, XLSX, PPTX) ou des fichiers PDF pour extraire toutes les URL intégrées. L'outil analyse la structure interne du document pour trouver chaque lien externe - des hyperliens et attributs href aux URL nues dans le texte. Chaque URL est affichée avec son emplacement dans le document, un extrait de contexte affichant le texte environnant, les informations de protocole (HTTPS vs HTTP) et le nom d'hôte extrait. Filtrez par protocole, recherchez par mot-clé et copiez ou exportez la liste complète des URL. Tout le traitement s'exécute localement dans votre navigateur - aucune donnée téléchargée, aucune inscription requise.
Upload Office documents (DOCX, XLSX, PPTX) or PDF files to extract all embedded URLs. Shows each URL with its location, context snippet, protocol, and hostname. Perfect for auditing external links, finding tracking pixels, or inspecting document content. All processing runs entirely in your browser with zero server uploads.
Drop a document or PDF here, or click to browse
Supports DOCX, XLSX, PPTX, PDF - max 100 MB
The Embedded URL Extractor parses the internal structure of Office documents (DOCX, XLSX, PPTX) using the JSZip library to decompress their ZIP-based format. It scans each internal component - document body, headers/footers, worksheets, slides, shared strings, hyperlink relationships (.rels), and comments - extracting URLs from both raw text and href attributes. For PDF files, it extracts URL patterns from the raw text content. Each URL is displayed with its location within the document, a context snippet showing surrounding text, protocol information (HTTPS vs HTTP), and the extracted hostname. All processing runs locally in your browser - no data is ever uploaded to any server.
Pourquoi utiliser notre extracteur d'URL intégré ?
- Détection complète des URL : extrait les URL de toutes les parties des documents Office : corps du document, en-têtes et pieds de page, feuilles de calcul (XLSX), diapositives (PPTX), tableaux de chaînes partagées, relations de liens hypertexte, commentaires et notes de bas de page/notes de fin. Pour les PDF, analyse le contenu du texte brut à la recherche de modèles d'URL. Aucun lien n'est manqué, qu'il s'agisse d'un lien hypertexte cliquable, d'un attribut href ou d'une simple URL dans le texte.
- Classification intelligente des URL : chaque URL extraite est classée par protocole (HTTPS, HTTP, FTP, autre), type de lien (lien hypertexte, attribut href, URL nue) et état de sécurité. Les noms d'hôtes sont extraits et dédupliqués pour un aperçu rapide de tous les domaines externes référencés dans le document. Les extraits de contexte affichent le texte entourant chaque URL, vous aidant ainsi à comprendre l'objectif de chaque lien.
- Prend en charge tous les principaux formats de documents : fonctionne avec les fichiers DOCX (documents Word), XLSX (feuilles de calcul Excel), PPTX (présentations PowerPoint) et PDF. Ces quatre formats couvrent la grande majorité des scénarios d'intégration d'URL basés sur des documents : des pièces jointes aux e-mails et des documents professionnels aux présentations et aux livres électroniques. Les anciens formats binaires (DOC, XLS, PPT) ne sont pas pris en charge.
- Rapports et exportation d'URL détaillés : chaque URL est affichée avec son adresse complète, son emplacement dans le document, son protocole, son nom d'hôte et un extrait de contexte. Filtrez les URL par protocole (tous, HTTPS uniquement, HTTP uniquement) ou effectuez une recherche par mot-clé. Copiez toutes les URL dans le presse-papiers sous forme de liste formatée ou exportez les résultats complets au format JSON pour une analyse plus approfondie ou une intégration avec d'autres outils.
Cas d'utilisation courants de l'extracteur d'URL intégré
- Évaluation de la sécurité des documents : les professionnels de la sécurité peuvent extraire toutes les URL des documents suspects avant de les ouvrir. Plutôt que de cliquer sur des liens inconnus, extrayez d'abord les URL pour examiner les destinations, identifier les domaines suspects et évaluer le niveau de risque. Particulièrement utile pour analyser les pièces jointes aux e-mails reçues d’expéditeurs inconnus.
- Analyse des liens des pièces jointes aux e-mails : analysez les URL intégrées dans les pièces jointes aux e-mails sans les ouvrir dans un navigateur. Extrayez les pixels de suivi, les liens de désabonnement, les URL marketing et les références de ressources externes des newsletters, des factures et des documents commerciaux reçus par e-mail.
- Audit du contenu du document : avant de publier ou de partager des documents en externe, auditez tous les liens intégrés pour vous assurer qu'ils pointent vers les bonnes destinations, ne sont pas rompus et ne contiennent pas d'URL de suivi ou de balises d'analyse inattendues. Particulièrement important pour les documents juridiques, les rapports financiers et les documents destinés au public.
- Développement Web et assurance qualité : extrayez toutes les URL des documents de conception, des spécifications techniques et des résumés de contenu (DOCX/PDF) pour créer des plans de site, vérifier la validité des liens et garantir que toutes les ressources référencées sont accessibles. Utile pour les équipes d'assurance qualité qui vérifient que les liens vers la documentation sont corrects.
- Recherche et analyse des citations : extrayez tous les liens externes des articles universitaires, des documents de recherche et des livres électroniques pour créer des listes de citations, vérifier la disponibilité des références et comprendre l'écosystème de ressources externes des œuvres publiées. Particulièrement utile pour les revues de littérature et les méta-analyses.
- Formation en criminalistique numérique : les étudiants qui étudient la criminalistique documentaire et les enquêtes numériques peuvent utiliser l'outil pour comprendre comment les URL sont intégrées dans les documents, comment les hyperliens sont stockés dans différents formats et comment extraire des preuves à partir de fichiers de documents. Exercice pratique pour les cours de cybersécurité et de criminalistique.
Qu'est-ce que l'extraction d'URL intégrée ?
L'extraction d'URL intégrée est le processus de recherche et d'extraction de tous les hyperliens et URL intégrés dans un fichier de document. Les documents peuvent contenir des URL sous de nombreuses formes : des hyperliens cliquables (stockés dans les fichiers de relations du document pour les formats Office), des attributs href dans le balisage XML, des URL nues dans le contenu texte (saisi ou collé), des pixels de suivi (minuscules images chargées à partir de serveurs externes), des ressources intégrées (feuilles de style, scripts ou polices liées) et des références croisées vers des fichiers externes. Notre outil extrait tous ces éléments, quel que soit leur emplacement dans la structure du document, et les présente dans une liste claire et organisée avec des informations contextuelles.
Comment les URL sont stockées dans différents formats
- Documents Office (DOCX, XLSX, PPTX) : Ce sont des archives ZIP contenant des fichiers XML. Les URL sont stockées à plusieurs emplacements : les fichiers de relations (.rels) contiennent les URL cibles réelles des hyperliens, tandis que le texte affiché se trouve dans le contenu XML principal. De plus, les URL peuvent apparaître sous forme de texte brut dans les passages de paragraphe (éléments w:t pour DOCX), de texte de cellule pour XLSX ou de passages de texte pour PPTX. Les tableaux de chaînes partagées dans XLSX contiennent également du texte avec des URL. Notre outil analyse tous ces emplacements.
- Fichiers PDF : les PDF stockent les URL sous forme d'annotations de lien (annotations avec une action URI) et sous forme de contenu texte brut dans les flux de contenu de page. Contrairement aux formats Office, les PDF n'ont pas de structure de fichier de relation distincte : les liens sont intégrés directement dans la description de la page. Notre outil extrait les URL en analysant le contenu textuel brut du PDF et en faisant correspondre les modèles d'URL.
- Liens hypertexte et relations : au format Office Open XML, un lien hypertexte se compose de deux parties : une relation qui mappe un ID à une URL cible (stockée dans un fichier .rels) et un balisage en ligne qui fait référence à cet ID. Notre outil extrait les URL des mappages de relations et des références en ligne pour garantir une couverture complète.
Comment fonctionne notre extracteur d'URL
- Détection du type de fichier : l'outil lit les octets magiques du fichier pour identifier le format - en-tête ZIP pour les documents Office (50 4B 03 04) et en-tête %PDF (25 50 44 46) pour les fichiers PDF. Cela garantit une détection précise du format quelle que soit l’extension du fichier.
- Analyse de documents : pour les documents Office, JSZip décompresse la structure ZIP et nous analysons le contenu XML de chaque composant : corps du document, en-têtes/pieds de page, feuilles de calcul (XLSX), diapositives (PPTX), tableaux de chaînes partagées, fichiers de relations (.rels) et commentaires. Pour les PDF, nous extrayons le contenu texte du binaire brut en lisant les objets texte entre parenthèses.
- Extraction et classification d'URL : tout le texte extrait est analysé avec des expressions rationnelles de modèle d'URL pour http://, https:// et www. URL préfixées. Les attributs href en XML sont également extraits. Chaque URL unique est classée par protocole (HTTPS, HTTP, FTP, autre), type de lien (lien hypertexte, href ou URL nue) et son nom d'hôte est analysé. La détection des doublons garantit que chaque URL n'apparaît qu'une seule fois.
Limites et confidentialité
Types de fichiers pris en charge : fichiers DOCX, XLSX, PPTX et PDF. Les formats binaires plus anciens (DOC, XLS, PPT) utilisent la structure OLE2/CFB et ne sont pas pris en charge. Limite de taille de fichier : documents jusqu'à 100 Mo. Portée de l'URL : l'outil extrait les URL avec préfixe http://, https://, ftp:// et www.. Il n'extrait pas les liens mailto:, les URL javascript: ni les chemins relatifs. Pas de vérification en direct : l'outil extrait les URL mais ne vérifie pas si elles sont actuellement accessibles ou valides. Utilisez les URL extraites avec un vérificateur de liens pour vérifier la disponibilité. 100 % privé : tous les traitements s'exécutent entièrement dans votre navigateur à l'aide des API FileReader et JSZip. Les fichiers ne quittent jamais votre appareil : pas de téléchargement, pas d'inscription, pas de collecte de données.
Foire aux questions
L'outil peut numériser des fichiers DOCX (documents Word), XLSX (feuilles de calcul Excel), PPTX (présentations PowerPoint) et PDF. Il s'agit des formats les plus courants pour l'intégration d'URL basées sur des documents. Les anciens formats Office binaires (DOC, XLS, PPT) utilisent une structure interne différente (OLE2/CFB) qui ne peut pas être analysée dans l'environnement du navigateur.
L'outil extrait les URL avec préfixe http://, https://, ftp:// et www. à partir du contenu de texte brut et des attributs de lien hypertexte. Il fait la distinction entre les URL absolues et note leur protocole. Il n'extrait pas les liens mailto:, les URL javascript:, les URI tel: ou les chemins relatifs car ceux-ci ne représentent pas des adresses Web externes.
Non. Le contenu des documents Office protégés par mot de passe ou cryptés ne peut pas être extrait sans le mot de passe. La structure ZIP peut être lisible au niveau du fichier, mais le contenu XML interne est crypté et ne peut pas être analysé. Vous devez supprimer la protection dans l'application source avant le téléchargement.
L'extrait de contexte affiche jusqu'à 60 caractères de texte avant et après chaque URL dans le document, fournissant un contexte environnant qui vous aide à comprendre l'objectif du lien. Par exemple, une URL trouvée à côté du texte « Cliquez ici pour consulter nos conditions » indique clairement un lien vers les conditions de service. L'extrait est tronqué et n'inclut pas le balisage XML environnant.
Non. L'extracteur d'URL intégré extrait uniquement les URL du document. Il n'effectue pas de validation en direct, de recherches DNS ou de contrôles d'accessibilité. Les URL extraites peuvent pointer vers des pages supprimées ou nécessiter une authentification. Pour la vérification des liens, utilisez la liste d'URL extraite avec un outil de vérification de liens dédié.
Non. Les PDF numérisés (ceux créés à partir d'images plutôt que de texte numérique) ne contiennent pas de texte sélectionnable ni de structure XML avec des modèles d'URL. L'outil ne peut extraire que les URL des PDF textuels où le contenu est stocké sous forme d'objets texte ou d'annotations de liens. Pour les documents numérisés, l’OCR serait requis en premier.
Absolument. Toutes les analyses de documents s'effectuent entièrement dans votre navigateur à l'aide de la bibliothèque JSZip pour l'analyse des documents Office et la lecture binaire directe des PDF. Vos fichiers ne sont jamais téléchargés sur aucun serveur - ils ne quittent jamais votre appareil. Pas d'inscription, pas de compte, pas de collecte de données, pas de suivi d'utilisation. L'outil fonctionne hors ligne après le chargement initial de la page.
Un lien hypertexte est un lien cliquable créé à l'aide de la fonction de lien hypertexte de l'application de documents avec une URL cible dédiée stockée dans le fichier de relations. Une URL nue est simplement un texte saisi dans le document qui ressemble à une URL. Les deux types sont extraits, avec des hyperliens détectés à partir de la structure de relation et des URL nues trouvées par correspondance de modèles dans le contenu textuel.
Oui, 100 % gratuit, pour toujours. Pas d'inscription, pas de compte, pas de niveau premium, pas de limites d'utilisation et pas de publicité. Extrayez les URL d’autant de documents que nécessaire. Tout le traitement est effectué localement dans votre navigateur sans aucun téléchargement sur le serveur. Aucune donnée ne quitte jamais votre appareil.