Ekstraktor URL Tersemat
Unggah dokumen Office (DOCX, XLSX, PPTX) atau file PDF untuk mengekstrak semua URL yang disematkan. Alat ini menguraikan struktur dokumen internal untuk menemukan setiap tautan eksternal - mulai dari hyperlink dan atribut href hingga URL kosong dalam teks. Setiap URL ditampilkan dengan lokasinya di dalam dokumen, cuplikan konteks yang menunjukkan teks di sekitarnya, informasi protokol (HTTPS vs HTTP), dan nama host yang diekstraksi. Filter berdasarkan protokol, cari berdasarkan kata kunci, dan salin atau ekspor daftar URL lengkap. Semua pemrosesan berjalan secara lokal di browser Anda - tidak ada data yang diunggah, tidak perlu mendaftar.
Upload Office documents (DOCX, XLSX, PPTX) or PDF files to extract all embedded URLs. Shows each URL with its location, context snippet, protocol, and hostname. Perfect for auditing external links, finding tracking pixels, or inspecting document content. All processing runs entirely in your browser with zero server uploads.
Drop a document or PDF here, or click to browse
Supports DOCX, XLSX, PPTX, PDF - max 100 MB
The Embedded URL Extractor parses the internal structure of Office documents (DOCX, XLSX, PPTX) using the JSZip library to decompress their ZIP-based format. It scans each internal component - document body, headers/footers, worksheets, slides, shared strings, hyperlink relationships (.rels), and comments - extracting URLs from both raw text and href attributes. For PDF files, it extracts URL patterns from the raw text content. Each URL is displayed with its location within the document, a context snippet showing surrounding text, protocol information (HTTPS vs HTTP), and the extracted hostname. All processing runs locally in your browser - no data is ever uploaded to any server.
Mengapa Menggunakan Ekstraktor URL Tersemat Kami?
- Deteksi URL Komprehensif: Mengekstrak URL dari seluruh bagian dokumen Office - badan dokumen, header dan footer, lembar kerja (XLSX), slide (PPTX), tabel string bersama, hubungan hyperlink, komentar, dan catatan kaki/catatan akhir. Untuk PDF, pindai konten teks mentah untuk mencari pola URL. Tidak ada tautan yang terlewat, baik itu hyperlink yang dapat diklik, atribut href, atau URL kosong di teks.
- Klasifikasi URL Cerdas: Setiap URL yang diekstraksi diklasifikasikan berdasarkan protokol (HTTPS, HTTP, FTP, lainnya), jenis tautan (hyperlink, atribut href, bare URL), dan status keamanan. Nama host diekstraksi dan dihapus duplikatnya untuk gambaran singkat semua domain eksternal yang dirujuk dalam dokumen. Cuplikan konteks menampilkan teks di sekitar setiap URL, membantu Anda memahami tujuan setiap tautan.
- Mendukung Semua Format Dokumen Utama: Bekerja dengan DOCX (dokumen Word), XLSX (spreadsheet Excel), PPTX (presentasi PowerPoint), dan file PDF. Keempat format ini mencakup sebagian besar skenario penyematan URL berbasis dokumen - mulai dari lampiran email dan dokumen bisnis hingga presentasi dan e-book. Format biner lama (DOC, XLS, PPT) tidak didukung.
- Laporan & Ekspor URL Terperinci: Setiap URL ditampilkan dengan alamat lengkap, lokasi dalam dokumen, protokol, nama host, dan cuplikan konteks. Filter URL berdasarkan protokol (semua, hanya HTTPS, hanya HTTP) atau cari berdasarkan kata kunci. Salin semua URL ke clipboard sebagai daftar berformat atau ekspor hasil lengkap sebagai JSON untuk analisis lebih lanjut atau integrasi dengan alat lain.
Kasus Penggunaan Umum untuk Ekstraktor URL Tersemat
- Penilaian Keamanan Dokumen: Profesional keamanan dapat mengekstrak semua URL dari dokumen mencurigakan sebelum membukanya. Daripada mengeklik tautan yang tidak dikenal, ekstrak URL terlebih dahulu untuk meninjau tujuan, mengidentifikasi domain yang mencurigakan, dan menilai tingkat risiko. Sangat berguna untuk menganalisis lampiran email yang diterima dari pengirim yang tidak dikenal.
- Analisis Tautan Lampiran Email: Analisis URL yang tertanam dalam lampiran email tanpa membukanya di browser. Ekstrak piksel pelacakan, tautan berhenti berlangganan, URL pemasaran, dan referensi sumber daya eksternal dari buletin, faktur, dan dokumen bisnis yang diterima melalui email.
- Audit Konten Dokumen: Sebelum menerbitkan atau membagikan dokumen secara eksternal, audit semua tautan yang disematkan untuk memastikan tautan tersebut mengarah ke tujuan yang benar, tidak rusak, dan tidak berisi URL pelacakan atau suar analitik yang tidak terduga. Sangat penting untuk dokumen hukum, laporan keuangan, dan materi yang berhubungan dengan publik.
- Pengembangan Web & QA: Ekstrak semua URL dari dokumen desain, spesifikasi teknis, dan ringkasan konten (DOCX/PDF) untuk membuat peta situs, memeriksa validitas tautan, dan memastikan semua sumber daya yang direferensikan dapat diakses. Berguna untuk tim QA yang memverifikasi bahwa tautan dokumentasi sudah benar.
- Analisis Penelitian & Kutipan: Ekstrak semua tautan eksternal dari makalah akademis, dokumen penelitian, dan e-book untuk membuat daftar kutipan, memverifikasi ketersediaan referensi, dan memahami ekosistem sumber daya eksternal dari karya yang diterbitkan. Sangat berguna untuk tinjauan literatur dan meta-analisis.
- Pendidikan Forensik Digital: Siswa yang mempelajari forensik dokumen dan investigasi digital dapat menggunakan alat ini untuk memahami bagaimana URL disematkan dalam dokumen, bagaimana hyperlink disimpan dalam format berbeda, dan cara mengekstrak bukti dari file dokumen. Latihan praktis untuk kursus keamanan siber dan forensik.
Apa Itu Ekstraksi URL Tersemat?
Ekstraksi URL tertanam adalah proses menemukan dan mengekstraksi semua hyperlink dan URL yang tertanam dalam file dokumen. Dokumen bisa berisi URL dalam berbagai bentuk: hyperlink yang dapat diklik (disimpan dalam file hubungan dokumen untuk format Office), atribut href dalam markup XML, URL kosong dalam konten teks (diketik atau ditempel), piksel pelacakan (gambar kecil yang dimuat dari server eksternal), sumber daya yang disematkan (lembar gaya, skrip, atau font tertaut), dan referensi silang ke file eksternal. Alat kami mengekstrak semua ini, di mana pun kemunculannya dalam struktur dokumen, dan menyajikannya dalam daftar yang jelas dan terorganisir dengan informasi kontekstual.
Bagaimana URL Disimpan dalam Berbagai Format
- Dokumen Office (DOCX, XLSX, PPTX): Ini adalah arsip ZIP yang berisi file XML. URL disimpan di beberapa lokasi: file hubungan (.rels) berisi URL target sebenarnya untuk hyperlink, sedangkan teks tampilan ada dalam XML konten utama. Selain itu, URL dapat muncul sebagai teks mentah dalam rangkaian paragraf (elemen w:t untuk DOCX), teks sel untuk XLSX, atau rangkaian teks untuk PPTX. Tabel string bersama di XLSX juga berisi teks dengan URL. Alat kami mem-parsing semua lokasi ini.
- File PDF: PDF menyimpan URL sebagai anotasi tautan (anotasi dengan tindakan URI) dan sebagai konten teks mentah dalam aliran konten halaman. Tidak seperti format Office, PDF tidak memiliki struktur file hubungan terpisah - tautan disematkan langsung ke deskripsi halaman. Alat kami mengekstrak URL dengan memindai konten teks mentah PDF dan mencocokkan pola URL.
- Hyperlink vs. Hubungan: Dalam format Office Open XML, hyperlink terdiri dari dua bagian: hubungan yang memetakan ID ke URL target (disimpan dalam file .rels), dan markup sebaris yang mereferensikan ID tersebut. Alat kami mengekstrak URL dari pemetaan hubungan dan referensi sebaris untuk memastikan cakupan yang lengkap.
Cara Kerja Ekstraktor URL Kami
- Deteksi Jenis File: Alat ini membaca byte ajaib file untuk mengidentifikasi format - header ZIP untuk dokumen Office (50 4B 03 04) dan header %PDF (25 50 44 46) untuk file PDF. Hal ini memastikan deteksi format yang akurat, apa pun ekstensi filenya.
- Penguraian Dokumen: Untuk dokumen Office, JSZip mendekompresi struktur ZIP dan kami mengurai konten XML dari setiap komponen: badan dokumen, header/footer, lembar kerja (XLSX), slide (PPTX), tabel string bersama, file hubungan (.rels), dan komentar. Untuk PDF, kami mengekstrak konten teks dari biner mentah dengan membaca objek teks di antara tanda kurung.
- Ekstraksi & Klasifikasi URL: Semua teks yang diekstraksi dipindai dengan regex pola URL untuk http://, https://, dan www. URL awalan. Atribut href dalam XML juga diekstraksi. Setiap URL unik diklasifikasikan berdasarkan protokol (HTTPS, HTTP, FTP, lainnya), jenis tautan (hyperlink, href, atau bare URL), dan nama hostnya diurai. Deteksi duplikat memastikan setiap URL hanya muncul satu kali.
Batasan & Privasi
Jenis file yang didukung: file DOCX, XLSX, PPTX, dan PDF. Format biner lama (DOC, XLS, PPT) menggunakan struktur OLE2/CFB dan tidak didukung. Batas ukuran file: Dokumen hingga 100 MB. Cakupan URL: Alat ini mengekstrak URL dengan awalan http://, https://, ftp://, dan www. Itu tidak mengekstrak tautan mailto:, javascript: URL, atau jalur relatif. Tidak ada pemeriksaan langsung: Alat ini mengekstrak URL tetapi tidak memverifikasi apakah URL tersebut saat ini dapat diakses atau valid. Gunakan URL yang diekstraksi dengan pemeriksa tautan untuk verifikasi ketersediaan. 100% pribadi: Semua pemrosesan berjalan sepenuhnya di browser Anda menggunakan FileReader dan JSZip API. File tidak pernah keluar dari perangkat Anda - tidak ada unggahan, tidak ada pendaftaran, tidak ada pengumpulan data.
Pertanyaan yang Sering Diajukan
Alat ini dapat memindai file DOCX (dokumen Word), XLSX (spreadsheet Excel), PPTX (presentasi PowerPoint), dan PDF. Ini adalah format paling umum untuk penyematan URL berbasis dokumen. Format biner Office yang lebih lama (DOC, XLS, PPT) menggunakan struktur internal berbeda (OLE2/CFB) yang tidak dapat diurai di lingkungan browser.
Alat ini mengekstrak URL dengan awalan http://, https://, ftp://, dan www. dari konten teks mentah dan atribut hyperlink. Ini membedakan antara URL absolut dan mencatat protokolnya. Itu tidak mengekstrak tautan mailto:, javascript: URL, tel: URI, atau jalur relatif karena tidak mewakili alamat web eksternal.
Tidak. Dokumen Office yang dilindungi kata sandi atau terenkripsi tidak dapat diekstraksi isinya tanpa kata sandi. Struktur ZIP mungkin dapat dibaca pada tingkat file, namun konten XML internal dienkripsi dan tidak dapat diuraikan. Anda harus menghapus perlindungan di aplikasi sumber sebelum mengunggah.
Cuplikan konteks menampilkan hingga 60 karakter teks sebelum dan sesudah setiap URL dalam dokumen, memberikan konteks sekitar yang membantu Anda memahami tujuan tautan. Misalnya, URL yang ditemukan di sebelah teks "Klik di sini untuk melihat persyaratan kami" dengan jelas menunjukkan tautan persyaratan layanan. Cuplikan dipangkas dan tidak menyertakan markup XML di sekitarnya.
Tidak. Ekstraktor URL Tersemat hanya mengekstrak URL dari dokumen - ia tidak melakukan validasi langsung, pencarian DNS, atau pemeriksaan aksesibilitas. URL yang diekstraksi mungkin mengarah ke halaman yang dihapus atau memerlukan autentikasi. Untuk pemeriksaan tautan, gunakan daftar URL yang diekstrak dengan alat pemeriksa tautan khusus.
Tidak. PDF yang dipindai (yang dibuat dari gambar, bukan teks digital) tidak berisi teks yang dapat dipilih atau struktur XML dengan pola URL. Alat ini hanya dapat mengekstrak URL dari PDF berbasis teks yang kontennya disimpan sebagai objek teks atau anotasi tautan. Untuk dokumen yang dipindai, OCR diperlukan terlebih dahulu.
Sangat. Semua analisis dokumen terjadi sepenuhnya di dalam browser Anda menggunakan perpustakaan JSZip untuk penguraian dokumen Office dan pembacaan biner langsung untuk PDF. File Anda tidak pernah diunggah ke server mana pun - file tidak pernah meninggalkan perangkat Anda. Tidak ada pendaftaran, tidak ada akun, tidak ada pengumpulan data, tidak ada pelacakan penggunaan. Alat ini bekerja secara offline setelah pemuatan halaman awal.
Hyperlink adalah tautan yang dapat diklik yang dibuat menggunakan fitur hyperlink aplikasi dokumen dengan URL target khusus yang disimpan dalam file hubungan. URL kosong hanyalah teks yang diketik ke dalam dokumen yang terlihat seperti URL. Kedua jenis tersebut diekstraksi, dengan hyperlink terdeteksi dari struktur hubungan dan URL kosong ditemukan dengan pencocokan pola dalam konten teks.
Ya - 100% gratis, selamanya. Tanpa pendaftaran, tanpa akun, tanpa tingkat premium, tanpa batasan penggunaan, dan tanpa iklan. Ekstrak URL dari dokumen sebanyak yang Anda perlukan. Semua pemrosesan dilakukan secara lokal di browser Anda tanpa unggahan server. Tidak ada data yang keluar dari perangkat Anda.