Kalkulator Token File
Estimasi jumlah token untuk berkas PDF, Markdown, JSON, HTML, kode sumber, CSV, dan lainnya — lokal di browser Anda. Unggah berapa pun berkas untuk melihat estimasi per berkas dan total, membandingkan biaya input di GPT-4o, Claude, Gemini, DeepSeek, dan Llama, serta memeriksa pemakaian jendela konteks. 100 % privat — tidak ada berkas yang meninggalkan perangkat Anda.
Upload files locally to estimate token counts for PDFs, Markdown, JSON, HTML, source code, CSV, and more. Compare token usage across AI models and calculate input costs - runs 100% in your browser, no data leaves your device.
Drop files here or click to browse
PDF, Markdown, JSON, HTML, source code, CSV, YAML, and more
Multiple files supported · Processed locally · No uploads
Supported formats: PDF, Markdown (.md), JSON, HTML/XML, CSV, source code (.py, .js, .ts, .go, .rs, .java…), YAML, and plain text
All processing happens locally - your files never leave your device
Mengapa mengukur token sebelum mengirim berkas
Setiap berkas yang dikirim ke model memakai token dan biaya. Mengukurnya lebih dulu mencegah error konteks, biaya tak terduga, dan pengiriman ulang yang tidak perlu.
Unggah berkas Anda, pilih model, lalu tinjau estimasi token per berkas, total, dan pemakaian jendela konteks.
- Prosa Inggris: ~3,8-4,0 karakter per token.
- Kode: ~3,2-3,4 karakter per token karena simbol dan indentasi.
- HTML/XML: ~3,0-3,2 karakter per token karena kepadatan tag.
Batas ekstraksi dari PDF
Tidak semua PDF memuat teks yang dapat diakses. Hasil pindai adalah gambar, dan berkas terenkripsi atau sangat terkompresi bisa menyembunyikan aliran teksnya.
- Angka yang jauh lebih rendah dari perkiraan biasanya menandakan PDF hasil pindai.
- PDF dengan font tersemat bisa mengembalikan teks tidak lengkap.
- Untuk angka tepat, ekstrak teks dengan pustaka khusus lalu gunakan penghitung teks biasa.
Merencanakan pemotongan saat berkas tidak muat
Bila konten melebihi jendela model, konten harus dipotong sebelum dikirim. Kalkulator menunjukkan besarnya kelebihan.
- Periksa pemakaian konteks berkas atau seluruh batch.
- Jika di atas 100 %, hitung berapa chunk yang dibutuhkan sesuai ukuran pilihan Anda.
- Pilih model dengan jendela lebih besar bila ingin menghindari pemotongan.
- Bandingkan biaya input tiap opsi sebelum memutuskan.
Pertanyaan yang Sering Diajukan
Ini alat berbasis browser yang membaca berkas yang diunggah secara lokal, mengekstrak teks yang dapat dibaca, dan mengestimasi berapa token yang akan terpakai jika konten itu dikirim ke API model bahasa seperti GPT-4o, Claude, atau Gemini. Alat ini mendukung jenis seperti PDF, Markdown, JSON, HTML, kode sumber, dan CSV, serta berjalan sepenuhnya di browser tanpa mengunggah ke server.
Mendukung PDF, Markdown (.md, .mdx), JSON dan JSONL, HTML, XML/SVG, CSV dan TSV, berkas kode sumber (.py, .js, .ts, .tsx, .go, .rs, .java, .c, .cpp, .cs, .rb, .php, .swift, .kt, .sh), YAML, TOML, INI, .env, SQL, CSS/SCSS, dan teks biasa. Berkas DOCX juga didukung melalui ekstraksi teks XML.
Estimasi memakai rasio rata-rata karakter per token per jenis berkas: sekitar 3,8-4,0 karakter/token untuk prosa Inggris, ~3,2-3,4 untuk kode, dan ~3,0-3,2 untuk HTML/XML. Ini pendekatan standar industri. Untuk penagihan kritis di produksi, verifikasi dengan tokenizer resmi penyedia Anda.
Tidak. Seluruh pemrosesan terjadi di browser Anda memakai File API. Berkas dibaca dari disk ke memori lokal browser, diproses dengan JavaScript, lalu dilepaskan. Tidak ada data berkas, teks hasil ekstraksi, atau hasil token yang dikirim ke server mana pun atau pihak ketiga.
Ekstraksi bekerja dengan mem-parsing aliran teks yang tidak terkompresi (blok BT/ET) di dalam biner PDF. PDF terkompresi, terenkripsi, hasil pindai berbasis gambar, dan PDF dengan font tersemat bisa tidak punya aliran teks yang sepenuhnya dapat diakses, sehingga jumlah karakternya lebih rendah. Untuk akurasi tinggi, ekstrak teks dulu dengan pustaka PDF sisi server lalu pakai penghitung teks biasa.
Bisa. Anda dapat menyeret beberapa berkas ke area unggah sekaligus, atau memilih beberapa berkas lewat penjelajah berkas. Setiap berkas diproses sendiri dan total per berkas maupun keseluruhan ditampilkan. Anda juga dapat menghapus berkas tertentu tanpa menghapus semua hasil.
Jika estimasi token berkas melebihi batas jendela konteks model yang dipilih, bilah pemakaian menjadi merah dan menampilkan indikator «>100 %». Anda bisa beralih ke model dengan jendela lebih besar (seperti Gemini 2.5 Pro dengan 2 juta token atau Claude Sonnet 4 dengan 1 juta token) untuk memeriksa kecocokan, atau merencanakan strategi pemotongan.
Ya, kalkulator ini sepenuhnya gratis, tanpa akun, tanpa pendaftaran, dan tanpa batas pemakaian. Berjalan 100 % di browser Anda memakai JavaScript sisi klien. Tidak ada biaya per berkas, tingkatan langganan, maupun batas permintaan.