Lompat ke konten
Aback Tools Logo

Kalkulator Kata ke Token

Estimasi jumlah token dari jumlah kata secara online dan gratis memakai rasio kata per token khusus model untuk GPT, Claude, Gemini, DeepSeek, Llama, Mistral, dan lainnya. Masukkan jumlah kata, tempel teks, atau pilih preset konten, lalu lihat token, biaya API, dan pemakaian jendela konteks di 15 model secara instan.

Word to Token Calculator

Estimate token counts from word counts using model-specific word-to-token ratios for 15 leading AI models. Enter words manually, paste text, or pick a content preset - then see token estimates, API costs, and context window usage instantly.

Word Count

words
050K100K

Quick Presets

Ratio: ~1.30 tokens/wordContext: 128.0K tokensInput/1M: $2.50

Baseline: ~1.3 tokens/word

Usage Forecast

reqs

Est. Tokens

~975

GPT-4o

Words

750

input count

Ratio Used

1.30×

English Prose

Context Window Usage - GPT-4o

975 used of 128.0K1% used

127.0K tokens remaining (99% free)

Monthly Input Cost - 30,000 requests

$73.13if used as prompt input

Per Request

$0.002437

If Generated (Output)

$292.50

Token Estimate

~975

Token Count Across Models

Sorted by cheapest monthly cost
ModelTokens/WordEst. TokensMonthly Input CostContext
MetaLlama 4 ScoutBudget
×1.30~975$2.930% used
MistralMistral SmallBudget
×1.32~990$2.971% used
DeepSeekDeepSeek V4 FlashBudget
×1.30~975$4.100% used
OpenAIGPT-4o MiniBudget
×1.30~975$4.391% used
GoogleGemini 2.5 FlashBudget
×1.25~938$8.440% used
DeepSeekDeepSeek V4 ProBudget
×1.30~975$12.720% used
AnthropicClaude Haiku 4.5Budget
×1.28~960$28.800% used
GoogleGemini 2.5 ProCapable
×1.25~938$35.180% used
GoogleGemini 3.5 FlashBudget
×1.25~938$42.210% used
OpenAIo3 (Reasoning)Capable
×1.30~975$58.500% used
MistralMistral LargeCapable
×1.32~990$59.401% used
OpenAIGPT-4o Selected
×1.30~975$73.131% used
OpenAIGPT-5.4Capable
×1.30~975$73.130% used
AnthropicClaude Sonnet 4.6Capable
×1.28~960$86.400% used
AnthropicClaude Opus 4.8Capable
×1.28~960$144.000% used
Estimation Note:Token counts are estimates based on average words-per-token ratios derived from published tokenizer benchmarks. English prose averages ~1.3 tokens per word for GPT/Llama BPE tokenizers and ~1.25-1.28 for Gemini and Claude. Actual counts vary by content - code, JSON, URLs, and non-Latin scripts tokenize differently. For exact counts, use the provider's official tokenizer (e.g. tiktoken for OpenAI).

Mengapa memakai kalkulator kata ke token kami

LLM tidak membaca kata demi kata: mereka memecah teks menjadi token sepanjang 2-6 karakter. Dalam prosa bahasa Inggris, satu kata rata-rata sekitar 1,3 token, tetapi rasionya berubah menurut keluarga model dan jenis konten. Kalkulator ini memakai rasio khusus untuk 15 model utama, sehingga Anda bisa menyusun anggaran dan rencana tanpa menjalankan kode atau memanggil API.

Semua dihitung di browser Anda: baik teks maupun jumlah kata tidak keluar dari perangkat Anda.

  • Estimasi instan: masukkan angka, geser slider, atau tempel teks dan token diperbarui secara real time.
  • Perhitungan privat: jumlah kata, teks yang ditempel, dan estimasi diproses sepenuhnya di browser.
  • Rasio khusus per model untuk 15 model dari OpenAI, Anthropic, Google, DeepSeek, Meta, dan Mistral.
  • Proyeksi biaya dan jendela konteks: biaya input per permintaan, proyeksi bulanan atau tahunan, dan bar visual pemakaian konteks.

Kasus penggunaan umum

Dari perencanaan anggaran API hingga desain pipeline RAG, inilah skenario yang paling sering muncul.

  • Merencanakan anggaran API: memperkirakan berapa token dalam permintaan rata-rata dan biayanya dalam skala besar.
  • Prompt engineering: memeriksa apakah system prompt, contoh, dan input muat di jendela konteks.
  • Desain pipeline RAG: memperkirakan token yang dipakai setiap potongan yang diambil sebelum membangun vector store.
  • Menentukan ukuran konten dan dokumen: memeriksa apakah artikel, laporan, atau bab buku muat di jendela konteks.
  • Membandingkan biaya antar model: menemukan model paling hemat untuk beban kerja dan bahasa Anda.
  • Pembelajaran: memahami mengapa kode atau teks CJK memakai jauh lebih banyak token daripada prosa Inggris.

Bagaimana konversi kata ke token bekerja

Rasio dasar prosa bahasa Inggris sekitar 0,75 kata per token (1,3 token per kata), tetapi setiap jenis konten mengubahnya: kode ×1,20, Markdown teknis ×1,15, dan teks non-Inggris atau CJK hingga ×1,60.

Kalkulator memberi estimasi, bukan jumlah pasti. Angka sebenarnya bergantung pada tokenizer tiap penyedia: OpenAI memakai tiktoken (BPE), Anthropic memakai SentencePiece khusus, dan Google Gemini memakai SentencePiece yang disetel untuk multibahasa. Kasus khusus seperti URL, angka, emoji, atau jargon teknis bisa jauh melebihi rasio standar.

  1. Masukkan jumlah kata: manual, slider, preset (tweet, artikel blog, makalah) atau tempel dan unggah teks.
  2. Pilih model (15 opsi) dan jenis konten: prosa Inggris, kode, Markdown teknis, non-Inggris, atau JSON.
  3. Tetapkan proyeksi pemakaian: permintaan per hari, bulan, atau tahun untuk melihat proyeksi biaya input.
  4. Tinjau hasilnya: estimasi token, pemakaian jendela konteks, proyeksi biaya, dan tabel perbandingan antar model.

Pertanyaan yang Sering Diajukan

Untuk prosa bahasa Inggris standar, 1.000 kata kira-kira 1.300 token dengan tokenizer keluarga GPT atau Llama, sekitar 1.280 token untuk Claude, dan sekitar 1.250 token untuk model Gemini. Estimasi ini memakai rasio rata-rata kata per token yang dipublikasikan tiap model. Kode, JSON, dan teks non-Inggris menghasilkan jumlah token lebih tinggi untuk jumlah kata yang sama.

Setiap penyedia melatih tokenizer berbeda (kosakata dan algoritma pemecahan). OpenAI memakai tiktoken dengan kosakata BPE 100 ribu token. Anthropic Claude memakai tokenizer SentencePiece khusus. Google Gemini juga memakai SentencePiece, tetapi disetel untuk multibahasa. Tokenizer ini memecah teks yang sama menjadi bagian sedikit berbeda, dengan selisih 2-5 % untuk bahasa Inggris.

Untuk prosa bahasa Inggris standar, estimasi biasanya dalam 5 % dari jumlah sebenarnya pada tokenizer resmi penyedia. Akurasi menurun untuk kode, data terstruktur, URL, angka, dan aksara non-Latin. Untuk jumlah pasti di sistem produksi, gunakan pustaka tokenizer resmi penyedia.

Untuk prosa bahasa Inggris, rata-rata standar industri adalah sekitar 0,75 kata per token, artinya kira-kira 1,3 token per kata. Angka ini berasal dari dokumentasi resmi OpenAI dan telah dikonfirmasi oleh benchmark independen pada keluarga model utama.

Kode sumber berisi banyak karakter yang jarang muncul dalam prosa Inggris: kurung, operator, garis bawah, titik koma, dan pengenal gabungan. Tokenizer BPE memecahnya berbeda dari kata alami, sering menghasilkan lebih banyak token per kata daripada prosa.

Ya. Masukkan perkiraan jumlah kata untuk ukuran chunk yang direncanakan, pilih model target, dan kalkulator menunjukkan berapa token yang akan dipakai chunk tersebut. Aturan umum adalah menjaga tiap chunk di bawah 512 token, yang setara sekitar 395 kata untuk model keluarga GPT.

Sepenuhnya. Kalkulator kata ke token berjalan 100 % di browser Anda. Saat Anda menempel atau mengunggah teks, teks diproses lokal di perangkat Anda: tidak pernah dikirim ke server, disimpan, atau dikirim melalui jaringan. Konten Anda tetap sepenuhnya privat.

Pilih jenis konten "Non-Inggris (CJK, dll.)" untuk menerapkan pengali 1,60× pada rasio dasar kata per token. Bahasa Mandarin, Jepang, Korea, dan aksara non-Latin lain biasanya membutuhkan jauh lebih banyak token per karakter daripada bahasa Inggris pada tokenizer BPE standar.