CodeKitHub
Bahasa Indonesia
Alat Teks

AI Token Counter

Tempelkan teks, prompt, atau kode apa pun dan lihat dengan tepat berapa banyak token yang digunakan — menggunakan encoding tokenizer yang sama seperti yang digunakan secara internal oleh model OpenAI (o200k_base untuk GPT-4o, cl100k_base untuk GPT-4/GPT-3.5), bukan perkiraan kasar berdasarkan jumlah karakter. Jumlah karakter dan kata juga ditampilkan sebagai referensi. Semuanya berjalan secara lokal di browser Anda.

0
Tokens
0
Characters
0
Words

Different models tokenize text differently — switch the model above to see the count change. Everything is computed locally; your text is never uploaded.

Apa Itu Alat Ini?

Model bahasa tidak memproses teks per karakter atau per kata — mereka membaginya menjadi "token", potongan yang seringkali beberapa karakter panjangnya (kira-kira 4 karakter atau 0,75 kata per token dalam bahasa Inggris, meski ini sangat bervariasi tergantung bahasa dan konten). Jumlah token secara langsung menentukan biaya API Anda dan apakah prompt Anda muat di dalam jendela konteks sebuah model.

Alat ini menggunakan encoding tokenizer asli — o200k_base (digunakan oleh GPT-4o dan GPT-4o mini) dan cl100k_base (digunakan oleh GPT-4 dan GPT-3.5) — alih-alih perkiraan kasar "jumlah karakter dibagi 4", sehingga jumlah yang Anda lihat di sini sesuai dengan apa yang sebenarnya akan Anda tagih atau batasi.

Mengapa Menggunakannya?

  • Encoding tokenizer asli (o200k_base, cl100k_base) — bukan tebakan berdasarkan jumlah karakter.
  • Ganti model secara instan untuk membandingkan bagaimana teks yang sama di-tokenisasi berbeda.
  • Jumlah karakter dan kata ditampilkan bersamaan, untuk referensi cepat.
  • Diperbarui secara langsung saat Anda mengetik atau menempel — tanpa perlu mengklik tombol.
  • 100% lokal — prompt atau dokumen Anda tidak pernah diunggah, yang penting jika berisi teks kepemilikan atau sensitif.

Cara Menggunakan

  1. Tempelkan atau ketik teks, prompt, atau kode Anda ke dalam kotak.
  2. Pilih model yang Anda tuju (GPT-4o / GPT-4o mini, atau GPT-4 / GPT-3.5).
  3. Jumlah token diperbarui secara instan — ganti model untuk membandingkan.
  4. Gunakan jumlah karakter/kata di sampingnya sebagai pemeriksaan akal sehat atau untuk batasan yang tidak berbasis token.

Contoh

Input

"Hello, world!" (encoding GPT-4o)

Output

4 token, 13 karakter, 2 kata

Frasa pendek yang umum sering di-tokenisasi sebagai 1 token per kata atau tanda baca, tetapi ini bervariasi tergantung kapitalisasi, spasi, dan bahasa.

Tokenizer mana yang sebaiknya Anda periksa?

Kedua encoding ini tidak bisa saling menggantikan — pilih yang sesuai dengan model yang benar-benar Anda panggil, karena teks yang sama bisa di-tokenisasi menjadi jumlah yang berbeda secara signifikan pada masing-masing.

Keluarga modelTokenizerKapan menggunakannya
GPT-4o, GPT-4o mini, GPT-4.1, model penalaran o1/o3o200k_baseRilis model OpenAI mana pun saat ini — ini adalah tokenizer yang telah dikirimkan OpenAI untuk semua model yang lebih baru sejak GPT-4o.
GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002cl100k_baseModel OpenAI yang lebih lama atau warisan, atau jika panggilan API Anda masih menargetkan GPT-3.5/GPT-4 (bukan GPT-4o) karena alasan biaya.
Claude, Gemini, Llama, model non-OpenAI lainnyaTidak ada — tidak dicakup di siniPenyedia ini menggunakan tokenizer mereka sendiri (tidak berbasis tiktoken); jumlah di sini tidak akan cocok dengan penagihan mereka.

Tips praktis

  • Memperkirakan biaya API sebelum mengirim permintaan: kalikan jumlah token dengan harga per token model Anda untuk mendapatkan perkiraan biaya cepat, alih-alih menebak dari jumlah karakter.
  • Memeriksa apakah dokumen panjang muat dalam jendela konteks sebuah model: tempelkan seluruhnya di sini terlebih dahulu — jauh lebih cepat daripada coba-coba dengan panggilan API sungguhan yang gagal di tengah jalan.
  • Membandingkan varian prompt engineering: jika Anda mencoba memperpendek prompt sistem untuk menghemat biaya, tempelkan setiap versi di sini untuk melihat langsung penghematan tokennya, bukan sekadar "kelihatannya lebih pendek".
  • Teks non-Inggris: jumlah token untuk teks Tionghoa, Jepang, Korea, dan aksara non-Latin lainnya seringkali jauh lebih tinggi per karakter dibandingkan bahasa Inggris — periksa ini secara eksplisit alih-alih mengasumsikan aturan 4-karakter-per-token berlaku.

Pertanyaan yang Sering Diajukan

Mengapa teks yang sama memberikan jumlah token yang berbeda untuk model yang berbeda?

GPT-4o dan GPT-4o mini menggunakan tokenizer yang lebih baru (o200k_base) dibandingkan GPT-4 dan GPT-3.5 (cl100k_base) — kedua encoding tersebut membagi teks menjadi kosakata potongan yang berbeda, sehingga input yang persis sama bisa di-tokenisasi menjadi jumlah yang berbeda tergantung model yang Anda tuju.

Apakah benar 1 token itu sekitar 4 karakter?

Itu adalah rata-rata kasar untuk prosa bahasa Inggris, tetapi sangat bervariasi: kata-kata bahasa Inggris yang umum sering hanya 1 token, sementara kata yang jarang, kode, dan terutama aksara non-Latin (Tionghoa, Jepang, Korea, Arab) bisa memakan token per karakter yang jauh lebih banyak. Selalu periksa jumlah yang tepat untuk apa pun yang sensitif terhadap biaya atau batas, alih-alih mengandalkan aturan praktis 4-karakter.

Apakah alat ini memanggil API OpenAI untuk menghitung token?

Tidak. Alat ini menggunakan implementasi JavaScript dari encoding tokenizer yang sama (o200k_base, cl100k_base), berjalan sepenuhnya di browser Anda. Tidak perlu kunci API, tidak ada permintaan jaringan yang dibuat, dan teks Anda tidak pernah dikirim ke mana pun.

Mengapa jumlah token saya penting?

Ada dua alasan: harga API ditagih per token (input dan output), dan setiap model memiliki jendela konteks maksimum yang diukur dalam token — jika prompt Anda ditambah respons yang diharapkan melebihi batas tersebut, permintaan gagal atau dipotong. Memeriksa jumlah token terlebih dahulu menghindari kedua kejutan tersebut.

Apakah ini berfungsi untuk Claude, Gemini, atau model non-OpenAI lainnya?

Jumlah yang ditampilkan secara khusus untuk tokenizer OpenAI (o200k_base dan cl100k_base). Penyedia lain menggunakan tokenizer mereka sendiri, yang bisa memberikan jumlah yang berbeda secara signifikan untuk teks yang sama — alat ini tidak mencakup itu.

Alat Terkait