Bu Araç Nedir?
Dil modelleri metni karakter karakter veya kelime kelime işlemez; metni “token”lere, genellikle birkaç karakter uzunluğunda olan parçalara böler (İngilizce’de token başına yaklaşık 4 karakter veya 0,75 kelime olmakla birlikte, bu oran dil ve içeriğe göre büyük ölçüde değişiklik gösterir). Belirteç sayısı, API maliyetinizi ve komut satırınızın modelin bağlam penceresine sığıp sığmayacağını doğrudan belirler.
Bu araç, kaba bir “karakter sayısı 4’e bölünür” yaklaşımı yerine gerçek tokenizer kodlamalarını kullanır — o200k_base (GPT-4o ve GPT-4o mini tarafından kullanılır) ve cl100k_base (GPT-4 ve GPT-3.5 tarafından kullanılır) — kullanır; bu sayede burada gördüğünüz sayı, size faturalandırılacak veya sınırlandırılacağınız gerçek değerle eşleşir.
Neden Kullanmalısınız?
- Gerçek tokenizer kodlamaları (o200k_base, cl100k_base) — karakter sayısına dayalı bir tahmin değildir.
- Modeller arasında anında geçiş yaparak, aynı metnin farklı modellerde nasıl tokenize edildiğini karşılaştırın.
- Hızlı bir bakış için karakter ve kelime sayıları yan tarafta gösterilmiştir.
- Yazarken veya yapıştırırken güncellemeler anında gerçekleşir — tıklanacak bir düğme yoktur.
- %100 yerel — komutunuz veya belgeniz hiçbir zaman yüklenmez; bu, özel veya hassas metinler içeriyorsa önemlidir.
Nasıl Kullanılır
- Metninizi, komutunuzu veya kodunuzu kutuya yapıştırın ya da yazın.
- Hedeflediğiniz modeli seçin (GPT-4o / GPT-4o mini veya GPT-4 / GPT-3.5).
- Jeton sayısı anında güncellenir — modelleri değiştirerek karşılaştırın.
- Yan taraftaki karakter/kelime sayılarını, doğrulama amacıyla veya simge tabanlı olmayan sınırlar için kullanın.
Örnek
Giriş
"Hello, world!" (GPT-4o encoding)Çıkış
4 tokens, 13 characters, 2 wordsSık kullanılan kısa ifadeler genellikle kelime veya noktalama işareti başına 1 token olarak bölünür, ancak bu durum büyük harf kullanımı, boşluklar ve dile göre değişiklik gösterir.
Hangi tokenizer’ı incelemelisiniz?
Bu iki kodlama birbirinin yerine kullanılamaz — aynı metin her iki kodlamada da belirgin şekilde farklı sayıda tokenlere ayrılabileceğinden, gerçekten çağırdığınız modele uygun olanı seçin.
| Model ailesi | Tokenizer | Ne zaman kullanılmalı? |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, o1/o3 akıl yürütme modelleri | o200k_base | OpenAI’nin şu anda piyasaya sürdüğü herhangi bir model — bu, OpenAI’nin GPT-4o’dan bu yana tüm yeni modeller için sunduğu tokenizer’dır. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Daha eski veya eski sürüm OpenAI modelleri ya da maliyet nedenleriyle API çağrılarınız hâlâ GPT-3.5/GPT-4’ü (GPT-4o değil) hedefliyorsa. |
| Claude, Gemini, Llama ve diğer OpenAI dışı modeller | İkisi de değil — bu konuda ele alınmamıştır | Bu hizmet sağlayıcılar kendi tokenleştiricilerini kullanmaktadır (tiktoken tabanlı değildir); buradaki sayılar, onların faturalandırma verileriyle uyuşmayacaktır. |
Pratik ipuçları
- İstek göndermeden önce API maliyetini tahmin etme: Karakter sayısından yola çıkarak tahminde bulunmak yerine, token sayısını modelinizin token başına fiyatıyla çarpın ve hızlı bir maliyet tahmini elde edin.
- Uzun bir belgenin bir modelin bağlam penceresine sığıp sığmadığını kontrol etmek: Öncelikle belgenin tamamını buraya yapıştırın — bu, yarıda hata veren gerçek bir API çağrısını deneme yanılma yoluyla test etmekten çok daha hızlıdır.
- Prompt mühendisliği varyantlarının karşılaştırılması: Maliyet tasarrufu sağlamak için bir sistem prompt’ını kısaltmaya çalışıyorsanız, her bir versiyonu buraya yapıştırın ve sadece “daha kısa görünüyor” demenin ötesinde, token tasarrufunu doğrudan görün.
- İngilizce dışındaki metinler: Çince, Japonca, Korece ve diğer Latin alfabesi dışındaki yazı sistemlerinde token sayısı, karakter başına genellikle İngilizceye göre çok daha yüksektir — “token başına 4 karakter” kuralının geçerli olduğunu varsaymak yerine, bunu açıkça kontrol edin.
Sıkça Sorulan Sorular
Aynı metin, farklı modellerde neden farklı token sayıları veriyor?
GPT-4o ve GPT-4o mini, GPT-4 ve GPT-3.5’ten daha yeni bir tokenleştirici (o200k_base) kullanır (cl100k_base) — bu iki kodlama yöntemi, metni farklı kelime dağarcığına sahip parçalara ayırır; bu nedenle, tamamen aynı girdi, hedeflediğiniz modele bağlı olarak farklı sayıda token'a bölünebilir.
1 token gerçekten yaklaşık 4 karakter mi?
Bu, İngilizce düz metinler için kabaca bir ortalamadır, ancak büyük farklılıklar gösterebilir: Yaygın İngilizce kelimeler genellikle her biri 1 token olarak sayılırken, nadir kelimeler, kodlar ve özellikle Latin alfabesi dışındaki yazı sistemleri (Çince, Japonca, Korece, Arapça) karakter başına belirgin şekilde daha fazla token alabilir. Maliyet veya sınırlamalar açısından hassas olan her şey için, 4 karakterlik genel kuralına güvenmek yerine her zaman kesin sayıyı kontrol edin.
Bu araç, token sayımı yapmak için OpenAI API’sini kullanıyor mu?
Hayır. Bu araç, aynı tokenizer kodlamalarının (o200k_base, cl100k_base) bir JavaScript uygulamasını kullanır ve tamamen tarayıcınızda çalışır. API anahtarı gerekmez, ağ isteği gönderilmez ve metniniz hiçbir yere gönderilmez.
Token sayımın neden önemli?
Bunun iki nedeni var: API ücretlendirmesi token başına (giriş ve çıkış) yapılır ve her modelin token cinsinden ölçülen bir maksimum bağlam penceresi vardır — eğer komut satırınız ve beklenen yanıt bu sınırı aşarsa, istek başarısız olur veya kesilir. Token sayısını önceden kontrol etmek, her iki durumdan da kaçınmanızı sağlar.
Bu yöntem Claude, Gemini veya OpenAI dışındaki diğer modellerde de işe yarıyor mu?
Gösterilen sayılar, özellikle OpenAI’nin tokenleştiricileri (o200k_base ve cl100k_base) için geçerlidir. Diğer sağlayıcılar kendi tokenleştiricilerini kullanır ve bunlar aynı metin için önemli ölçüde farklı sayılar verebilir — bu araç bunları kapsamamaktadır.