Τι είναι αυτό το εργαλείο;
Τα γλωσσικά μοντέλα δεν επεξεργάζονται το κείμενο χαρακτήρα-προς-χαρακτήρα ή λέξη-προς-λέξη — το χωρίζουν σε "tokens", τμήματα που συχνά έχουν μήκος λίγων χαρακτήρων (περίπου 4 χαρακτήρες ή 0,75 λέξεις ανά token στα αγγλικά, αν και αυτό διαφέρει πολύ ανάλογα με τη γλώσσα και το περιεχόμενο). Ο αριθμός των tokens καθορίζει άμεσα το κόστος API σας και το αν το prompt σας χωράει μέσα στο παράθυρο περιεχομένου ενός μοντέλου.
Αυτό το εργαλείο χρησιμοποιεί τις πραγματικές κωδικοποιήσεις tokenizer — o200k_base (χρησιμοποιείται από GPT-4o και GPT-4o mini) και cl100k_base (χρησιμοποιείται από GPT-4 και GPT-3.5) — αντί για μια πρόχειρη προσέγγιση "χαρακτήρες διά 4", ώστε ο αριθμός που βλέπετε εδώ να ταιριάζει με αυτόν που πραγματικά θα χρεωνόσασταν ή θα σας περιόριζε.
Γιατί να το χρησιμοποιήσετε;
- Πραγματικές κωδικοποιήσεις tokenizer (o200k_base, cl100k_base) — όχι εικασία βάσει αριθμού χαρακτήρων.
- Αλλάξτε μοντέλα ακαριαία για να συγκρίνετε πώς το ίδιο κείμενο κατατέμνεται διαφορετικά.
- Αριθμός χαρακτήρων και λέξεων εμφανίζεται δίπλα, για γρήγορη αναφορά.
- Ενημερώνεται ζωντανά καθώς πληκτρολογείτε ή επικολλάτε — χωρίς κουμπί για κλικ.
- 100% τοπικό — το prompt ή το έγγραφό σας δεν μεταφορτώνεται ποτέ, κάτι που έχει σημασία αν περιέχει ιδιόκτητο ή ευαίσθητο κείμενο.
Πώς χρησιμοποιείται
- Επικολλήστε ή πληκτρολογήστε το κείμενο, prompt ή κώδικά σας στο πλαίσιο.
- Επιλέξτε το μοντέλο-στόχο (GPT-4o / GPT-4o mini, ή GPT-4 / GPT-3.5).
- Ο αριθμός token ενημερώνεται άμεσα — αλλάξτε μοντέλα για να συγκρίνετε.
- Χρησιμοποιήστε τους αριθμούς χαρακτήρων/λέξεων δίπλα ως έλεγχο λογικής ή για όρια που δεν βασίζονται σε tokens.
Παράδειγμα
Είσοδος
"Hello, world!" (κωδικοποίηση GPT-4o)Έξοδος
4 tokens, 13 χαρακτήρες, 2 λέξειςΣυνηθισμένες σύντομες φράσεις συχνά κωδικοποιούνται σε 1 token ανά λέξη ή σημείο στίξης, αλλά αυτό διαφέρει ανάλογα με τα κεφαλαία, τα κενά και τη γλώσσα.
Ποιον tokenizer πρέπει να ελέγξετε;
Οι δύο κωδικοποιήσεις δεν είναι εναλλάξιμες — επιλέξτε αυτήν που ταιριάζει με το μοντέλο που πραγματικά καλείτε, καθώς το ίδιο κείμενο μπορεί να κατατμηθεί σε αισθητά διαφορετικό αριθμό σε καθεμία.
| Οικογένεια μοντέλου | Tokenizer | Πότε να τον χρησιμοποιήσετε |
|---|---|---|
| GPT-4o, GPT-4o mini, GPT-4.1, μοντέλα συλλογισμού o1/o3 | o200k_base | Οποιαδήποτε τρέχουσα κυκλοφορία μοντέλου OpenAI — αυτός είναι ο tokenizer που έχει κυκλοφορήσει το OpenAI για όλα τα νεότερα μοντέλα μετά το GPT-4o. |
| GPT-4, GPT-4-turbo, GPT-3.5-turbo, text-embedding-ada-002 | cl100k_base | Παλαιότερα ή legacy μοντέλα OpenAI, ή αν οι κλήσεις API σας στοχεύουν ακόμα GPT-3.5/GPT-4 (όχι GPT-4o) για λόγους κόστους. |
| Claude, Gemini, Llama, άλλα μοντέλα εκτός OpenAI | Κανένα — δεν καλύπτεται εδώ | Αυτοί οι πάροχοι χρησιμοποιούν τους δικούς τους tokenizers (όχι βασισμένους σε tiktoken)· οι αριθμοί εδώ δεν θα ταιριάζουν με τη χρέωσή τους. |
Πρακτικές συμβουλές
- Εκτίμηση κόστους API πριν την αποστολή αιτήματος: πολλαπλασιάστε τον αριθμό token με την τιμή ανά token του μοντέλου σας για γρήγορη εκτίμηση κόστους, αντί να μαντεύετε από τον αριθμό χαρακτήρων.
- Έλεγχος αν ένα μεγάλο έγγραφο χωράει στο παράθυρο περιεχομένου ενός μοντέλου: επικολλήστε το εδώ πρώτα — είναι πολύ πιο γρήγορο από το να δοκιμάζετε με σφάλματα μια πραγματική κλήση API που αποτυγχάνει στη μέση.
- Σύγκριση παραλλαγών prompt engineering: αν προσπαθείτε να συντομεύσετε ένα system prompt για εξοικονόμηση κόστους, επικολλήστε κάθε έκδοση εδώ για να δείτε άμεσα την εξοικονόμηση token, όχι απλώς "φαίνεται πιο σύντομο".
- Μη αγγλικό κείμενο: ο αριθμός tokens για κινέζικα, ιαπωνικά, κορεατικά και άλλα μη λατινικά συστήματα γραφής είναι συχνά πολύ υψηλότερος ανά χαρακτήρα από τα αγγλικά — ελέγξτε το ρητά αντί να υποθέτετε ότι ισχύει ο κανόνας των 4 χαρακτήρων ανά token.
Συχνές ερωτήσεις
Γιατί το ίδιο κείμενο δίνει διαφορετικό αριθμό tokens για διαφορετικά μοντέλα;
Τα GPT-4o και GPT-4o mini χρησιμοποιούν νεότερο tokenizer (o200k_base) από τα GPT-4 και GPT-3.5 (cl100k_base) — οι δύο κωδικοποιήσεις χωρίζουν το κείμενο σε διαφορετικό λεξιλόγιο τμημάτων, οπότε η ίδια ακριβώς είσοδος μπορεί να κατατμηθεί σε διαφορετικό αριθμό ανάλογα με το ποιο μοντέλο στοχεύετε.
Ισχύει πραγματικά ότι 1 token είναι περίπου 4 χαρακτήρες;
Αυτό είναι ένας πρόχειρος μέσος όρος για αγγλικό πεζό κείμενο, αλλά διαφέρει πολύ: κοινές αγγλικές λέξεις είναι συχνά 1 token η καθεμία, ενώ σπάνιες λέξεις, κώδικας, και ειδικά μη λατινικά συστήματα γραφής (κινέζικα, ιαπωνικά, κορεατικά, αραβικά) μπορούν να χρειαστούν αισθητά περισσότερα tokens ανά χαρακτήρα. Ελέγχετε πάντα τον ακριβή αριθμό για οτιδήποτε ευαίσθητο σε κόστος ή όριο, αντί να βασίζεστε στον εμπειρικό κανόνα των 4 χαρακτήρων.
Καλεί αυτό το εργαλείο το API του OpenAI για να μετρήσει tokens;
Όχι. Χρησιμοποιεί μια υλοποίηση JavaScript των ίδιων κωδικοποιήσεων tokenizer (o200k_base, cl100k_base), που εκτελείται εξ ολοκλήρου στον browser σας. Δεν χρειάζεται κλειδί API, δεν γίνεται αίτημα δικτύου, και το κείμενό σας δεν στέλνεται ποτέ πουθενά.
Γιατί έχει σημασία ο αριθμός των tokens μου;
Για δύο λόγους: η τιμολόγηση API χρεώνεται ανά token (είσοδος και έξοδος), και κάθε μοντέλο έχει ένα μέγιστο παράθυρο περιεχομένου μετρημένο σε tokens — αν το prompt σας συν την αναμενόμενη απάντηση υπερβαίνει αυτό το όριο, το αίτημα αποτυγχάνει ή περικόπτεται. Ο έλεγχος του αριθμού token εκ των προτέρων αποφεύγει και τα δύο.
Λειτουργεί αυτό για Claude, Gemini, ή άλλα μοντέλα εκτός OpenAI;
Οι αριθμοί που εμφανίζονται είναι ειδικά για τους tokenizers του OpenAI (o200k_base και cl100k_base). Άλλοι πάροχοι χρησιμοποιούν τους δικούς τους tokenizers, οι οποίοι μπορούν να δώσουν αισθητά διαφορετικούς αριθμούς για το ίδιο κείμενο — αυτό το εργαλείο δεν τους καλύπτει.
Πόσα tokens πρέπει να περιμένω ανά λέξη;
Για συνηθισμένο αγγλικό πεζό κείμενο, περίπου 0,75 λέξεις ανά token — οπότε ένα άρθρο 1.000 λέξεων φτάνει περίπου τα 1.300 tokens. Ο κώδικας συνήθως κατατέμνεται λιγότερο αποδοτικά λόγω εσοχών και συμβόλων, και τα μη λατινικά συστήματα γραφής κοστίζουν ακόμη περισσότερο: το κινέζικο κείμενο συχνά χρησιμοποιεί ένα ή περισσότερα tokens ανά χαρακτήρα. Αν προϋπολογίζετε κόστη API, μετρήστε το πραγματικό κείμενό σας εδώ αντί να εκτιμάτε μόνο από τον αριθμό λέξεων.