Τι περιλαμβάνει η μέτρηση token
Επιλέξτε ακριβώς την κωδικοποίηση που απαιτεί η εφαρμογή σας. Ο tokenizer χωρίζει το κείμενο σε τμήματα byte UTF-8 και τα συγχωνεύει σύμφωνα με το επιλεγμένο λεξιλόγιο. Οι λευκοί χαρακτήρες, τα κεφαλαία και πεζά και η στίξη μπορούν να αλλάξουν τα token, ακόμη κι όταν οι λέξεις μοιάζουν.
Η μέτρηση καλύπτει μόνο το κείμενο που επικολλήσατε. Δεν περιλαμβάνει ρόλους συνομιλίας, περιβλήματα συστήματος, εργαλεία, εικόνες, ήχο ή άλλα πρόσθετα στοιχεία του αιτήματος. Τα ονόματα των κωδικοποιήσεων εμφανίζονται απευθείας, ώστε μια αλλαγή στο όνομα του μοντέλου να μην οδηγήσει σε λανθασμένη επιλογή λεξιλογίου χωρίς να το αντιληφθείτε.
Ανοίξτε τις λεπτομέρειες των token για να ελέγξετε τα όρια και τα ID. Τα εξαγόμενα ID ανασυνθέτουν τα byte UTF-8 του κειμένου· το εργαλείο ελέγχει ότι συμφωνούν πριν ενεργοποιήσει την εξαγωγή. Οι συμβολοσειρές που μοιάζουν με ειδικά token μετρώνται ως κανονικό κείμενο.
Παράδειγμα
Το «hello world» αντιστοιχεί σε 2 token και στις δύο κωδικοποιήσεις, αλλά τα ID διαφέρουν: το cl100k_base δίνει [15339, 1917] και το o200k_base δίνει [24912, 2375].
Πριν χρησιμοποιήσετε το αποτέλεσμα
Η μέτρηση δεν αντιστοιχεί στη χρεώσιμη χρήση API ούτε εγγυάται ότι το κείμενο χωρά στο παράθυρο συμφραζομένων. Υποστηρίζονται μόνο οι δύο συγκεκριμένες βασικές κωδικοποιήσεις. Ένα token μπορεί να περιέχει μέρος ενός χαρακτήρα Unicode· έτσι, ένα μεμονωμένο τμήμα στην προεπισκόπηση μπορεί να εμφανίζει σύμβολο αντικατάστασης, παρότι τα συνολικά byte είναι ακριβή. Μεμονωμένες μη έγκυρες υποκατάστατες μονάδες UTF-16 μετατρέπονται στον χαρακτήρα αντικατάστασης.
Παραπομπή σε αυτή τη σελίδα
ToolOctopus. “Μετρητής token.” Ενημερώθηκε 7 Οκτωβρίου 2026. https://tooloctopus.com/el/μετρητής-token.
Προσθέστε ημερομηνία πρόσβασης, αν απαιτείται από τις οδηγίες σας.
Οι παραπομπές μορφοποιούνται με το citeproc-js του Frank Bennett και πρότυπα Citation Style Language. Άδεια χρήσης και πηγαίος κώδικας.