Apa saja yang masuk dalam hitungan token ini
Pilih encoding yang tepat sesuai kebutuhan aplikasi Anda. Tokenizer membagi teks menjadi potongan byte UTF-8 lalu menggabungkannya menggunakan kosakata yang dipilih. Spasi, penggunaan huruf kapital, dan tanda baca dapat mengubah token meskipun kata-katanya terlihat serupa.
Hitungan hanya mencakup teks yang ditempel. Peran dalam chat, pembungkus sistem, alat, gambar, audio, dan komponen tambahan permintaan lainnya tidak dihitung. Nama encoding ditampilkan langsung agar perubahan nama model tidak menyebabkan kosakata yang salah dipilih tanpa diketahui.
Buka detail token untuk memeriksa batas dan ID-nya. ID token yang diekspor dapat menyusun kembali byte UTF-8 teks; alat ini memeriksa kecocokannya sebelum mengaktifkan ekspor. String yang menyerupai token khusus dihitung sebagai teks biasa.
Contoh
“hello world” terdiri dari 2 token pada kedua encoding, tetapi ID-nya berbeda: cl100k_base menghasilkan [15339, 1917] dan o200k_base menghasilkan [24912, 2375].
Sebelum menggunakan hasil
Hitungan ini bukan jumlah penggunaan API yang ditagihkan atau jaminan batas konteks. Alat ini hanya mendukung dua encoding dasar yang disebutkan. Token dapat membelah satu karakter Unicode; pratinjau satu potongan bisa menampilkan simbol pengganti meskipun gabungan byte-nya tepat. Surrogate UTF-16 yang tidak valid dan tidak berpasangan dinormalisasi menjadi karakter pengganti.
Diperbarui
Kutip halaman ini
ToolOctopus. “Penghitung token.” Diperbarui 7 Oktober 2026. https://tooloctopus.com/id/penghitung-token.
Tambahkan tanggal akses jika pedoman yang Anda ikuti mewajibkannya.
Format sitasi menggunakan citeproc-js buatan Frank Bennett dan gaya Citation Style Language. Lisensi dan kode sumber.