Wat telt deze tokenteller mee?
Kies precies de encodering die je toepassing nodig heeft. De tokenizer splitst je tekst in stukken UTF-8-bytes en voegt die samen volgens de gekozen woordenschat. Witruimte, hoofdletters en leestekens kunnen de tokens veranderen, ook als de woorden op elkaar lijken.
De telling omvat alleen de geplakte tekst. Chatrollen, systeemomhulsels, tools, afbeeldingen, audio en andere extra onderdelen van het verzoek tellen niet mee. De namen van de encoderingen staan er rechtstreeks bij, zodat een veranderende modelnaam niet ongemerkt de verkeerde woordenschat kiest.
Open de tokendetails om grenzen en ID's te bekijken. De geëxporteerde token-ID's reconstrueren de UTF-8-bytes van de tekst; de tool controleert of die overeenkomen voordat exporteren mogelijk wordt. Tekenreeksen die op speciale tokens lijken, tellen als gewone tekst.
Voorbeeld
“hello world” bestaat in beide encoderingen uit 2 tokens, maar de ID's verschillen: cl100k_base geeft [15339, 1917] en o200k_base geeft [24912, 2375].
Voordat je het resultaat gebruikt
Deze telling geeft niet het gefactureerde API-gebruik weer en garandeert niet dat de tekst binnen het contextvenster past. Alleen de twee genoemde basisencoderingen worden ondersteund. Tokens kunnen een Unicode-teken splitsen; een afzonderlijk stukje in het voorbeeld kan een vervangingssymbool tonen, ook als de gecombineerde bytes exact kloppen. Losse, ongeldige UTF-16-surrogaten worden genormaliseerd naar het vervangingsteken.
Bijgewerkt
Deze pagina citeren
ToolOctopus. “Tokens tellen.” Bijgewerkt 7 oktober 2026. https://tooloctopus.com/nl/tokens-tellen.
Voeg een raadpleegdatum toe als je instructies dat vereisen.
Bronvermeldingen worden opgemaakt met citeproc-js van Frank Bennett en stijlen uit Citation Style Language. Licentie en broncode.