Ce que le compteur de tokens prend en compte
Choisissez l’encodage exact requis par votre application. Le tokeniseur découpe votre texte en séquences d’octets UTF-8, puis les fusionne selon le vocabulaire sélectionné. Les espaces, les majuscules et la ponctuation peuvent modifier les tokens, même si les mots se ressemblent.
Le décompte porte uniquement sur le texte collé. Il exclut les rôles de conversation, les éléments d’encapsulation du système, les outils, les images, l’audio et les autres éléments ajoutés à la requête. Les noms des encodages sont affichés directement pour éviter qu’un changement de nom de modèle ne sélectionne un vocabulaire incorrect à votre insu.
Ouvrez le détail des tokens pour examiner leur découpage et leurs identifiants. Les identifiants exportés permettent de reconstituer les octets UTF-8 du texte ; l’outil vérifie cette correspondance avant d’autoriser l’export. Les chaînes qui ressemblent à des tokens spéciaux sont comptées comme du texte ordinaire.
Exemple
« hello world » compte 2 tokens dans les deux encodages, mais leurs identifiants diffèrent : cl100k_base donne [15339, 1917] et o200k_base donne [24912, 2375].
Avant d’utiliser le résultat
Ce décompte ne correspond pas à l’utilisation facturée de l’API et ne garantit pas que le texte tient dans une fenêtre de contexte. Seuls les deux encodages de base indiqués sont pris en charge. Un token peut couper un caractère Unicode ; un fragment de l’aperçu peut donc afficher un symbole de remplacement, même si les octets réunis sont exacts. Les substituts UTF-16 isolés et invalides sont normalisés en caractères de remplacement.
Mis à jour
Citer cette page
ToolOctopus. “Compteur de tokens.” Mis à jour 7 octobre 2026. https://tooloctopus.com/fr/compteur-de-tokens.
Ajoutez une date de consultation si vos consignes l’exigent.
Les références sont mises en forme avec citeproc-js, de Frank Bennett, et les styles Citation Style Language. Licence et code source.