Was bei der Token-Zählung berücksichtigt wird
Wähle genau die Kodierung, die deine Anwendung benötigt. Der Tokenizer zerlegt deinen Text in UTF-8-Bytefolgen und führt sie anhand des gewählten Vokabulars zusammen. Leerraumzeichen, Groß- und Kleinschreibung sowie Satzzeichen können die Tokens verändern, selbst wenn die Wörter ähnlich aussehen.
Gezählt wird nur der eingefügte Text. Chat-Rollen, Systemhüllen, Tools, Bilder, Audio und weitere Bestandteile der Anfrage sind ausgeschlossen. Die Kodierungsnamen werden direkt angezeigt, damit eine Änderung des Modellnamens nicht unbemerkt zur Auswahl des falschen Vokabulars führt.
Öffne die Token-Details, um Grenzen und IDs zu prüfen. Mit den exportierten Token-IDs lassen sich die UTF-8-Bytes des Textes rekonstruieren. Das Tool prüft diese Übereinstimmung, bevor es den Export freigibt. Zeichenfolgen, die wie spezielle Tokens aussehen, werden als gewöhnlicher Text gezählt.
Beispiel
„hello world“ ergibt in beiden Kodierungen 2 Tokens, aber unterschiedliche IDs: cl100k_base liefert [15339, 1917] und o200k_base [24912, 2375].
Hinweise zum Ergebnis
Diese Zählung entspricht nicht der abgerechneten API-Nutzung und garantiert nicht, dass eine Anfrage ins Kontextfenster passt. Unterstützt werden nur die beiden genannten Basiskodierungen. Tokens können ein Unicode-Zeichen aufteilen; ein einzelner Vorschauabschnitt kann deshalb ein Ersatzzeichen zeigen, obwohl die zusammengesetzten Bytes exakt stimmen. Ungültige einzelne UTF-16-Surrogate werden zum Ersatzzeichen normalisiert.
Aktualisiert
Diese Seite zitieren
ToolOctopus. “Tokens zählen.” Aktualisiert 7. Oktober 2026. https://tooloctopus.com/de/tokens-zählen.
Ergänze ein Abrufdatum, wenn deine Vorgaben das verlangen.
Die Quellenangaben werden mit citeproc-js von Frank Bennett und Zitierstilen der Citation Style Language formatiert. Lizenz und Quellcode.