מה כלול בספירת הטוקנים
בחרו את הקידוד המדויק שהיישום שלכם דורש. מנגנון הטוקניזציה מפצל את הטקסט למקטעים של בתי UTF-8 וממזג אותם לפי אוצר הטוקנים שנבחר. תווי רווח, אותיות גדולות וקטנות וסימני פיסוק יכולים לשנות את הטוקנים גם כשהמילים נראות דומות.
הספירה כוללת רק את הטקסט שהודבק. היא אינה כוללת תפקידי הודעות בצ׳אט, מעטפות מערכת, כלים, תמונות, שמע ורכיבים נוספים של הבקשה. שמות הקידודים מוצגים במפורש, כדי ששינוי בשם של מודל לא יגרום לבחירה באוצר טוקנים שגוי ללא ידיעתכם.
פתחו את פרטי הטוקנים כדי לבדוק את הגבולות והמזהים שלהם. מזהי הטוקנים המיוצאים משחזרים את בתי ה־UTF-8 של הטקסט; הכלי בודק את ההתאמה לפני שהוא מאפשר ייצוא. מחרוזות שנראות כמו טוקנים מיוחדים נספרות כטקסט רגיל.
דוגמה
״hello world״ הוא 2 טוקנים בשני הקידודים, אך המזהים שונים: ב־cl100k_base מתקבלים [15339, 1917] וב־o200k_base מתקבלים [24912, 2375].
לפני השימוש בתוצאה
הספירה אינה משקפת את השימוש המחויב ב־API ואינה מבטיחה שהטקסט ייכנס לחלון ההקשר. הכלי תומך רק בשני קידודי הבסיס שצוינו. טוקנים עשויים לפצל תו Unicode; מקטע בודד בתצוגה המקדימה עשוי להציג סימן החלפה גם כשהבתים המשולבים מדויקים. יחידות surrogate לא תקינות וללא זוג ב־UTF-16 מומרות לתו ההחלפה.
ציטוט העמוד
ToolOctopus. “ספירת טוקנים.” עודכן 7 באוקטובר 2026. https://tooloctopus.com/he/ספירת-טוקנים.
אם ההנחיות דורשות זאת, יש להוסיף תאריך גישה.
הציטוטים מעוצבים באמצעות citeproc-js של Frank Bennett וסגנונות Citation Style Language. רישיון וקוד מקור.