टोकन की गिनती में क्या शामिल है
अपने ऐप्लिकेशन के लिए ज़रूरी सटीक एन्कोडिंग चुनें. टोकनाइज़र टेक्स्ट को UTF-8 बाइट के हिस्सों में बाँटता है और चुनी गई शब्दावली के अनुसार उन्हें जोड़ता है. शब्द एक जैसे दिखने पर भी खाली जगह, छोटे-बड़े अक्षर और विराम चिह्न टोकन बदल सकते हैं.
गिनती में केवल पेस्ट किया गया टेक्स्ट शामिल है. चैट भूमिकाएँ, सिस्टम रैपर, टूल, तस्वीरें, ऑडियो और अनुरोध का अन्य अतिरिक्त डेटा इसमें शामिल नहीं है. एन्कोडिंग के नाम सीधे दिखाए जाते हैं, ताकि मॉडल का नाम बदलने पर गलत शब्दावली अपने आप न चुनी जाए.
टोकन की सीमाएँ और ID जाँचने के लिए टोकन विवरण खोलें. एक्सपोर्ट की गई टोकन ID से टेक्स्ट के UTF-8 बाइट दोबारा बनाए जा सकते हैं; एक्सपोर्ट चालू करने से पहले टूल उनका मेल जाँचता है. विशेष टोकन जैसी दिखने वाली स्ट्रिंग साधारण टेक्स्ट की तरह गिनी जाती हैं.
उदाहरण
“hello world” दोनों एन्कोडिंग में 2 टोकन है, लेकिन ID अलग हैं: cl100k_base में [15339, 1917] और o200k_base में [24912, 2375].
नतीजे का इस्तेमाल करने से पहले
यह बिल में गिने जाने वाले API उपयोग की गिनती या कॉन्टेक्स्ट विंडो में समाने की गारंटी नहीं है. इसमें केवल बताई गई दो बेस एन्कोडिंग उपलब्ध हैं. टोकन किसी Unicode अक्षर को बाँट सकते हैं; सभी बाइट मिलकर सटीक होने पर भी किसी एक हिस्से के प्रीव्यू में प्रतिस्थापन चिह्न दिख सकता है. अकेले अमान्य UTF-16 सरोगेट प्रतिस्थापन अक्षर में बदल जाते हैं.
अपडेट किया गया
इस पेज का संदर्भ दें
ToolOctopus. “टोकन काउंटर.” अपडेट किया गया 7 अक्टूबर 2026. https://tooloctopus.com/hi/टोकन-काउंटर.
अगर आपके निर्देशों में ज़रूरी हो, तो पेज देखने की तारीख भी जोड़ें.
संदर्भों का प्रारूप बनाने के लिए Frank Bennett की citeproc-js लाइब्रेरी और Citation Style Language की शैलियों का इस्तेमाल होता है. लाइसेंस और सोर्स कोड.