AI में टोकन क्या हैं?
टोकन टेक्स्ट के वे टुकड़े हैं जो AI मॉडल पढ़ता और बनाता है — और यही वह इकाई है जिसमें हर कॉन्टेक्स्ट सीमा और API बिल लिखा जाता है।
परिभाषा, एक वाक्य में
टोकन टेक्स्ट का एक टुकड़ा है — अक्सर कोई पूरी सामान्य शब्द, कभी शब्द का अंश या चिह्न — जिसे भाषा मॉडल एक इकाई की तरह संसाधित करता है। मॉडल कभी सीधे अक्षर नहीं देखते; टोकनाइज़र पहले आपके टेक्स्ट को टोकन ID में बदलता है, और उसके बाद सब कुछ (कॉन्टेक्स्ट सीमाएँ, कीमतें, उपयोग मीटर) उन्हीं टोकनों में गिना जाता है।
सामान्य अंग्रेज़ी के लिए एक टोकन लगभग 0.75 शब्द, या करीब 4 कैरेक्टर (स्पेस सहित) होता है। बस यही अनुपात आपकी जानी-पहचानी इकाइयों (शब्द, पेज) और प्रोवाइडर की बिलिंग इकाई (टोकन) के बीच बदलता है।
अभ्यास में टोकन कैसा दिखता है
छोटे सामान्य शब्द एक टोकन में समा जाते हैं: the, and, is। लंबे या दुर्लभ शब्द टुकड़ों में बंटते हैं। संख्याएँ, URL, कोड पहचानकर्ता और इमोजी कई टोकन बन जाते हैं।
हर मॉडल परिवार ने अपना टोकनाइज़र शब्दकोश सिखाया है, इसलिए एक ही वाक्य GPT, Claude, Gemini, Grok और Kimi पर हल्के अलग संख्या में टोकन बनता है — और एक ही प्रोवाइडर में टोकनाइज़र पीढ़ियाँ बदलती हैं।
AI अनुरोध में टोकन कहाँ आते हैं
इनपुट टोकन में मॉडल को भेजी गई हर चीज़ शामिल है: सिस्टम निर्देश, संदेश, बातचीत का इतिहास, प्राप्त दस्तावेज़ और टूल परिभाषाएँ। आउटपुट टोकन मॉडल बनाता है, अधिकतर इनपुट से 3–6 गुना ऊँची दर पर। कैश्ड इनपुट टोकन दोहराए जाने वाले प्रीफिक्स हैं जो भारी छूट पर मिलते हैं।
- इनपुट: निर्देश, सवाल, संदर्भ और इतिहास।
- आउटपुट: मॉडल का जवाब — सबसे महंगा हिस्सा।
- कैश्ड इनपुट: पुनः उपयोग किए प्रीफिक्स, अक्सर इनपुट कीमत का 10%।
टोकन गिनती मायने क्यों रखती है
टोकन तय करते हैं कि अनुरोध मॉडल की कॉन्टेक्स्ट विंडो में समेगा या नहीं और उसकी कीमत क्या होगी। एक छोटा संदेश भी बड़ा अनुरोध बन सकता है अगर ऐप लंबा सिस्टम प्रॉम्प्ट, कई दस्तावेज़ या पूरी बातचीत जोड़ दे।
बड़े पैमाने पर छोटे टोकन फैसले जमा होते हैं: $2,000/माह की वर्कलोड में प्रॉम्प्ट टोकन 20% काटने पर $400 बचते हैं — जो आउटपुट बनने से रुका वो अलग।
एक टोकन कितने शब्द होता है?
योजना अनुपात: 1 टोकन ≈ 0.75 शब्द ≈ 4 कैरेक्टर; 1 शब्द ≈ 1.3 टोकन; 1,000 टोकन ≈ 750 शब्द, यानी 1.5–2 पेज। 128K टोकन की विंडो में लगभग एक उपन्यास समता है; 1M में करीब दस।
एक संख्या नहीं, सीमा इस्तेमाल करें: सामान्य अंग्रेज़ी 0.85 शब्द प्रति टोकन के पास रहती है, घनी तकनीकी लेखन 0.65 के पास, और कोड या गैर-लैटिन लिपियाँ काफ़ी ज़्यादा सघन।
एक उपयोगी योजना प्रक्रिया
पहले स्थिर प्रॉम्प्ट गिनें — ब्राउज़र में असली टोकनाइज़र OpenAI मॉडल के लिए सटीक गिनती और बाकियों के लिए साफ़ तौर पर चिह्नित अनुमान देता है। फिर सामान्य बातचीत और रिट्रीवल संदर्भ जोड़ें, जवाब के लिए जगह रिज़र्व करें और यथार्थ ट्रैफ़िक से गुणा करें।
आख़िर में कैलिब्रेट करें: हर जवाब के साथ प्रोवाइडर सटीक उपयोग संख्या लौटाते हैं। एक हफ़्ते लॉग करें और अपने अनुमान से तुलना करें।
अक्सर पूछे जाने वाले सवाल
AI में टोकन ठीक क्या है?
टेक्स्ट का एक टुकड़ा — आम तौर पर कोई सामान्य शब्द या शब्दांश — जिसे मॉडल एक इकाई की तरह पढ़ता या लिखता है। प्रोवाइडर प्रति टोकन चार्ज करते हैं, इनपुट और आउटपुट अलग-अलग।
सरल शब्दों में टोकन क्या है?
टोकन को टेक्स्ट के LEGO टुकड़े समझिए: आम शब्द एक टुकड़ा; दुर्लभ शब्द, संख्याएँ और कोड कई छोटे जुड़े टुकड़े।
एक टोकन कितने शब्द है?
लगभग 0.75 अंग्रेज़ी शब्द प्रति टोकन; एक शब्द करीब 1.3 टोकन। 1,000 टोकन लगभग 750 शब्द।
इनपुट टोकन और आउटपुट टोकन में क्या फ़र्क़ है?
इनपुट टोकन वह सब है जो आप अनुरोध में भेजते हैं; आउटपुट टोकन वह है जो मॉडल बनाता है, जिसकी दर ज़्यादा होती है।
क्या सभी AI मॉडल एक ही टोकन इस्तेमाल करते हैं?
नहीं। हर मॉडल परिवार का अपना टोकनाइज़र शब्दकोश है, इसलिए एक ही टेक्स्ट GPT, Claude, Gemini, Grok और Kimi पर अलग गिनती देता है।