HI ▾
TTS पाइपलाइनों के लिए अनसेंस्ड टेक्स्ट APIhttps://api.ttsapihub.com/v1

Elevenlabs API चेकलिस्ट: उत्पादन TTS पाइपलाइन गाइड

यह चेकलिस्ट ElevenLabs API के लिए महत्वपूर्ण एकीकरण चरणों को मैप करती है, यह सुनिश्चित करते हुए कि आपकी टेक्स्ट-टू-स्पीच पाइपलाइन स्ट्रीमिंग, कॉन्टेक्स्ट सीमाओं और रेट लिमिट को बिना किसी समस्या के संभाल सके। हम यह भी उजागर करते हैं कि अनसेंस्ड टेक्स्ट API आपके संवाद जनरेशन में रचनात्मक सेंसरशिप को खत्म करने के लिए मानक LLMs को कैसे बदल सकता है।

Updated

मुख्य बिंदु

  • कम विलंबता वाले उपयोगकर्ता अनुभवों के लिए स्ट्रीमिंग ऑडियो चंक को संभालने के लिए अपने ElevenLabs एकीकरण को संरचित करें।
  • संगत आवाज़ चयन और मेटाडेटा के लिए संरचित JSON आउटपुट करने के लिए अपने टेक्स्ट जनरेशन परत में टूल कॉलिंग का उपयोग करें।
  • उच्च-वॉल्यूम नैरेशन टास्क के दौरान 429 त्रुटियों से बचने के लिए अपने अनुरोध रेट लिमिट की कड़ाई से निगरानी करें।
  • लंबे ऑडियो स्क्रिप्ट में टोकन ट्रंकेशन से बचने के लिए अपनी कॉन्टेक्स्ट विंडो को सुरक्षित सीमाओं में रखें।

टेक्स्ट गुणवत्ता TTS गुणवत्ता को निर्धारित क्यों करती है

किसी भी TTS पाइपलाइन का आउटपुट उतना ही अच्छा होता है जितना इनपुट टेक्स्ट। यदि आपका LLM अजीब वाक्य रचना, असंगत विराम चिह्न या अप्रत्याशित विराम उत्पन्न करता है, तो ElevenLabs API उन त्रुटियों को बिल्कुल वैसे ही उच्चारित करेगा जैसा लिखा गया है। यही कारण है कि टेक्स्ट जनरेशन चरण अक्सर आपकी आर्किटेक्चर का सबसे महत्वपूर्ण हिस्सा होता है।

मानक मॉडल अक्सर कॉर्पोरेट सुरक्षा फ़िल्टर लागू करते हैं जो वाक्यों को काट देते हैं या विवादास्पद विषयों से बचने के लिए संवाद के बीच टोन बदल देते हैं। रचनात्मक लेखन, गेमिंग या वयस्क सामग्री पाइपलाइनों के लिए, ये विघ्न अंतर्निवेश को तोड़ देते हैं। एक बिना सेंसर LLM सुनिश्चित करता है कि आपका स्क्रिप्ट TTS इंजन तक बिल्कुल वैसे ही पहुँचे जैसा आपने इरादा किया था, जिससे सूक्ष्मता और प्रवाह बना रहता है।

  • लंबे पाठ में स्थिर चरित्र आवाज़ों के लिए जांच करें।
  • सुनिश्चित करें कि विराम चिह्न वांछित बोलने की लय से मेल खाते हैं।
  • सत्यापित करें कि सुरक्षा फ़िल्टर प्रमुख संवाद को फिर से नहीं लिख रहे हैं।

यदि आपकी टेक्स्ट पाइपलाइन एक मानक मॉडल का उपयोग करती है, तो आप अचानक टोन शिफ्ट देख सकते हैं जब कोई विषय एक छिपी हुई सीमा को पार कर जाता है। रचनात्मक स्वतंत्रता के लिए ट्यून्ड एक मॉडल पर स्विच करने से इस चर को समाप्त कर दिया जाता है।

रचनात्मक स्वतंत्रता के लिए अनसेंस्ड स्क्रिप्ट

कहानी कहने, ऑडियोबुक या इंटरैक्टिव फिक्शन के लिए एप्लिकेशन बनाते समय, आपको एक टेक्स्ट इंजन की आवश्यकता होती है जो मनमाने दिशानिर्देशों के आधार पर सामग्री को अस्वीकार न करे। हमारा API एक बिना सेंसर LLM प्रदान करता है जो कानूनी वयस्क उपयोग, सुरक्षा अनुसंधान और रचनात्मक कथा के लिए अनुकूलित है।

मॉडल, जिसे uncensored के रूप में पहचाना गया है, हमारे अपने GPU सर्वरों पर चलता है और प्रशिक्षण के लिए आपके प्रॉम्प्ट का उपयोग नहीं करता है। यह SSE के माध्यम से स्ट्रीमिंग का समर्थन करता है, जिससे आप लगभग तुरंत ऑडियो टेक्स्ट चunks उत्पन्न करना शुरू कर सकते हैं।

हम 1M इनपुट टोकन के लिए $0.25 और 1M आउटपुट टोकन के लिए $1.00 चार्ज करते हैं। कोई मासिक शुल्क नहीं है, और प्रीपेड क्रेडिट कभी समाप्त नहीं होते हैं। यह पे-एज़-यू-गो मॉडल किसी भी OpenAI-संगत क्लाइंट, जिसमें मानक ElevenLabs टेक्स्ट इनपुट शामिल हैं, के साथ सहजता से एकीकृत होता है।

  • संरचित आउटपुट के लिए टूल/फ़ंक्शन कॉलिंग का समर्थन करता है।
  • लंबी कथाओं के लिए 100,000 टोकन कॉन्टेक्स्ट विंडो।
  • मानक वयस्क या विवादास्पद विषयों के लिए कोई कंटेंट अस्वीकृति नहीं।

Elevenlabs API के लिए स्ट्रीमिंग टेक्स्ट

कम लेटेंसी रियल-टाइम TTS एप्लिकेशन के लिए महत्वपूर्ण है। जबकि ElevenLabs स्ट्रीमिंग ऑडियो का समर्थन करता है, टेक्स्ट जनरेशन परत को भी समय-प्रथम-बाइट को कम करने के लिए स्ट्रीम करना चाहिए। मानक OpenAI-कम्पेटिबल एंडपॉइंट POST /v1/chat/completions का उपयोग stream: true के साथ करें।

रियल-टाइम में टेक्स्ट चंक प्राप्त करें और उन्हें सीधे ElevenLabs स्ट्रीमिंग ऑडियो एंडपॉइंट में फीड करें। यह एक निरंतर पाइपलाइन बनाता है जहां ऑडियो पूरे स्क्रिप्ट जनरेट होने से पहले बजता है।

हमारी API SSE (Server-Sent Events) का समर्थन करती है, जिससे टेक्स्ट को सीधे आपके ऑडियो इंजन में पाइप करना आसान हो जाता है। सुनिश्चित करें कि आपका क्लाइंट आंशिक वाक्यों को सहजता से संभाले ताकि ऑडियो ग्लिच से बचा जा सके।

  • अपने LLM क्लाइंट में स्ट्रीमिंग सक्षम करें।
  • ऑडियो चंक को आने पर बफर करें।
  • नेटवर्क विघ्न को केवल गायब खंडों को पुनः प्रयास करके संभालें।

लंबी कथाओं के लिए कॉन्टेक्स्ट विंडो को संभालना

tts api जिसका उपयोग आप टेक्स्ट जनरेशन के लिए करते हैं, यदि आप ऑडियोबुक या लंबे लेख बना रहे हैं तो लंबे कॉन्टेक्स्ट विंडो को संभालना चाहिए। हमारा मॉडल 100,000 टोकन का समर्थन करता है, जो टेक्स्ट के लगभग 40-50 पृष्ठों को कवर करता है।

यदि आपकी कथा इस सीमा से अधिक होती है, तो आपको एक चंकिंग रणनीति लागू करनी चाहिए। टेक्स्ट को तार्किक खंडों में विभाजित करें, प्रत्येक को API के माध्यम से प्रोसेस करें और परिणामों को संयोजित करें। खंडों के बीच कथात्मक निरंतरता खोने से सावधान रहें।

अपने टोकन उपयोग की कड़ाई से निगरानी करें। इनपुट टोकन आउटपुट टोकन से सस्ते हैं, लेकिन लंबे प्रॉम्प्ट अभी भी जुड़ सकते हैं। अप्रत्याशित लागत से बचने के लिए बड़े टेक्स्ट भेजने से पहले टोकन गणना पूर्व-कंप्यूट करें।

  • पाठ को अध्याय या दृश्य द्वारा विभाजित करें।
  • आवाज़ की स्थिरता बनाए रखने के लिए एक सिस्टम प्रॉम्प्ट पास करें।
  • पुनः प्रोसेसिंग से बचने के लिए पूर्ण खंडों को कैश करें।

संरचित संवाद के लिए टूल कॉलिंग

जटिल एप्लिकेशन के लिए, आपको सादे टेक्स्ट से अधिक की आवश्यकता होती है। स्ट्रक्चर्ड JSON उत्पन्न करने के लिए फ़ंक्शन कॉलिंग का उपयोग करें जिसमें वॉइस ID, इमोशन टैग और मेटाडेटा शामिल हों। यह सुनिश्चित करता है कि आपकी ElevenLabs API कॉल स्थिर और पूर्वानुमेय हैं।

एक स्कीमा परिभाषित करें जिसमें voice_id, stability, और similarity_boost के लिए फ़ील्ड शामिल हों। LLM इस JSON को आउटपुट करता है, जिसे आपका बैकएंड पार्स करता है और ElevenLabs को भेजता है। यह मैनुअल कॉन्फ़िगरेशन को कम करता है और त्रुटियों से बचाता है।

हमारी API फ़ंक्शन कॉलिंग को नेटिव रूप से सपोर्ट करती है। अपने tools पैरामीटर में अपने टूल्स को परिभाषित करें और मॉडल को तय करने दें कि कब उनका उपयोग करें। यह गतिशील पात्रों या बहु-वक्ता संवादों के लिए आदर्श है।

  • आवाज़ पैरामीटर के लिए एक JSON स्कीमा परिभाषित करें।
  • TTS API को कॉल करने से पहले LLM आउटपुट को पार्स करें।
  • यदि LLM किसी फ़ील्ड को छूट जाता है तो त्रुटियों को सहजता से संभालें।

गोपनीयता: आपके स्क्रिप्ट पर प्रशिक्षण नहीं

पेशेवर सामग्री निर्माताओं के लिए, गोपनीयता सर्वोपरि है। हमारी API सुनिश्चित करती है कि आपके प्रॉम्प्ट प्रशिक्षण के लिए उपयोग नहीं किए जाते हैं। जब आप साइन इन करते हैं, तो आप केवल एक ईमेल और पासवर्ड प्रदान करते हैं, और आपका डेटा सुरक्षित रखा जाता है।

कुछ मुफ़्त ट्रायल स्तरों के विपरीत, हम अपना मॉडल बेहतर बनाने के लिए आपका टेक्स्ट उपयोग नहीं करते हैं। यह स्वामित्व वाली कहानियों, व्यापार स्क्रिप्ट या व्यक्तिगत डेटा के लिए महत्वपूर्ण है। आपकी रचनात्मक कृति आपकी ही रहती है।

हम एक कठोर सामग्री सीमा भी लागू करते हैं: किशोरों से संबंधित यौन सामग्री नहीं। यह आपकी कानूनी सामग्री पर लागू एकमात्र प्रतिबंध है। बाकी सब कुछ आपकी पाइपलाइन के लिए खेल का मैदान है।

  • आपके प्रॉम्प्ट पर कोई प्रशिक्षण नहीं।
  • न्यूनतम साइन अप आवश्यकताएं।
  • स्पष्ट कंटेंट सीमाएं।

अपने TTS API अनुरोधों के लिए रेट लिमिटिंग

रेट लिमिट केवल एक कृपा नहीं हैं; वे स्थिर उत्पादन के लिए एक आवश्यकता हैं। हमारी API प्रति कुंजी प्रति मिनट 300 अनुरोधों की अनुमति देती है। यदि आप इससे अधिक करते हैं, तो आपको 429 त्रुटि मिलेगी।

अपने क्लाइंट में एक्सपोनेंशियल बैकऑफ़ लागू करें ताकि पुनः प्रयास को कुशलता से संभाला जा सके। यदि आप इसे टाल सकते हैं तो API को समानांतर अनुरोधों से न चिढ़ाएं। उच्च-आयतन कार्यों को प्रबंधित करने के लिए एक कतार का उपयोग करें।

अपने उपभोग को ट्रैक करने के लिए अपने उपयोग डैशबोर्ड की निगरानी करें। यदि आपको उच्च सीमाओं की आवश्यकता है, तो अपनी API कुंजी को पुनः उत्पन्न करने पर विचार करें, जो पुरानी कुंजी को रद्द कर देता है और एक नया रेट लिमिट काउंटर शुरू करता है। यह अचानक बढ़ा हुआ ट्रैफ़िक के लिए उपयोगी हो सकता है।

  • प्रति मिनट 300 अनुरोधों के लिए एक अधिकतम सेट करें।
  • रीट्राइज़ के लिए एक्सपोनेन्शियल बैकऑफ़ का उपयोग करें।
  • यदि आवश्यक हो तो सीमाओं को रीसेट करने के लिए कुंजियों को पुनः उत्पन्न करें।

उच्च-आयतन TTS के लिए लागत अनुकूलन

लागत नियंत्रण स्केलिंग के लिए आवश्यक है। हमारी API 1M इनपुट टोकन के लिए $0.25 और 1M आउटपुट टोकन के लिए $1.00 चार्ज करती है। यह बिना सेंसर मॉडल के लिए प्रतिस्पर्धी है, लेकिन लागत जल्दी बढ़ सकती है।

अनावश्यक अतिरिक्त खाली जगह और कॉन्टेक्स्ट को हटाकर अपने प्रॉम्प्ट को अनुकूलित करें। राउंड ट्रिप्स की संख्या कम करने के लिए फ़ंक्शन कॉलिंग का उपयोग करें। बजट के भीतर रहने के लिए टोकन गणना को पूर्व-गणना करें।

हम बोनस के साथ प्रीपेड क्रेडिट प्रदान करते हैं। 5% बोनस प्राप्त करने के लिए $50 जोड़ें, या 10% बोनस के लिए $100 जोड़ें। यह प्रति टोकन आपकी प्रभावी लागत को काफी कम कर देता है।

  • प्रतिदिन टोकन उपयोग की निगरानी करें।
  • छूट के लिए प्रीपेड क्रेडिट का उपयोग करें।
  • प्रॉम्प्ट लंबाई को अनुकूलित करें।

प्रश्न और उत्तर

बिना सेंसर मॉडल के लिए कॉन्टेक्स्ट विंडो क्या है?

मॉडल 100,000 टोकन का कॉन्टेक्स्ट विंडो सपोर्ट करता है, जिसमें प्रॉम्प्ट और कंप्लीशन दोनों टोकन शामिल हैं। यह लगभग 50 पृष्ठों तक लंबी कथाओं की अनुमति देता है।

क्या आप मेरे प्रॉम्प्ट को ट्रेनिंग के लिए उपयोग करते हैं?

नहीं। आपके प्रॉम्प्ट ट्रेनिंग के लिए उपयोग नहीं किए जाते हैं। साइन अप के लिए हमें केवल एक ईमेल और पासवर्ड की आवश्यकता होती है, और आपका डेटा गोपनीय रहता है।

कौन सा कंटेंट ब्लॉक किया गया है?

हम किशोरों से संबंधित यौन सामग्री पर एक कठोर सीमा लागू करते हैं। अन्य सभी कानूनी वयस्क, काल्पनिक या विवादास्पद विषयों को बिना अस्वीकृति के अनुमति है।

मैं ट्रायल के साथ कैसे शुरू करूं?

ट्रायल क्रेडिट के लिए $0.50 प्राप्त करने के लिए एक ईमेल और पासवर्ड के साथ साइन अप करें, जो 7 दिनों के लिए मान्य है। शुरू करने के लिए क्रेडिट कार्ड की आवश्यकता नहीं है।

आपकी कुंजी बस एक फ़ॉर्म दूर है

एक खाता बनाएं, कुंजी कॉपी करें, बेस URL बदलें। सेटअप यही है।

API कुंजी पाएँ