टीटीएस 2 फ्लैश EmpirioLabs पर उपलब्ध है। इनवर्ल्ड ने रीयलटाइम टीटीएस-2 परिवार को सामान्य उपलब्धता के लिए भेज दिया, और फ्लैश इसका विलंबता-पहला सदस्य है। यह 200+ भाषाओं और स्थानों में एक एकल आवाज पहचान रखता है, संश्लेषण के रूप में ऑडियो स्ट्रीम करता है, और प्रति-शब्द या प्रति-वर्ण टाइमस्टैम्प वापस कर सकता है। रीयलटाइम टीटीएस-2, एक ही परिवार में गुणवत्ता-प्रथम मॉडल, इसके साथ प्लेटफॉर्म पर लाइव है।
टीटीएस 2 फ्लैश क्या समर्थन करता है
फ्लैश टेक्स्ट लेता है और ऑडियो लौटाता है। यह एक आवाज पहचान के साथ 200+ भाषाओं और स्थानों को कवर करता है, इसलिए जब आप भाषा स्विच करते हैं तो वही वॉयस आईडी अपने चरित्र को बनाए रखती है, जिसमें एक पीढ़ी के माध्यम से आंशिक रूप से स्विच करना भी शामिल है। आउटपुट 8 kHz से 48 kHz तक नमूना दरों पर MP3, WAV, OGG, FLAC, PCM, A-law, या mu-law के रूप में वापस आता है।
वॉयस ड्रॉपडाउन 20 हाथ से चुने गए प्रीसेट को उजागर करता है। यह एक सुविधा सूची है, कैटलॉग नहीं: क्षेत्रीय और क्लोन की गई आवाज़ों सहित किसी भी अन्य वॉयस आईडी को पास करें voice_id, और जो उपलब्ध है उसकी गणना करने के लिए आवाज़ों के समापन बिंदु को कॉल करें।
टीटीएस 2 फ्लैश को कैसे कॉल करें
OpenAI-संगत स्पीच एंडपॉइंट का उपयोग करें और सेट करें मॉडल सेवा मेरे tts-2-flash:
कर्ल https://api.empiriolabs.ai/v1/audio/speech \ -एच 'प्राधिकरण: वाहक $EMPIRIOLABS_एपीआई_की' \ -एच 'सामग्री-प्रकार: application/json' \ -d '{ "मॉडल": "tts-2-flash", "इनपुट": "हैलो, और कॉल करने के लिए धन्यवाद। मैं आज आपकी मदद कैसे कर सकता हूं?", "आवाज": "एशले", "भाषा": "एन-यूएस", "output_format": "एमपी3" }'
प्रतिक्रिया में जनरेट किए गए ऑडियो के लिए एक हस्ताक्षरित URL और बिल किए गए वर्ण गणना के साथ एक उपयोग ब्लॉक होता है. बिलिंग इनपुट के प्रति वर्ण है, इसलिए लागत आपके द्वारा भेजे गए पाठ को ट्रैक करती है, न कि वापस आने वाले ऑडियो की लंबाई के.
स्ट्रीमिंग
वॉयस एजेंटों और किसी भी चीज़ के लिए जो ऑडियो चलाती है, जबकि यह अभी भी तैयार किया जा रहा है, उसी समापन बिंदु के स्ट्रीमिंग संस्करण पर पोस्ट करें। यह सर्वर-भेजे गए ईवेंट लौटाता है: ऑडियो.चंक Base64 ऑडियो ले जाने वाली घटनाएं क्योंकि यह संश्लेषित है, वैकल्पिक ऑडियो.टाइमस्टैम्प घटनाएँ जब आपने शब्द या वर्ण समय और अंतिम के लिए कहा ऑडियो.डन रीप्ले URL और उपयोग ब्लॉक के साथ ईवेंट. सेट करें timestamp_type सेवा मेरे शब्द या चरित्र जब आप कैप्शन या हाइलाइट यूआई चला रहे हों।
टीटीएस 2 और टीटीएस 2 फ्लैश के बीच चयन करना
दोनों मॉडल समान अनुरोध आकार, समान आवाज़ें और समान भाषा कवरेज साझा करते हैं, इसलिए स्विच करना एक-शब्द परिवर्तन है मॉडल. जब आप चुनते हैं तो जो अंतर मायने रखता है वह है डिलीवरी नियंत्रण।
रीयलटाइम टीटीएस -2 सादे-अंग्रेजी आवाज दिशा स्वीकार करता है: ब्रैकेट किए गए निर्देश के साथ पाठ खोलें और मॉडल निर्देश को जोर से पढ़ने के बजाय इस तरह से लाइन करता है। यह छोटे निर्देशों और फ्री-फॉर्म ब्रीफ दोनों को समझता है।
{ "मॉडल": "टीटीएस -2", "इनपुट": "[गर्मजोशी से बोलें, जैसे आप एक पुराने दोस्त का अभिवादन कर रहे हैं] सुप्रभात, आपको फिर से देखकर अच्छा लगा। ", "आवाज": "एशले" }
टीटीएस 2 फ्लैश उस दिशा को लागू नहीं करता है। फ्लैश को एक ही ब्रैकेट टेक्स्ट भेजें और इसे अनदेखा कर दिया जाता है, इसलिए जब प्रदर्शन मायने रखता है तो टीटीएस 2 तक पहुंचें और फ्लैश के लिए जब विलंबता और वॉल्यूम मायने रखता है। फ्लैश पर, आकार वितरण के साथ रफ़्तार तथा तापमान इसके बजाय नियंत्रण।
आपकी पहली कॉल से पहले जानने लायक नोट्स
- आवाज की दिशा केवल टीटीएस 2 है। फ्लैश चुपचाप एक ब्रैकेट किए गए निर्देश को अस्वीकार करने के बजाय अनदेखा करता है, इसलिए टीटीएस 2 के लिए लिखा गया एक संकेत फ्लैश पर चलेगा और बस अप्रत्यक्ष रूप से वापस आ जाएगा।
- दिशा पाठ को बिल किया जाता है। ब्रैकेट किए गए निर्देश अनुरोध के लिए कुल वर्ण की ओर गिना जाता है, भले ही यह कभी नहीं बोला जाता है, इसलिए संक्षिप्त विवरण को छोटा रखें।
- प्रति-अनुरोध सीमा 2,000 वर्ण है। क्लाइंट पर वाक्य सीमाओं पर लंबे समय तक कॉपी करें और एक लंबा ब्लॉक भेजने के बजाय ऑडियो को संयोजित करें।
- पाठ सामान्यीकरण डिफ़ॉल्ट रूप से चालू है। संख्याओं, तिथियों और संक्षिप्ताक्षरों को बोले जाने वाले रूप में विस्तारित किया जाता है, जिसका अर्थ यह भी है कि बिल किए गए वर्ण संख्या आपके द्वारा भेजी गई स्ट्रिंग की लंबाई से अधिक हो सकती है। यदि आपने पहले ही पाठ को स्वयं सामान्य कर दिया है, तो इसे बंद कर दें।
शुरू हो जाओ
टीटीएस 2 फ्लैश में प्रयास करें खेल का मैदानपढ़ना एपीआई संदर्भ, या वर्तमान दरों को देखें मॉडल पेज।.



