Qwen Audio 3.0 TTS EmpirioLabs पर उपलब्ध है। यह अलीबाबा का भाषण संश्लेषण मॉडल है, और हम इसे एक टियर स्विच के साथ एकल मॉडल के रूप में भेजते हैं: साथ ही उच्चतम ऑडियो गुणवत्ता और अभिव्यक्ति के लिए, कम प्रथम-पैकेट विलंबता के साथ वास्तविक समय की बातचीत के लिए फ्लैश। दोनों स्तर समान पैरामीटर और एक ही वॉयस लाइब्रेरी साझा करते हैं, इसलिए आप एक बार एक आवाज चुनते हैं और एक फ़ील्ड के साथ टियर बदलते हैं।
Qwen Audio 3.0 TTS किस चीज़ में अच्छा है
इसमें अरबी, चीनी, अंग्रेजी, फ्रेंच, जर्मन, इंडोनेशियाई, इतालवी, जापानी, कोरियाई, मलय, पुर्तगाली, रूसी, स्पेनिश, तागालोग, थाई और वियतनामी के साथ-साथ 20 चीनी बोली क्षेत्र शामिल हैं। डिलीवरी दो तरीकों से निर्देशित है: एक सादा-अंग्रेजी शिक्षण-प्रशिक्षण जो पूरे रेंडर के लिए भावना, स्वर, चरित्र, गति और शैली सेट करता है, और इनलाइन टैग जैसे [उत्साहित], [फुसफुसाते हुए], [हस रहा], या [आहें भरते हुए] वाक्य-मध्य में अभिव्यक्ति बदलने के लिए सीधे पाठ में गिरा दिया गया।
वॉयस लाइब्रेरी ही कारण है कि टियर स्विच दर्द रहित है। 1,000 से अधिक आधार आवाजें हैं, और उनमें से हर एक एक ही आईडी के तहत दोनों स्तरों पर मौजूद है, इसलिए प्लस और फ्लैश के बीच जाने से यह नहीं बदलता है कि कौन बोल रहा है। उन के शीर्ष पर, प्रत्येक स्तर की अपनी प्रमुख सिस्टम आवाज़ों का एक छोटा सा सेट होता है।
अनुरोध करना
यह मानक OpenAI-आकार का स्पीच एंडपॉइंट है, इसलिए अधिकांश क्लाइंट को एक आधार URL परिवर्तन की आवश्यकता होती है:
कर्ल https://api.empiriolabs.ai/v1/audio/speech \ -एच "प्राधिकरण: वाहक $EMPIRIOLABS_एपीआई_की" \ -एच "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "qwen-audio-3-0-tts", "model_tier": "फ्लैश", "इनपुट": "[उत्साहित] परिणाम आ गए हैं, और वे हमारे पूर्वानुमान को हरा देते हैं![ हंसते हुए]", "आवाज": "लूंगजेम्सझाओ", "निर्देश": "उत्साहित, उत्साही स्वर में जल्दी से बोलें", "response_format": "एमपी3", "sample_rate": 24000 }'
आपको एक हस्ताक्षरित ऑडियो URL वापस मिलता है। आउटपुट MP3, WAV, हेडरलेस PCM और Opus का समर्थन करता है, 8 kHz से 48 kHz तक की नमूना दरों पर। गति, पिच, आयतन और बीज सभी उजागर होते हैं, साथ ही नामों और परिवर्णी शब्दों के लिए उच्चारण ओवरराइड, ब्रांड नामों के लिए शाब्दिक पाठ प्रतिस्थापन, और एक मार्कडाउन फ़िल्टर ताकि स्वरूपण वर्णों को जोर से न पढ़ा जाए।
पूर्ण वॉयस कैटलॉग ब्राउज़ करने के लिए, कॉल करें /v1/voices. यह भाषा, लिंग, स्तर और आवाज के नामों, लक्षणों और उपयोग के मामलों में एक मुफ़्त-पाठ खोज के आधार पर फ़िल्टरिंग का समर्थन करता है।
निर्माण से पहले जानने लायक तीन बातें
बेस आवाजें टियर-पोर्टेबल हैं, सिस्टम आवाजें नहीं हैं। कोई भी बेस वॉयस आईडी प्लस और फ्लैश दोनों पर काम करती है, इसलिए आप स्थिर रखी गई आवाज के साथ स्तरों को A/B सकते हैं। छह फ्लैगशिप सिस्टम आवाज़ें प्रत्येक एक स्तर पर बंद हैं, और यदि आप एक को गलत स्तर पर भेजते हैं तो एपीआई आपको बताता है कि कौन सा स्तर अस्पष्ट रूप से विफल होने के बजाय इसकी सेवा करता है।
SSML इस मॉडल द्वारा समर्थित नहीं है। उपयोग शिक्षण-प्रशिक्षण वैश्विक वितरण दिशा और स्थानीय अभिव्यक्ति परिवर्तनों के लिए इनलाइन टैग के लिए। यह संयोजन उन अधिकांश को कवर करता है जो लोग SSML के लिए करने के लिए पहुंचते हैं, और इसे लिखना आसान है।
पिच से गति भी बदलती है। पिच को कम करने से क्लिप फैलती है और इसे ऊपर उठाने से क्लिप संपीड़ित हो जाती है, इसलिए यदि आप मूल अवधि में एक अलग पिच चाहते हैं, तो समायोजित करें रफ़्तार क्षतिपूर्ति करने के लिए।
मूल्य निर्धारण और आरंभ करना
बिलिंग इनपुट टेक्स्ट के प्रति वर्ण है, जिस भी स्तर पर आपने चुना है, और यह pay-as-you-go है। फ्लैश दोनों में से सस्ता है। दोनों स्तरों के लिए वर्तमान दरें हैं क्वेन ऑडियो 3.0 टीटीएस मॉडल पेज और पर मूल्य निर्धारण पृष्ठ।.
आप इसमें कोई कोड लिखे बिना इसे आज़मा सकते हैं खेल का मैदान, जहां टियर स्विच, वॉयस पिकर और हर पैरामीटर लाइव नियंत्रण हैं। पूर्ण पैरामीटर संदर्भ में है एपीआई दस्तावेज़ीकरण।.



