घर ब्लॉग

Qwen Audio 3.0 TTS API का उपयोग कैसे करें

Qwen Audio 3.0 TTS by API on EmpirioLabs

Jul 23, 2026

EmpirioLabs AI

Qwen Audio 3.0 TTS EmpirioLabs पर उपलब्ध है। यह अलीबाबा का भाषण संश्लेषण मॉडल है, और हम इसे एक टियर स्विच के साथ एक एकल मॉडल के रूप में जहाज करते हैं: साथ ही उच्चतम ऑडियो गुणवत्ता और अभिव्यक्ति के लिए, निचले प्रथम पैकेट विलंबता के साथ वास्तविक समय की बातचीत के लिए फ्लैश। दोनों स्तरों में समान पैरामीटर और समान वॉयस लाइब्रेरी साझा होती है, इसलिए आप एक बार आवाज उठाते हैं और एक क्षेत्र के साथ टियर्स को बदल देते हैं।

क्या Qwen ऑडियो 3.0 टीटीएस पर अच्छा है?

इसमें अरबी, चीनी, अंग्रेजी, फ्रेंच, जर्मन, इंडोनेशियाई, इतालवी, जापानी, कोरियाई, मलय, पुर्तगाली, रूसी, स्पेनिश, टैगलॉग, थाई और वियतनामी सहित 16 भाषाओं को शामिल किया गया है, साथ ही 20 चीनी बोली क्षेत्र भी शामिल हैं। डिलिवरी दो तरीके निर्देशित है: एक सादे अंग्रेजी अनुदेश कि सेट भावनाओं, स्वर, चरित्र, गति, और पूरे प्रतिपादन के लिए शैली, और इनलाइन टैग जैसे कि [excited], [whispers], [laughing], या [sighing] अभिव्यक्ति मध्य वाक्य को बदलने के लिए सीधे पाठ में गिरा दिया गया।

आवाज पुस्तकालय कारण टीयर स्विच दर्द रहित है। 1,000 से अधिक बेस आवाज़ें हैं, और उनमें से प्रत्येक एक समान आईडी के तहत दोनों स्तरों पर मौजूद है, इसलिए प्लस और फ्लैश के बीच आगे बढ़ना वह नहीं है जो बोल रहा है। उन लोगों के शीर्ष पर, प्रत्येक टियर के पास फ्लैगशिप सिस्टम वॉयस का एक छोटा सेट होता है।

अनुरोध करना

यह मानक OpenAI के आकार का भाषण समापन बिंदु है, इसलिए अधिकांश ग्राहकों को एक आधार URL परिवर्तन की आवश्यकता होती है:

कर्ल https://api.empiriolabs.ai/v1/audio/speech परिणाम हैं, और वे हमारे पूर्वानुमान को हराया!

आपको एक हस्ताक्षरित ऑडियो URL वापस मिलता है। आउटपुट MP3, WAV, हेडरलेस PCM और Opus, 8 kHz से 48 kHz तक नमूना दरों पर समर्थन करता है। स्पीड, पिच, वॉल्यूम, और बीज सभी उजागर होते हैं, साथ ही नामों और संक्षिप्तनामों के लिए उच्चारण ओवरराइड्स, ब्रांड नामों के लिए शाब्दिक पाठ प्रतिस्थापन, और एक मार्कडाउन फ़िल्टर इसलिए प्रारूपण वर्ण जोर नहीं पढ़े जाते हैं।

पूर्ण आवाज सूची ब्राउज़ करने के लिए, कॉल करें E-Mail साइटमैपयह भाषा, लैंगिक, टियर और वॉयस नामों, लक्षणों और उपयोग के मामलों में एक मुफ्त टेक्स्ट खोज द्वारा फ़िल्टरिंग का समर्थन करता है।

आपके निर्माण से पहले जानने लायक तीन चीजें

बेस वॉयस टियर-पोर्टेबल हैं, सिस्टम वॉयस नहीं हैं। किसी भी बेस वॉयस आईडी प्लस और फ्लैश दोनों पर काम करता है, इसलिए आप सकते हैं A/B छह फ्लैगशिप सिस्टम वॉयस को प्रत्येक स्तर पर एक स्तर पर लॉक किया जाता है, और यदि आप किसी को गलत टियर में भेजते हैं तो एपीआई आपको बताती है कि कौन सा टियर इसे अस्पष्ट रूप से विफल होने के बजाय काम करता है।

एसएसएमएल इस मॉडल द्वारा समर्थित नहीं है। उपयोग अनुदेश स्थानीय अभिव्यक्ति परिवर्तन के लिए वैश्विक वितरण दिशा और इनलाइन टैग के लिए। उस संयोजन में अधिकांश लोग एसएसएमएल तक पहुंचते हैं, और यह लेखक के लिए आसान है।

पिच भी गति बदलता है। पिच को कम करने से क्लिप को बढ़ाया जा सकता है और इसे क्लिप को संपीड़ित करता है, इसलिए यदि आप मूल अवधि में एक अलग पिच चाहते हैं, तो समायोजित करें गति क्षतिपूर्ति करना

मूल्य निर्धारण और आरंभ करना

बिलिंग इनपुट टेक्स्ट के प्रति चरित्र है, जिस पर आप जिस भी स्तर का चयन करते हैं, और यह pay-as-you-go है। फ्लैश दोनों में से सस्ता है। दोनों स्तरों के लिए वर्तमान दरों पर हैं Qwen Audio 3.0 TTS मॉडल पृष्ठ और मूल्य निर्धारण पृष्ठ।.

आप इसे बिना किसी कोड में लिख सकते हैं खेल का मैदान, जहां टियर स्विच, आवाज पिकर, और हर पैरामीटर लाइव कंट्रोल हैं। पूर्ण पैरामीटर संदर्भ में है एपीआई दस्तावेज़ीकरण।.

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मॉडलों का अन्वेषण करें, या व्यावसायिक पूछताछ, कस्टम परिनियोजन, या किसी भी अन्य चीज़ के बारे में हमसे संपर्क करें।