
1,000 से अधिक आवाजों, 16 भाषाओं, 20 चीनी बोलियों, प्राकृतिक-भाषा वितरण दिशा और इनलाइन भावना टैग के साथ स्तरीय भाषण संश्लेषण।
1,000 से अधिक आवाजों, 16 भाषाओं, 20 चीनी बोलियों, प्राकृतिक-भाषा वितरण दिशा और इनलाइन भावना टैग के साथ स्तरीय भाषण संश्लेषण।
आवाज चयन स्तरीय जागरूक है: बेस वॉयस आईडी दोनों स्तरों पर काम करते हैं और स्वचालित रूप से चयनित model_tier से मेल खाते हैं, जबकि छह सिस्टम आवाजें एक स्तर पर लॉक होती हैं। पिच प्रदान किए गए ऑडियो की गति को भी बदल देती है, इसलिए जब आप मूल अवधि को संरक्षित करना चाहते हैं तो इसे गति के साथ जोड़ें।
इस नाम से भी जाना जाता है Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS
qwen-audio-3-0-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesqwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flashEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Qwen Audio 3.0 TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id qwen-audio-3-0-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-0-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर Qwen Audio 3.0 TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | अधिकतम 20000 | संश्लेषित करने के लिए पाठ। प्रति अनुरोध 20,000 वर्ण तक। पाठ में सीधे रखे गए इनलाइन अभिव्यक्ति टैग का समर्थन करता है, उदाहरण के लिए [उत्साहित], [हंसते हुए],... |
| model_tier | enum | plus | plus, flash | प्लस: उच्चतम ऑडियो गुणवत्ता और अभिव्यक्ति, सामग्री निर्माण, ऑडियोबुक, डबिंग और ब्रांड वॉयस वर्क के लिए सर्वश्रेष्ठ। फ्लैश: कम प्रथम-पैकेट विलंबता के साथ वास्तविक समय... |
| voice | enum | loongjameszhao | loongjameszhao, loongolivialin, loonglunawang, loongnorahu, l... | आवाज पूर्व निर्धारित। आधार आवाजें दोनों स्तरों पर काम करती हैं, इसलिए model_tier बदलने से आपका चयन बना रहता है। छह फ्लैगशिप आवाजें टियर लॉक हैं: प्लस पर... |
| voice_id | string | - | - | फ़्री-फ़ॉर्म वॉयस आईडी, जो सेट होने पर वॉयस को ओवरराइड करता है। GET /v1/voices से किसी भी आधार वॉइस को स्वीकार करता है, या तो नंगे आईडी के रूप में (अनुशंसित, दोनों... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 24000 में आउटपुट नमूना दर स्पीच प्लेबैक के लिए उपयुक्त है, और 48000 एक बड़े फ़ाइल आकार पर प्रसारण-गुणवत्ता आउटपुट देता है। |
| speed | number | 1 | 0.5 से 2 | बोलने की दर गुणक। 0.5 आधी गति है और 2.0 दोहरी गति है। |
| pitch | number | 1 | 0.5 से 2 | पिच गुणक। 1.0 से नीचे के मान आवाज को कम करते हैं और ऊपर के मान इसे बढ़ाते हैं। पिच प्रदान किए गए ऑडियो की गति को भी बदल देती है, इसलिए जब आप मूल अवधि रखना चाहते हैं... |
| volume | integer | 50 | 0 से 100 | आउटपुट लाउडनेस, जहां 50 संदर्भ स्तर है। |
| instruction | string | - | अधिकतम 128 | डिलीवरी के लिए प्राकृतिक-भाषा दिशा, 128 वर्णों तक। भावना, स्वर, चरित्र, गति और बोलने की शैली को नियंत्रित करता है, उदाहरण के लिए "उत्साहित, उत्साहित स्वर में जल्दी... |
| language_hints | array | - | zh, en | भाषा कोड जो मिश्रित-भाषा पाठ के लिए उच्चारण को पूर्वाग्रह करते हैं, उदाहरण के लिए ["zh", "en"]। मॉडल को भाषा का पता लगाने देने के लिए अनसेट छोड़ दें। |
| seed | integer | 0 | 0 से 65535 | नमूना बीज। दोहराने योग्य रेंडर के लिए समान इनपुट और सेटिंग्स के साथ एक बीज का पुन: उपयोग करें। |
| bit_rate | integer | 32000 | 16000 से 64000 | बीपीएस में एनकोडर बिटरेट। केवल ओपस प्रारूप पर लागू होता है, और एमपी 3, डब्ल्यूएवी और पीसीएम के लिए अनदेखा किया जाता है। |
| pronunciation | object | - | - | उच्चारण लिखित रूप द्वारा कुंजी को ओवरराइड करता है, उदाहरण के लिए {"重要": "zhong4 yao4"}। नाम, परिवर्णी शब्द और होमोग्राफ को ठीक करने के लिए इसका उपयोग करें। |
| replace | object | - | - | संश्लेषण से पहले लागू शाब्दिक पाठ प्रतिस्थापन, उदाहरण के लिए {"EmpirioLabs": "Empirio Labs"}। ब्रांड नाम और संक्षिप्ताक्षरों के लिए उपयोगी। |
स्तर - प्लस: उच्चतम ऑडियो गुणवत्ता और अभिव्यक्ति, सामग्री निर्माण, ऑडियोबुक, डबिंग, और ब्रांड आवाज काम के लिए - फ्लैश: आवाज सहायकों और लाइव एजेंटों के लिए कम पहले पैकेट विलंबता के साथ वास्तविक समय की बातचीत के लिए ट्यून किया गया - model_tier पैरामीटर के साथ स्विच करें, या qwen-audio-3.0-tts-plus या qwen-audio-3.0-tts-flash मॉडल आईडी के रूप में भेजें आवाज - 1,000 से अधिक आधार आवाजें, सभी दोनों स्तरों पर उपलब्ध हैं, इसलिए टियर बदलने से आपकी चयनित आवाज रहती है - छह फ्लैगशिप सिस्टम आवाजें टियर विशिष्ट हैं: longanlingxin और प्लस पर longanlufeng, और फ्लैश पर longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn फ्लैश पर - GET /v1/voices के साथ पूर्ण कैटलॉग ब्राउज़ करें, और qwen-audio-3.0-tts-plus 0__ के माध्यम से किसी भी आवाज को पास करें इनपुट सीमा - प्रति अनुरोध 20,000 वर्ण तक qwen-audio-3.0-tts-plus 1__ 128 वर्णों तक स्वीकार करता है - एसएसएमएल इनपुट समर्थित नहीं है। वितरण दिशा के लिए qwen-audio-3.0-tts-plus 2__ का उपयोग करें, और पाठ के अंदर qwen-audio-3.0-tts-plus 3__ या qwen-audio-3.0-tts-plus 4__ जैसे इनलाइन टैग का उपयोग करें बिलिंग - चयनित टियर की दर पर इनपुट पाठ के प्रति वर्ण बिल किया गया
EmpirioLabs पर Qwen Audio 3.0 TTS का बिल उपयोग के अनुसार बनता है: प्लस संश्लेषण $0.20 प्रति 10,000 वर्ण; फ्लैश संश्लेषण $0.15 प्रति 10,000 वर्ण। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Qwen Audio 3.0 TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में Qwen Audio 3.0 TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।