Qwen Audio 3.0 TTS एपीआई

1,000 से अधिक आवाजों, 16 भाषाओं, 20 चीनी बोलियों, प्राकृतिक-भाषा वितरण दिशा और इनलाइन भावना टैग के साथ स्तरीय भाषण संश्लेषण।

Alibaba Cloudऑडियो जनरेशनरिलीज 20 जुल॰ 2026Singaporeस्वामित्व वाला एंडपॉइंटनया

Qwen Audio 3.0 TTS के बारे में

1,000 से अधिक आवाजों, 16 भाषाओं, 20 चीनी बोलियों, प्राकृतिक-भाषा वितरण दिशा और इनलाइन भावना टैग के साथ स्तरीय भाषण संश्लेषण।

आवाज चयन स्तरीय जागरूक है: बेस वॉयस आईडी दोनों स्तरों पर काम करते हैं और स्वचालित रूप से चयनित model_tier से मेल खाते हैं, जबकि छह सिस्टम आवाजें एक स्तर पर लॉक होती हैं। पिच प्रदान किए गए ऑडियो की गति को भी बदल देती है, इसलिए जब आप मूल अवधि को संरक्षित करना चाहते हैं तो इसे गति के साथ जोड़ें।

इस नाम से भी जाना जाता है Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS

text to speechmultilingualexpressive prosodyemotion controlvoice tagsdialectlow latency

Qwen Audio 3.0 TTS की विशेषताएं

मॉडल ID
qwen-audio-3-0-tts
निर्माता
Alibaba Cloud
श्रेणी
ऑडियो जनरेशन
रिलीज
20 जुल॰ 2026
इनपुट
टेक्स्ट
आउटपुट
ऑडियो
रीजन
Singapore
एंडपॉइंट
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
वैकल्पिक मॉडल ID
qwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash

Qwen Audio 3.0 TTS API की कीमतें

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
प्लस संश्लेषण
प्रति 10,000 वर्ण
$0.20
फ्लैश संश्लेषण
प्रति 10,000 वर्ण
$0.15
पूरे कीमत पेज पर तुलना करें

Qwen Audio 3.0 TTS API को कैसे कॉल करें

Qwen Audio 3.0 TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id qwen-audio-3-0-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3-0-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Qwen Audio 3.0 TTS API का पूरा संदर्भ

Qwen Audio 3.0 TTS API के पैरामीटर

EmpirioLabs पर Qwen Audio 3.0 TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
inputstring-अधिकतम 20000संश्लेषित करने के लिए पाठ। प्रति अनुरोध 20,000 वर्ण तक। पाठ में सीधे रखे गए इनलाइन अभिव्यक्ति टैग का समर्थन करता है, उदाहरण के लिए [उत्साहित], [हंसते हुए],...
model_tierenumplusplus, flashप्लस: उच्चतम ऑडियो गुणवत्ता और अभिव्यक्ति, सामग्री निर्माण, ऑडियोबुक, डबिंग और ब्रांड वॉयस वर्क के लिए सर्वश्रेष्ठ। फ्लैश: कम प्रथम-पैकेट विलंबता के साथ वास्तविक समय...
voiceenumloongjameszhaoloongjameszhao, loongolivialin, loonglunawang, loongnorahu, l...आवाज पूर्व निर्धारित। आधार आवाजें दोनों स्तरों पर काम करती हैं, इसलिए model_tier बदलने से आपका चयन बना रहता है। छह फ्लैगशिप आवाजें टियर लॉक हैं: प्लस पर...
voice_idstring--फ़्री-फ़ॉर्म वॉयस आईडी, जो सेट होने पर वॉयस को ओवरराइड करता है। GET /v1/voices से किसी भी आधार वॉइस को स्वीकार करता है, या तो नंगे आईडी के रूप में (अनुशंसित, दोनों...
sample_rateenum240008000, 16000, 22050, 24000, 44100, 4800024000 में आउटपुट नमूना दर स्पीच प्लेबैक के लिए उपयुक्त है, और 48000 एक बड़े फ़ाइल आकार पर प्रसारण-गुणवत्ता आउटपुट देता है।
speednumber10.5 से 2बोलने की दर गुणक। 0.5 आधी गति है और 2.0 दोहरी गति है।
pitchnumber10.5 से 2पिच गुणक। 1.0 से नीचे के मान आवाज को कम करते हैं और ऊपर के मान इसे बढ़ाते हैं। पिच प्रदान किए गए ऑडियो की गति को भी बदल देती है, इसलिए जब आप मूल अवधि रखना चाहते हैं...
volumeinteger500 से 100आउटपुट लाउडनेस, जहां 50 संदर्भ स्तर है।
instructionstring-अधिकतम 128डिलीवरी के लिए प्राकृतिक-भाषा दिशा, 128 वर्णों तक। भावना, स्वर, चरित्र, गति और बोलने की शैली को नियंत्रित करता है, उदाहरण के लिए "उत्साहित, उत्साहित स्वर में जल्दी...
language_hintsarray-zh, enभाषा कोड जो मिश्रित-भाषा पाठ के लिए उच्चारण को पूर्वाग्रह करते हैं, उदाहरण के लिए ["zh", "en"]। मॉडल को भाषा का पता लगाने देने के लिए अनसेट छोड़ दें।
seedinteger00 से 65535नमूना बीज। दोहराने योग्य रेंडर के लिए समान इनपुट और सेटिंग्स के साथ एक बीज का पुन: उपयोग करें।
bit_rateinteger3200016000 से 64000बीपीएस में एनकोडर बिटरेट। केवल ओपस प्रारूप पर लागू होता है, और एमपी 3, डब्ल्यूएवी और पीसीएम के लिए अनदेखा किया जाता है।
pronunciationobject--उच्चारण लिखित रूप द्वारा कुंजी को ओवरराइड करता है, उदाहरण के लिए {"重要": "zhong4 yao4"}। नाम, परिवर्णी शब्द और होमोग्राफ को ठीक करने के लिए इसका उपयोग करें।
replaceobject--संश्लेषण से पहले लागू शाब्दिक पाठ प्रतिस्थापन, उदाहरण के लिए {"EmpirioLabs": "Empirio Labs"}। ब्रांड नाम और संक्षिप्ताक्षरों के लिए उपयोगी।
डॉक्स में 2 और पैरामीटर

जानने योग्य

स्तर - प्लस: उच्चतम ऑडियो गुणवत्ता और अभिव्यक्ति, सामग्री निर्माण, ऑडियोबुक, डबिंग, और ब्रांड आवाज काम के लिए - फ्लैश: आवाज सहायकों और लाइव एजेंटों के लिए कम पहले पैकेट विलंबता के साथ वास्तविक समय की बातचीत के लिए ट्यून किया गया - model_tier पैरामीटर के साथ स्विच करें, या qwen-audio-3.0-tts-plus या qwen-audio-3.0-tts-flash मॉडल आईडी के रूप में भेजें आवाज - 1,000 से अधिक आधार आवाजें, सभी दोनों स्तरों पर उपलब्ध हैं, इसलिए टियर बदलने से आपकी चयनित आवाज रहती है - छह फ्लैगशिप सिस्टम आवाजें टियर विशिष्ट हैं: longanlingxin और प्लस पर longanlufeng, और फ्लैश पर longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn फ्लैश पर - GET /v1/voices के साथ पूर्ण कैटलॉग ब्राउज़ करें, और qwen-audio-3.0-tts-plus 0__ के माध्यम से किसी भी आवाज को पास करें इनपुट सीमा - प्रति अनुरोध 20,000 वर्ण तक qwen-audio-3.0-tts-plus 1__ 128 वर्णों तक स्वीकार करता है - एसएसएमएल इनपुट समर्थित नहीं है। वितरण दिशा के लिए qwen-audio-3.0-tts-plus 2__ का उपयोग करें, और पाठ के अंदर qwen-audio-3.0-tts-plus 3__ या qwen-audio-3.0-tts-plus 4__ जैसे इनलाइन टैग का उपयोग करें बिलिंग - चयनित टियर की दर पर इनपुट पाठ के प्रति वर्ण बिल किया गया

Qwen Audio 3.0 TTS API: आम सवाल

Qwen Audio 3.0 TTS API की कीमत कितनी है?

EmpirioLabs पर Qwen Audio 3.0 TTS का बिल उपयोग के अनुसार बनता है: प्लस संश्लेषण $0.20 प्रति 10,000 वर्ण; फ्लैश संश्लेषण $0.15 प्रति 10,000 वर्ण। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

Qwen Audio 3.0 TTS कौन सा endpoint उपयोग करता है?

Qwen Audio 3.0 TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में Qwen Audio 3.0 TTS आज़मा सकता हूं?

हां। EmpirioLabs playground ब्राउज़र में Qwen Audio 3.0 TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।

Qwen Audio 3.0 TTS की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।