
रीयलटाइम वॉयस मॉडल जो सादा-अंग्रेजी डिलीवरी दिशा लेता है, 200+ भाषाओं में एक आवाज की पहचान रखता है, और शब्द टाइमस्टैम्प के साथ स्ट्रीम करता है।
रीयलटाइम वॉयस मॉडल जो सादा-अंग्रेजी डिलीवरी दिशा लेता है, 200+ भाषाओं में एक आवाज की पहचान रखता है, और शब्द टाइमस्टैम्प के साथ स्ट्रीम करता है।
इस नाम से भी जाना जाता है Inworld TTS 2
tts-2/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
TTS 2 POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id tts-2 के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर TTS 2 API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | अधिकतम 2000 | संश्लेषित करने के लिए पाठ. प्रति अनुरोध अधिकतम 2,000 वर्ण; क्लाइंट पर वाक्य सीमाओं पर चंक लंबी प्रतिलिपि. वैकल्पिक रूप से सादे अंग्रेजी में ब्रैकेट की गई डिलीवरी... |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | आवाज पूर्व निर्धारित। अंग्रेजी, स्पेनिश, पुर्तगाली, हिंदी और विभिन्न लहजे को कवर करने वाली 20 हाथ से चुनी गई आवाज़ें। पूर्ण वॉयस कैटलॉग (क्लोन की गई आवाज़ों सहित) के... |
| voice_id | string | - | - | फ़्री-फ़ॉर्म वॉयस ID. सेट होने पर वॉयस को ओवरराइड करता है. क्लोन और क्षेत्रीय आवाज़ों सहित क्यूरेटेड 20-प्रीसेट सूची से परे किसी भी आवाज़ को संबोधित करने के लिए इसका... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47 भाषा कोड। यह मॉडल 200+ भाषाओं और स्थानों में एक आवाज की पहचान रखता है, इसलिए आप यहां किसी भी समर्थित कोड को पास कर सकते हैं, भले ही वह ड्रॉपडाउन में न हो। |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | ऑडियो container/codec। WAV = RIFF के अंदर LINEAR16 (सर्वव्यापी)। एमपी3/ओजीजी = संकुचित। पीसीएम = हेडरलेस कच्चा, चंक रीयल-टाइम प्लेबैक के लिए उपयोगी। FLAC = दोषरहित। |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | 24000 में आउटपुट नमूना दर इनवर्ल्ड का डिफ़ॉल्ट है और उनके वॉयस मॉडल किस पर प्रशिक्षित होते हैं; प्रसारण गुणवत्ता के लिए 48000 तक बढ़ाएं। |
| speed | number | 1 | 0.5 से 1.5 | बोलने की दर गुणक। 0.5 = आधी गति, 1.5 = 50% तेज। |
| temperature | number | 1 | 0.1 से 2 | आवाज की अभिव्यक्ति/परिवर्तनशीलता। निचला = अधिक सुसंगत/"फ्लैट"; उच्च = अधिक अभिव्यंजक लेकिन रेंडर के बीच अधिक भिन्नता। |
| bit_rate | number | 128000 | 32000 से 320000 | एमपी 3 / OGG_OPUS के लिए बीपीएस में बिटरेट। अन्य एन्कोडिंग के लिए अनदेखा किया गया। |
| apply_text_normalization | enum | ON | ON, OFF | चालू होने पर, इनवर्ल्ड संख्याओं/संक्षिप्ताक्षरों/तिथियों को बोले जाने वाले रूप में विस्तारित करता है ("यूएसडी 5" → "पांच अमेरिकी डॉलर")। |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | यदि गैर-कोई नहीं है, तो प्रतिक्रिया में timestamp_info में प्रति-शब्द या प्रति-वर्ण टाइमस्टैम्प शामिल हैं। यूआई को कैप्शन/हाइलाइट करने के लिए उपयोगी। |
सीमाएं - अधिकतम इनपुट: प्रति अनुरोध 2,000 वर्ण (वाक्य सीमाओं पर लंबे पाठ का खंड) - वेबसॉकेट: 20 समवर्ती कनेक्शन, 5 contexts/connection - प्रति-डब्ल्यूएस संदेश: 1,000 वर्ण आवाज दिशा - डिलीवरी को चलाने के लिए सादे अंग्रेजी में ब्रैकेट किए गए निर्देश के साथ पाठ खोलें, उदाहरण के लिए [whispering], [excited], या [Speak warmly, like you are greeting an old friend] - ब्रैकेट किए गए पाठ को दिशा के रूप में माना जाता है और इसे जोर से नहीं पढ़ा जाता है - दिशा पाठ बिल किए गए वर्ण कुल की ओर गिना जाता है, इसलिए इसे छोटा रखें विलंबता - p90 TTFB: 100 एमएस से कम (इनवर्ल्ड बेंचमार्क) आवाज़ें - 200+ भाषाओं और स्थानों में आयोजित एक आवाज पहचान, जिसमें मध्य-पीढ़ी में भाषा स्विचिंग शामिल है - ड्रॉपडाउन में क्यूरेटेड प्रीसेट; voice_id के माध्यम से किसी भी अन्य वॉयस आईडी पास करें
EmpirioLabs पर TTS 2 का बिल उपयोग के अनुसार बनता है। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
TTS 2 api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में TTS 2 को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।