
विलंबता-पहला रीयलटाइम वॉयस सिंथेसिस 200+ भाषाओं में एक आवाज की पहचान रखता है, जिसे उच्च-मात्रा स्ट्रीमिंग वर्कलोड के लिए ट्यून किया गया है।
विलंबता-पहला रीयलटाइम वॉयस सिंथेसिस 200+ भाषाओं में एक आवाज की पहचान रखता है, जिसे उच्च-मात्रा स्ट्रीमिंग वर्कलोड के लिए ट्यून किया गया है।
इस नाम से भी जाना जाता है Inworld TTS 2 Flash
tts-2-flash/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2-flashEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
TTS 2 Flash POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id tts-2-flash के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2-flash",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2-flash", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर TTS 2 Flash API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | अधिकतम 2000 | संश्लेषित करने के लिए पाठ। प्रति अनुरोध अधिकतम 2,000 वर्ण; क्लाइंट पर वाक्य सीमाओं पर चंक लंबी प्रतिलिपि। यह मॉडल ब्रैकेटेड डिलीवरी दिशा लागू नहीं करता है; जब आपको... |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | आवाज पूर्व निर्धारित। अंग्रेजी, स्पेनिश, पुर्तगाली, हिंदी और विभिन्न लहजे को कवर करने वाली 20 हाथ से चुनी गई आवाज़ें। पूर्ण वॉयस कैटलॉग (क्लोन की गई आवाज़ों सहित) के... |
| voice_id | string | - | - | फ़्री-फ़ॉर्म वॉयस ID. सेट होने पर वॉयस को ओवरराइड करता है. क्लोन और क्षेत्रीय आवाज़ों सहित क्यूरेटेड 20-प्रीसेट सूची से परे किसी भी आवाज़ को संबोधित करने के लिए इसका... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | BCP-47 भाषा कोड। यह मॉडल 200+ भाषाओं और स्थानों में एक आवाज की पहचान रखता है, इसलिए आप यहां किसी भी समर्थित कोड को पास कर सकते हैं, भले ही वह ड्रॉपडाउन में न हो। |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | ऑडियो container/codec। WAV = RIFF के अंदर LINEAR16 (सर्वव्यापी)। एमपी3/ओजीजी = संकुचित। पीसीएम = हेडरलेस कच्चा, चंक रीयल-टाइम प्लेबैक के लिए उपयोगी। FLAC = दोषरहित। |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | 24000 में आउटपुट नमूना दर इनवर्ल्ड का डिफ़ॉल्ट है और उनके वॉयस मॉडल किस पर प्रशिक्षित होते हैं; प्रसारण गुणवत्ता के लिए 48000 तक बढ़ाएं। |
| speed | number | 1 | 0.5 से 1.5 | बोलने की दर गुणक। 0.5 = आधी गति, 1.5 = 50% तेज। |
| temperature | number | 1 | 0.1 से 2 | आवाज की अभिव्यक्ति/परिवर्तनशीलता। निचला = अधिक सुसंगत/"फ्लैट"; उच्च = अधिक अभिव्यंजक लेकिन रेंडर के बीच अधिक भिन्नता। |
| bit_rate | number | 128000 | 32000 से 320000 | एमपी 3 / OGG_OPUS के लिए बीपीएस में बिटरेट। अन्य एन्कोडिंग के लिए अनदेखा किया गया। |
| apply_text_normalization | enum | ON | ON, OFF | चालू होने पर, इनवर्ल्ड संख्याओं/संक्षिप्ताक्षरों/तिथियों को बोले जाने वाले रूप में विस्तारित करता है ("यूएसडी 5" → "पांच अमेरिकी डॉलर")। |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | यदि गैर-कोई नहीं है, तो प्रतिक्रिया में timestamp_info में प्रति-शब्द या प्रति-वर्ण टाइमस्टैम्प शामिल हैं। यूआई को कैप्शन/हाइलाइट करने के लिए उपयोगी। |
सीमाएं - अधिकतम इनपुट: प्रति अनुरोध 2,000 वर्ण (वाक्य सीमाओं पर लंबे पाठ का खंड) - वेबसॉकेट: 20 समवर्ती कनेक्शन, 5 contexts/connection - प्रति-डब्ल्यूएस संदेश: 1,000 वर्ण आवाज दिशा - यह मॉडल ब्रैकेट सादे-अंग्रेजी वितरण दिशा लागू नहीं करता है। जब आपको इसकी आवश्यकता हो तो टीटीएस 2 का उपयोग करें, या speed और temperature नियंत्रणों के साथ यहां वितरण को आकार दें। विलंबता - p90 TTFB: 25 एमएस (इनवर्ल्ड बेंचमार्क) आवाज़ें - 200+ भाषाओं और स्थानों में आयोजित एक आवाज पहचान, जिसमें भाषा मध्य-पीढ़ी को बदलना शामिल है - ड्रॉपडाउन में क्यूरेटेड प्रीसेट; voice_id के माध्यम से किसी भी अन्य वॉयस आईडी को पास करें
EmpirioLabs पर TTS 2 Flash का बिल उपयोग के अनुसार बनता है। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
TTS 2 Flash api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में TTS 2 Flash को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।