TTS 2 एपीआई

रीयलटाइम वॉयस मॉडल जो सादा-अंग्रेजी डिलीवरी दिशा लेता है, 200+ भाषाओं में एक आवाज की पहचान रखता है, और शब्द टाइमस्टैम्प के साथ स्ट्रीम करता है।

Inworldऑडियो जनरेशनरिलीज 5 मई 2026स्वामित्व वाला एंडपॉइंट

TTS 2 के बारे में

रीयलटाइम वॉयस मॉडल जो सादा-अंग्रेजी डिलीवरी दिशा लेता है, 200+ भाषाओं में एक आवाज की पहचान रखता है, और शब्द टाइमस्टैम्प के साथ स्ट्रीम करता है।

इस नाम से भी जाना जाता है Inworld TTS 2

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingualexpressive prosodyvoice direction

TTS 2 की विशेषताएं

मॉडल ID
tts-2
प्रदाता
Inworld
श्रेणी
ऑडियो जनरेशन
रिलीज
5 मई 2026
इनपुट
टेक्स्ट
आउटपुट
ऑडियो
एंडपॉइंट
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
वैकल्पिक मॉडल ID
inworld-tts-2

TTS 2 API की कीमतें12% तक बचाएं

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
संश्लेषण
प्रति 1M वर्ण
$25.00$22.00
पूरे कीमत पेज पर तुलना करें

TTS 2 API को कैसे कॉल करें

TTS 2 POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id tts-2 के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
TTS 2 API का पूरा संदर्भ

TTS 2 API के पैरामीटर

EmpirioLabs पर TTS 2 API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
inputstring-अधिकतम 2000संश्लेषित करने के लिए पाठ. प्रति अनुरोध अधिकतम 2,000 वर्ण; क्लाइंट पर वाक्य सीमाओं पर चंक लंबी प्रतिलिपि. वैकल्पिक रूप से सादे अंग्रेजी में ब्रैकेट की गई डिलीवरी...
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...आवाज पूर्व निर्धारित। अंग्रेजी, स्पेनिश, पुर्तगाली, हिंदी और विभिन्न लहजे को कवर करने वाली 20 हाथ से चुनी गई आवाज़ें। पूर्ण वॉयस कैटलॉग (क्लोन की गई आवाज़ों सहित) के...
voice_idstring--फ़्री-फ़ॉर्म वॉयस ID. सेट होने पर वॉयस को ओवरराइड करता है. क्लोन और क्षेत्रीय आवाज़ों सहित क्यूरेटेड 20-प्रीसेट सूची से परे किसी भी आवाज़ को संबोधित करने के लिए इसका...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...BCP-47 भाषा कोड। यह मॉडल 200+ भाषाओं और स्थानों में एक आवाज की पहचान रखता है, इसलिए आप यहां किसी भी समर्थित कोड को पास कर सकते हैं, भले ही वह ड्रॉपडाउन में न हो।
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWऑडियो container/codec। WAV = RIFF के अंदर LINEAR16 (सर्वव्यापी)। एमपी3/ओजीजी = संकुचित। पीसीएम = हेडरलेस कच्चा, चंक रीयल-टाइम प्लेबैक के लिए उपयोगी। FLAC = दोषरहित।
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 4800024000 में आउटपुट नमूना दर इनवर्ल्ड का डिफ़ॉल्ट है और उनके वॉयस मॉडल किस पर प्रशिक्षित होते हैं; प्रसारण गुणवत्ता के लिए 48000 तक बढ़ाएं।
speednumber10.5 से 1.5बोलने की दर गुणक। 0.5 = आधी गति, 1.5 = 50% तेज।
temperaturenumber10.1 से 2आवाज की अभिव्यक्ति/परिवर्तनशीलता। निचला = अधिक सुसंगत/"फ्लैट"; उच्च = अधिक अभिव्यंजक लेकिन रेंडर के बीच अधिक भिन्नता।
bit_ratenumber12800032000 से 320000एमपी 3 / OGG_OPUS के लिए बीपीएस में बिटरेट। अन्य एन्कोडिंग के लिए अनदेखा किया गया।
apply_text_normalizationenumONON, OFFचालू होने पर, इनवर्ल्ड संख्याओं/संक्षिप्ताक्षरों/तिथियों को बोले जाने वाले रूप में विस्तारित करता है ("यूएसडी 5" → "पांच अमेरिकी डॉलर")।
timestamp_typeenumNONENONE, WORD, CHARACTERयदि गैर-कोई नहीं है, तो प्रतिक्रिया में timestamp_info में प्रति-शब्द या प्रति-वर्ण टाइमस्टैम्प शामिल हैं। यूआई को कैप्शन/हाइलाइट करने के लिए उपयोगी।

जानने योग्य

सीमाएं - अधिकतम इनपुट: प्रति अनुरोध 2,000 वर्ण (वाक्य सीमाओं पर लंबे पाठ का खंड) - वेबसॉकेट: 20 समवर्ती कनेक्शन, 5 contexts/connection - प्रति-डब्ल्यूएस संदेश: 1,000 वर्ण आवाज दिशा - डिलीवरी को चलाने के लिए सादे अंग्रेजी में ब्रैकेट किए गए निर्देश के साथ पाठ खोलें, उदाहरण के लिए [whispering], [excited], या [Speak warmly, like you are greeting an old friend] - ब्रैकेट किए गए पाठ को दिशा के रूप में माना जाता है और इसे जोर से नहीं पढ़ा जाता है - दिशा पाठ बिल किए गए वर्ण कुल की ओर गिना जाता है, इसलिए इसे छोटा रखें विलंबता - p90 TTFB: 100 एमएस से कम (इनवर्ल्ड बेंचमार्क) आवाज़ें - 200+ भाषाओं और स्थानों में आयोजित एक आवाज पहचान, जिसमें मध्य-पीढ़ी में भाषा स्विचिंग शामिल है - ड्रॉपडाउन में क्यूरेटेड प्रीसेट; voice_id के माध्यम से किसी भी अन्य वॉयस आईडी पास करें

TTS 2 API: आम सवाल

TTS 2 API की कीमत कितनी है?

EmpirioLabs पर TTS 2 का बिल उपयोग के अनुसार बनता है। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

TTS 2 कौन सा endpoint उपयोग करता है?

TTS 2 api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में TTS 2 आज़मा सकता हूं?

हां। EmpirioLabs playground ब्राउज़र में TTS 2 को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।

TTS 2 की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।