TTS 2 एपीआई

सादे-अंग्रेजी आवाज दिशा के साथ रीयलटाइम वॉयस मॉडल, 100+ भाषाओं में एक आवाज की पहचान, और सब-200ms स्ट्रीमिंग time-to-first-audio।

Inworldऑडियो जनरेशनरिलीज 5 मई 2026स्वामित्व वाला एंडपॉइंटनया

TTS 2 के बारे में

सादे-अंग्रेजी आवाज दिशा के साथ रीयलटाइम वॉयस मॉडल, 100+ भाषाओं में एक आवाज की पहचान, और सब-200ms स्ट्रीमिंग time-to-first-audio।

इस नाम से भी जाना जाता है Inworld TTS 2, TTS-2

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingualexpressive prosody

TTS 2 की विशेषताएं

मॉडल ID
tts-2
प्रदाता
Inworld
श्रेणी
ऑडियो जनरेशन
रिलीज
5 मई 2026
इनपुट
टेक्स्ट
आउटपुट
ऑडियो
एंडपॉइंट
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
वैकल्पिक मॉडल ID
inworld-tts-2

TTS 2 API की कीमतें12% तक बचाएं

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
संश्लेषण
प्रति 1M वर्ण
$25.00$22.00
पूरे कीमत पेज पर तुलना करें

TTS 2 API को कैसे कॉल करें

TTS 2 POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id tts-2 के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
TTS 2 API का पूरा संदर्भ

TTS 2 API के पैरामीटर

EmpirioLabs पर TTS 2 API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
inputstring-अधिकतम 2000संश्लेषित करने के लिए पाठ। प्रति अनुरोध अधिकतम 2,000 वर्ण; ग्राहक पर वाक्य सीमाओं पर लंबे समय तक प्रतिलिपि का खंडन।
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...आवाज पूर्व निर्धारित। अंग्रेजी, स्पेनिश, पुर्तगाली, हिंदी और विभिन्न लहजे को कवर करने वाली 20 हाथ से चुनी गई आवाज़ें। पूर्ण वॉयस कैटलॉग (क्लोन की गई आवाज़ों सहित) के...
voice_idstring--फ़्री-फ़ॉर्म वॉयस ID. सेट होने पर वॉयस को ओवरराइड करता है. क्लोन और क्षेत्रीय आवाज़ों सहित क्यूरेटेड 20-प्रीसेट सूची से परे किसी भी आवाज़ को संबोधित करने के लिए इसका...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...BCP-47 भाषा कोड। यह मॉडल 100+ भाषाओं में एक आवाज की पहचान रखता है; यहां कोई भी समर्थित कोड पास करें, भले ही वह ड्रॉपडाउन में न हो।
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWऑडियो container/codec। WAV = RIFF के अंदर LINEAR16 (सर्वव्यापी)। एमपी3/ओजीजी = संकुचित। पीसीएम = हेडरलेस कच्चा, चंक रीयल-टाइम प्लेबैक के लिए उपयोगी। FLAC = दोषरहित।
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 4800024000 में आउटपुट नमूना दर इनवर्ल्ड का डिफ़ॉल्ट है और उनके वॉयस मॉडल किस पर प्रशिक्षित होते हैं; प्रसारण गुणवत्ता के लिए 48000 तक बढ़ाएं।
speednumber10.5 से 1.5बोलने की दर गुणक। 0.5 = आधी गति, 1.5 = 50% तेज।
temperaturenumber10.1 से 2आवाज की अभिव्यक्ति/परिवर्तनशीलता। निचला = अधिक सुसंगत/"फ्लैट"; उच्च = अधिक अभिव्यंजक लेकिन रेंडर के बीच अधिक भिन्नता।
bit_ratenumber12800032000 से 320000एमपी 3 / OGG_OPUS के लिए बीपीएस में बिटरेट। अन्य एन्कोडिंग के लिए अनदेखा किया गया।
apply_text_normalizationenumONON, OFFचालू होने पर, इनवर्ल्ड संख्याओं/संक्षिप्ताक्षरों/तिथियों को बोले जाने वाले रूप में विस्तारित करता है ("यूएसडी 5" → "पांच अमेरिकी डॉलर")।
timestamp_typeenumNONENONE, WORD, CHARACTERयदि गैर-कोई नहीं है, तो प्रतिक्रिया में timestamp_info में प्रति-शब्द या प्रति-वर्ण टाइमस्टैम्प शामिल हैं। यूआई को कैप्शन/हाइलाइट करने के लिए उपयोगी।

जानने योग्य

सीमाएं - अधिकतम इनपुट: प्रति अनुरोध 2,000 वर्ण (वाक्य सीमाओं पर लंबे पाठ का खंड) - वेबसॉकेट: 20 समवर्ती कनेक्शन, 5 contexts/connection - प्रति-डब्ल्यूएस संदेश: 1,000 वर्ण विलंबता - पी90 टीटीएफबी: 200 एमएस से कम (इनवर्ल्ड बेंचमार्क) आवाजें - 100+ भाषाओं में आयोजित एक आवाज पहचान - ड्रॉपडाउन में क्यूरेटेड प्रीसेट; voice_id के माध्यम से किसी भी अन्य वॉयस आईडी को पास करें - टोन और डिलीवरी को चलाने के लिए सादा-अंग्रेजी आवाज दिशा

TTS 2 API: आम सवाल

TTS 2 API की कीमत कितनी है?

EmpirioLabs पर TTS 2 का बिल उपयोग के अनुसार बनता है। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

TTS 2 कौन सा endpoint उपयोग करता है?

TTS 2 api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में TTS 2 आज़मा सकता हूं?

हां। EmpirioLabs playground ब्राउज़र में TTS 2 को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।

TTS 2 की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।