TTS 2 Flash एपीआई

विलंबता-पहला रीयलटाइम वॉयस सिंथेसिस 200+ भाषाओं में एक आवाज की पहचान रखता है, जिसे उच्च-मात्रा स्ट्रीमिंग वर्कलोड के लिए ट्यून किया गया है।

Inworldऑडियो जनरेशनरिलीज 2 सित॰ 2026स्वामित्व वाला एंडपॉइंटनया

TTS 2 Flash के बारे में

विलंबता-पहला रीयलटाइम वॉयस सिंथेसिस 200+ भाषाओं में एक आवाज की पहचान रखता है, जिसे उच्च-मात्रा स्ट्रीमिंग वर्कलोड के लिए ट्यून किया गया है।

इस नाम से भी जाना जाता है Inworld TTS 2 Flash

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingual

TTS 2 Flash की विशेषताएं

मॉडल ID
tts-2-flash
प्रदाता
Inworld
श्रेणी
ऑडियो जनरेशन
रिलीज
2 सित॰ 2026
इनपुट
टेक्स्ट
आउटपुट
ऑडियो
एंडपॉइंट
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
वैकल्पिक मॉडल ID
inworld-tts-2-flash

TTS 2 Flash API की कीमतें30% तक बचाएं

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
संश्लेषण
प्रति 1M वर्ण
$15.00$10.50
पूरे कीमत पेज पर तुलना करें

TTS 2 Flash API को कैसे कॉल करें

TTS 2 Flash POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id tts-2-flash के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2-flash",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2-flash", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
TTS 2 Flash API का पूरा संदर्भ

TTS 2 Flash API के पैरामीटर

EmpirioLabs पर TTS 2 Flash API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
inputstring-अधिकतम 2000संश्लेषित करने के लिए पाठ। प्रति अनुरोध अधिकतम 2,000 वर्ण; क्लाइंट पर वाक्य सीमाओं पर चंक लंबी प्रतिलिपि। यह मॉडल ब्रैकेटेड डिलीवरी दिशा लागू नहीं करता है; जब आपको...
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...आवाज पूर्व निर्धारित। अंग्रेजी, स्पेनिश, पुर्तगाली, हिंदी और विभिन्न लहजे को कवर करने वाली 20 हाथ से चुनी गई आवाज़ें। पूर्ण वॉयस कैटलॉग (क्लोन की गई आवाज़ों सहित) के...
voice_idstring--फ़्री-फ़ॉर्म वॉयस ID. सेट होने पर वॉयस को ओवरराइड करता है. क्लोन और क्षेत्रीय आवाज़ों सहित क्यूरेटेड 20-प्रीसेट सूची से परे किसी भी आवाज़ को संबोधित करने के लिए इसका...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...BCP-47 भाषा कोड। यह मॉडल 200+ भाषाओं और स्थानों में एक आवाज की पहचान रखता है, इसलिए आप यहां किसी भी समर्थित कोड को पास कर सकते हैं, भले ही वह ड्रॉपडाउन में न हो।
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWऑडियो container/codec। WAV = RIFF के अंदर LINEAR16 (सर्वव्यापी)। एमपी3/ओजीजी = संकुचित। पीसीएम = हेडरलेस कच्चा, चंक रीयल-टाइम प्लेबैक के लिए उपयोगी। FLAC = दोषरहित।
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 4800024000 में आउटपुट नमूना दर इनवर्ल्ड का डिफ़ॉल्ट है और उनके वॉयस मॉडल किस पर प्रशिक्षित होते हैं; प्रसारण गुणवत्ता के लिए 48000 तक बढ़ाएं।
speednumber10.5 से 1.5बोलने की दर गुणक। 0.5 = आधी गति, 1.5 = 50% तेज।
temperaturenumber10.1 से 2आवाज की अभिव्यक्ति/परिवर्तनशीलता। निचला = अधिक सुसंगत/"फ्लैट"; उच्च = अधिक अभिव्यंजक लेकिन रेंडर के बीच अधिक भिन्नता।
bit_ratenumber12800032000 से 320000एमपी 3 / OGG_OPUS के लिए बीपीएस में बिटरेट। अन्य एन्कोडिंग के लिए अनदेखा किया गया।
apply_text_normalizationenumONON, OFFचालू होने पर, इनवर्ल्ड संख्याओं/संक्षिप्ताक्षरों/तिथियों को बोले जाने वाले रूप में विस्तारित करता है ("यूएसडी 5" → "पांच अमेरिकी डॉलर")।
timestamp_typeenumNONENONE, WORD, CHARACTERयदि गैर-कोई नहीं है, तो प्रतिक्रिया में timestamp_info में प्रति-शब्द या प्रति-वर्ण टाइमस्टैम्प शामिल हैं। यूआई को कैप्शन/हाइलाइट करने के लिए उपयोगी।

जानने योग्य

सीमाएं - अधिकतम इनपुट: प्रति अनुरोध 2,000 वर्ण (वाक्य सीमाओं पर लंबे पाठ का खंड) - वेबसॉकेट: 20 समवर्ती कनेक्शन, 5 contexts/connection - प्रति-डब्ल्यूएस संदेश: 1,000 वर्ण आवाज दिशा - यह मॉडल ब्रैकेट सादे-अंग्रेजी वितरण दिशा लागू नहीं करता है। जब आपको इसकी आवश्यकता हो तो टीटीएस 2 का उपयोग करें, या speed और temperature नियंत्रणों के साथ यहां वितरण को आकार दें। विलंबता - p90 TTFB: 25 एमएस (इनवर्ल्ड बेंचमार्क) आवाज़ें - 200+ भाषाओं और स्थानों में आयोजित एक आवाज पहचान, जिसमें भाषा मध्य-पीढ़ी को बदलना शामिल है - ड्रॉपडाउन में क्यूरेटेड प्रीसेट; voice_id के माध्यम से किसी भी अन्य वॉयस आईडी को पास करें

TTS 2 Flash API: आम सवाल

TTS 2 Flash API की कीमत कितनी है?

EmpirioLabs पर TTS 2 Flash का बिल उपयोग के अनुसार बनता है। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

TTS 2 Flash कौन सा endpoint उपयोग करता है?

TTS 2 Flash api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में TTS 2 Flash आज़मा सकता हूं?

हां। EmpirioLabs playground ब्राउज़र में TTS 2 Flash को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।

TTS 2 Flash की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।