
वॉयस एजेंटों और डबिंग के लिए लागत-कुशल भाषण, स्ट्रीमिंग, वोकल टैग और 101 भाषाओं और 2,000+ आवाजों में दो-स्पीकर संवाद के साथ।
वॉयस एजेंटों और डबिंग के लिए लागत-कुशल भाषण, स्ट्रीमिंग, वोकल टैग और 101 भाषाओं और 2,000+ आवाजों में दो-स्पीकर संवाद के साथ।
इस नाम से भी जाना जाता है Gemini Flash-Lite TTS, Google Gemini 3.8 Flash-Lite TTS, Gemini-3.8-Flash-Lite-TTS
gemini-3-8-flash-lite-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesgemini-3.8-flash-lite-ttsgoogle/gemini-3.8-flash-lite-ttsEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Gemini 3.8 Flash-Lite TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id gemini-3-8-flash-lite-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-8-flash-lite-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-8-flash-lite-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर Gemini 3.8 Flash-Lite TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | अधिकतम 5000 | भाषण में बदलने के लिए पाठ। मल्टी-स्पीकर मोड के लिए, स्पीकर1:/स्पीकर2:: के साथ उपसर्ग पंक्तियाँ। 5,000 वर्णों तक। वितरण दिशा को style_prompt में रखें, और इन मुखर टैग... |
| mode | enum | single | single, multi | एकल = एक आवाज, बहु = दो-आवाज संवाद (आवाज + आवाज का उपयोग करता है2 + स्पीकर नाम)। |
| language | string | - | - | वैकल्पिक BCP-47 भाषा टैग (en-US, es-ES, आदि)। पाठ की भाषा स्वचालित रूप से पता चल जाती है। 30 सूचीबद्ध आवाज़ें हर समर्थित भाषा बोलती हैं; एक पुस्तकालय की आवाज़ का... |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | प्राथमिक आवाज का नाम (जैसे कोरे, पक, एओडे)। डिफ़ॉल्ट के लिए खाली छोड़ दें। ये 30 आवाजें हर समर्थित भाषा बोलती हैं। GET /v1/voices 2,000 से अधिक आवाजों की पूरी... |
| voice_audio_url | string | - | - | voice=custom only: आवाज से क्लोन तक स्वच्छ, प्राकृतिक भाषण की 10 से 30 सेकंड की रिकॉर्डिंग के लिए एक HTTPS URL (WAV, MP3, M4A, OGG, WEBM या FLAC)। इसे एक शांत कमरे... |
| voice_consent_audio_url | string | - | - | voice=custom only: इस कथन को ज़ोर से पढ़ने वाले एक ही स्पीकर के लिए एक https URL: "मैं इस आवाज़ का मालिक हूं और मैं सिंथेटिक वॉयस मॉडल बनाने के लिए इस आवाज़ का उपयोग... |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | मल्टी-स्पीकर मोड के लिए दूसरी आवाज का नाम। |
| speaker1_name | string | Speaker1 | - | स्पीकर 1 (डिफ़ॉल्ट: स्पीकर1) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम। |
| speaker2_name | string | Speaker2 | - | स्पीकर 2 (डिफ़ॉल्ट: स्पीकर 2) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम। |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | ऑडियो फ़ाइल प्रारूप: टेलीफोनी के लिए WAV, MP3, OGG (Opus), या ALAW/MULAW। |
| speed | number | 1 | 0.25 से 2 | प्लेबैक दर। 1.0 = प्राकृतिक; <1 धीमा, >1 तेज। |
| volume_gain | number | 0 | -96 से 16 | डीबी में आउटपुट लाभ। 0 = अपरिवर्तित। |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | हर्ट्ज (8000, 16000, 22050, 24000, 44100, या 48000) में आउटपुट नमूना दर। |
| style_prompt | string | - | - | प्राकृतिक भाषा शैली दिशा (उदाहरण के लिए "गर्म, संवादात्मक" या "न्यूज़कास्टर, गंभीर")। |
सीमाएं - पाठ: प्रति अनुरोध 5,000 वर्ण तक - ऑडियो बिलिंग: जेनरेट किए गए ऑडियो के प्रति सेकंड 32 आउटपुट टोकन - 101 भाषाएँ। पाठ की भाषा स्वचालित रूप से पता चल जाती है। आवाज़ें - voice सूची में 30 आवाजें हर समर्थित भाषा बोलती हैं। - GET /v1/voices?model=gemini-3-8-flash-lite-tts 30 स्थानों पर 2,000 से अधिक आवाजों की पूरी लाइब्रेरी को सूचीबद्ध करता है, जिसमें भाषा, उच्चारण, लिंग, पिच और प्रत्येक का विवरण होता है। इसे language, gender, pitch या q से फ़िल्टर करें। यह जो भी आईडी देता है वह voice या voice2 के रूप में काम करता है; जब आप भी language सेट करते हैं, तो आवाज की अपनी भाषा का उपयोग करें। कस्टम आवाज़ें - voice को https URL के रूप में एक ही वयस्क स्पीकर की दो रिकॉर्डिंग GET /v1/voices?model=gemini-3-8-flash-lite-tts 0__ और पास करने के लिए सेट करें: GET /v1/voices?model=gemini-3-8-flash-lite-tts 1__, 10 से 30 सेकंड का प्राकृतिक भाषण, और GET /v1/voices?model=gemini-3-8-flash-lite-tts 2__, स्पीकर पढ़ता है "मैं इस आवाज का मालिक हूं और मैं सिंथेटिक वॉयस मॉडल बनाने के लिए इस आवाज का उपयोग करने के लिए Google को सहमति देता हूं। कथन 30 भाषाओं में स्वीकार किया जाता है; उस पैरामीटर पर GET /v1/voices?model=gemini-3-8-flash-lite-tts 3__ प्रत्येक शब्द को सूचीबद्ध करता है। - दोनों को एक ही माइक्रोफ़ोन पर एक शांत कमरे में रिकॉर्ड करें। WAV, MP3, M4A, OGG, WEBM और FLAC स्वीकार किए जाते हैं, प्रत्येक में 15 एमबी तक। - प्रतिक्रिया में GET /v1/voices?model=gemini-3-8-flash-lite-tts 4__ और GET /v1/voices?model=gemini-3-8-flash-lite-tts 5__ शामिल हैं। नई रिकॉर्डिंग के बिना 7 दिनों तक आवाज का पुन: उपयोग करने के लिए GET /v1/voices?model=gemini-3-8-flash-lite-tts 6__ को GET /v1/voices?model=gemini-3-8-flash-lite-tts 7__ या GET /v1/voices?model=gemini-3-8-flash-lite-tts 8__ के रूप में पास करें। आईडी वाला कोई भी व्यक्ति आवाज के समाप्त होने तक उसका उपयोग कर सकता है, इसलिए इसे निजी रखें। वितरण दिशा - पूरे मार्ग के लिए दिशा पाठ के बजाय GET /v1/voices?model=gemini-3-8-flash-lite-tts 9__ में रखें, उदाहरण के लिए "गर्म, अनियंत्रित और आश्वस्त"। - वोकल टैग इनलाइन रखें जहां ध्वनि होनी चाहिए। इन अंग्रेज़ी टैग का उपयोग तब भी करें जब पाठ किसी अन्य भाषा में हो: केवल '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__".
EmpirioLabs पर Gemini 3.8 Flash-Lite TTS का बिल उपयोग के अनुसार बनता है: इनपुट $2.60 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $31.20 प्रति 1M जेनरेट किए गए टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Gemini 3.8 Flash-Lite TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में Gemini 3.8 Flash-Lite TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।