Gemini 3.8 Flash-Lite TTS एपीआई

वॉयस एजेंटों और डबिंग के लिए लागत-कुशल भाषण, स्ट्रीमिंग, वोकल टैग और 101 भाषाओं और 2,000+ आवाजों में दो-स्पीकर संवाद के साथ।

Googleऑडियो जनरेशनरिलीज 22 सित॰ 2026स्वामित्व वाला एंडपॉइंटनया

Gemini 3.8 Flash-Lite TTS के बारे में

वॉयस एजेंटों और डबिंग के लिए लागत-कुशल भाषण, स्ट्रीमिंग, वोकल टैग और 101 भाषाओं और 2,000+ आवाजों में दो-स्पीकर संवाद के साथ।

इस नाम से भी जाना जाता है Gemini Flash-Lite TTS, Google Gemini 3.8 Flash-Lite TTS, Gemini-3.8-Flash-Lite-TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Gemini 3.8 Flash-Lite TTS की विशेषताएं

मॉडल ID
gemini-3-8-flash-lite-tts
निर्माता
Google
श्रेणी
ऑडियो जनरेशन
रिलीज
22 सित॰ 2026
इनपुट
टेक्स्ट
आउटपुट
ऑडियो
एंडपॉइंट
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
वैकल्पिक मॉडल ID
gemini-3.8-flash-lite-ttsgoogle/gemini-3.8-flash-lite-tts

Gemini 3.8 Flash-Lite TTS API की कीमतें

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
इनपुट
प्रति 1M प्रॉम्प्ट टोकन
$2.60
उत्पादन
प्रति 1M जेनरेट किए गए टोकन
$31.20
पूरे कीमत पेज पर तुलना करें

Gemini 3.8 Flash-Lite TTS API को कैसे कॉल करें

Gemini 3.8 Flash-Lite TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id gemini-3-8-flash-lite-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-lite-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-lite-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.8 Flash-Lite TTS API का पूरा संदर्भ

Gemini 3.8 Flash-Lite TTS API के पैरामीटर

EmpirioLabs पर Gemini 3.8 Flash-Lite TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
inputstring-अधिकतम 5000भाषण में बदलने के लिए पाठ। मल्टी-स्पीकर मोड के लिए, स्पीकर1:/स्पीकर2:: के साथ उपसर्ग पंक्तियाँ। 5,000 वर्णों तक। वितरण दिशा को style_prompt में रखें, और इन मुखर टैग...
modeenumsinglesingle, multiएकल = एक आवाज, बहु = दो-आवाज संवाद (आवाज + आवाज का उपयोग करता है2 + स्पीकर नाम)।
languagestring--वैकल्पिक BCP-47 भाषा टैग (en-US, es-ES, आदि)। पाठ की भाषा स्वचालित रूप से पता चल जाती है। 30 सूचीबद्ध आवाज़ें हर समर्थित भाषा बोलती हैं; एक पुस्तकालय की आवाज़ का...
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...प्राथमिक आवाज का नाम (जैसे कोरे, पक, एओडे)। डिफ़ॉल्ट के लिए खाली छोड़ दें। ये 30 आवाजें हर समर्थित भाषा बोलती हैं। GET /v1/voices 2,000 से अधिक आवाजों की पूरी...
voice_audio_urlstring--voice=custom only: आवाज से क्लोन तक स्वच्छ, प्राकृतिक भाषण की 10 से 30 सेकंड की रिकॉर्डिंग के लिए एक HTTPS URL (WAV, MP3, M4A, OGG, WEBM या FLAC)। इसे एक शांत कमरे...
voice_consent_audio_urlstring--voice=custom only: इस कथन को ज़ोर से पढ़ने वाले एक ही स्पीकर के लिए एक https URL: "मैं इस आवाज़ का मालिक हूं और मैं सिंथेटिक वॉयस मॉडल बनाने के लिए इस आवाज़ का उपयोग...
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...मल्टी-स्पीकर मोड के लिए दूसरी आवाज का नाम।
speaker1_namestringSpeaker1-स्पीकर 1 (डिफ़ॉल्ट: स्पीकर1) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम।
speaker2_namestringSpeaker2-स्पीकर 2 (डिफ़ॉल्ट: स्पीकर 2) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम।
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWऑडियो फ़ाइल प्रारूप: टेलीफोनी के लिए WAV, MP3, OGG (Opus), या ALAW/MULAW।
speednumber10.25 से 2प्लेबैक दर। 1.0 = प्राकृतिक; <1 धीमा, >1 तेज।
volume_gainnumber0-96 से 16डीबी में आउटपुट लाभ। 0 = अपरिवर्तित।
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000हर्ट्ज (8000, 16000, 22050, 24000, 44100, या 48000) में आउटपुट नमूना दर।
style_promptstring--प्राकृतिक भाषा शैली दिशा (उदाहरण के लिए "गर्म, संवादात्मक" या "न्यूज़कास्टर, गंभीर")।

जानने योग्य

सीमाएं - पाठ: प्रति अनुरोध 5,000 वर्ण तक - ऑडियो बिलिंग: जेनरेट किए गए ऑडियो के प्रति सेकंड 32 आउटपुट टोकन - 101 भाषाएँ। पाठ की भाषा स्वचालित रूप से पता चल जाती है। आवाज़ें - voice सूची में 30 आवाजें हर समर्थित भाषा बोलती हैं। - GET /v1/voices?model=gemini-3-8-flash-lite-tts 30 स्थानों पर 2,000 से अधिक आवाजों की पूरी लाइब्रेरी को सूचीबद्ध करता है, जिसमें भाषा, उच्चारण, लिंग, पिच और प्रत्येक का विवरण होता है। इसे language, gender, pitch या q से फ़िल्टर करें। यह जो भी आईडी देता है वह voice या voice2 के रूप में काम करता है; जब आप भी language सेट करते हैं, तो आवाज की अपनी भाषा का उपयोग करें। कस्टम आवाज़ें - voice को https URL के रूप में एक ही वयस्क स्पीकर की दो रिकॉर्डिंग GET /v1/voices?model=gemini-3-8-flash-lite-tts 0__ और पास करने के लिए सेट करें: GET /v1/voices?model=gemini-3-8-flash-lite-tts 1__, 10 से 30 सेकंड का प्राकृतिक भाषण, और GET /v1/voices?model=gemini-3-8-flash-lite-tts 2__, स्पीकर पढ़ता है "मैं इस आवाज का मालिक हूं और मैं सिंथेटिक वॉयस मॉडल बनाने के लिए इस आवाज का उपयोग करने के लिए Google को सहमति देता हूं। कथन 30 भाषाओं में स्वीकार किया जाता है; उस पैरामीटर पर GET /v1/voices?model=gemini-3-8-flash-lite-tts 3__ प्रत्येक शब्द को सूचीबद्ध करता है। - दोनों को एक ही माइक्रोफ़ोन पर एक शांत कमरे में रिकॉर्ड करें। WAV, MP3, M4A, OGG, WEBM और FLAC स्वीकार किए जाते हैं, प्रत्येक में 15 एमबी तक। - प्रतिक्रिया में GET /v1/voices?model=gemini-3-8-flash-lite-tts 4__ और GET /v1/voices?model=gemini-3-8-flash-lite-tts 5__ शामिल हैं। नई रिकॉर्डिंग के बिना 7 दिनों तक आवाज का पुन: उपयोग करने के लिए GET /v1/voices?model=gemini-3-8-flash-lite-tts 6__ को GET /v1/voices?model=gemini-3-8-flash-lite-tts 7__ या GET /v1/voices?model=gemini-3-8-flash-lite-tts 8__ के रूप में पास करें। आईडी वाला कोई भी व्यक्ति आवाज के समाप्त होने तक उसका उपयोग कर सकता है, इसलिए इसे निजी रखें। वितरण दिशा - पूरे मार्ग के लिए दिशा पाठ के बजाय GET /v1/voices?model=gemini-3-8-flash-lite-tts 9__ में रखें, उदाहरण के लिए "गर्म, अनियंत्रित और आश्वस्त"। - वोकल टैग इनलाइन रखें जहां ध्वनि होनी चाहिए। इन अंग्रेज़ी टैग का उपयोग तब भी करें जब पाठ किसी अन्य भाषा में हो: केवल '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__".

Gemini 3.8 Flash-Lite TTS API: आम सवाल

Gemini 3.8 Flash-Lite TTS API की कीमत कितनी है?

EmpirioLabs पर Gemini 3.8 Flash-Lite TTS का बिल उपयोग के अनुसार बनता है: इनपुट $2.60 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $31.20 प्रति 1M जेनरेट किए गए टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

Gemini 3.8 Flash-Lite TTS कौन सा endpoint उपयोग करता है?

Gemini 3.8 Flash-Lite TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में Gemini 3.8 Flash-Lite TTS आज़मा सकता हूं?

हां। EmpirioLabs playground ब्राउज़र में Gemini 3.8 Flash-Lite TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।

Gemini 3.8 Flash-Lite TTS की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।