Gemini 3.8 Flash TTS एपीआई

130 भाषाओं में इनलाइन वोकल टैग, शैली दिशा और दो-स्पीकर संवाद के साथ अभिव्यंजक भाषण और 2,000 से अधिक आवाजों की लाइब्रेरी।

Googleऑडियो जनरेशनरिलीज 22 सित॰ 2026स्वामित्व वाला एंडपॉइंटनया

Gemini 3.8 Flash TTS के बारे में

130 भाषाओं में इनलाइन वोकल टैग, शैली दिशा और दो-स्पीकर संवाद के साथ अभिव्यंजक भाषण और 2,000 से अधिक आवाजों की लाइब्रेरी।

इस नाम से भी जाना जाता है Gemini Flash TTS, Google Gemini 3.8 Flash TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

Gemini 3.8 Flash TTS की विशेषताएं

मॉडल ID
gemini-3-8-flash-tts
निर्माता
Google
श्रेणी
ऑडियो जनरेशन
रिलीज
22 सित॰ 2026
इनपुट
टेक्स्ट
आउटपुट
ऑडियो
एंडपॉइंट
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
वैकल्पिक मॉडल ID
gemini-3.8-flash-ttsgoogle/gemini-3.8-flash-tts

Gemini 3.8 Flash TTS API की कीमतें

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
इनपुट
प्रति 1M प्रॉम्प्ट टोकन
$2.60
उत्पादन
प्रति 1M जेनरेट किए गए टोकन
$46.80
पूरे कीमत पेज पर तुलना करें

Gemini 3.8 Flash TTS API को कैसे कॉल करें

Gemini 3.8 Flash TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id gemini-3-8-flash-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 3.8 Flash TTS API का पूरा संदर्भ

Gemini 3.8 Flash TTS API के पैरामीटर

EmpirioLabs पर Gemini 3.8 Flash TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
inputstring-अधिकतम 5000भाषण में बदलने के लिए पाठ। मल्टी-स्पीकर मोड के लिए, स्पीकर1:/स्पीकर2:: के साथ उपसर्ग पंक्तियाँ। 5,000 वर्णों तक। वितरण दिशा को style_prompt में रखें, और इन मुखर टैग...
modeenumsinglesingle, multiएकल = एक आवाज, बहु = दो-आवाज संवाद (आवाज + आवाज का उपयोग करता है2 + स्पीकर नाम)।
languagestring--वैकल्पिक BCP-47 भाषा टैग (en-US, es-ES, आदि)। पाठ की भाषा स्वचालित रूप से पता चल जाती है। 30 सूचीबद्ध आवाज़ें हर समर्थित भाषा बोलती हैं; एक पुस्तकालय की आवाज़ का...
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...प्राथमिक आवाज का नाम (जैसे कोरे, पक, एओडे)। डिफ़ॉल्ट के लिए खाली छोड़ दें। ये 30 आवाजें हर समर्थित भाषा बोलती हैं। GET /v1/voices 2,000 से अधिक आवाजों की पूरी...
voice_audio_urlstring--voice=custom only: आवाज से क्लोन तक स्वच्छ, प्राकृतिक भाषण की 10 से 30 सेकंड की रिकॉर्डिंग के लिए एक HTTPS URL (WAV, MP3, M4A, OGG, WEBM या FLAC)। इसे एक शांत कमरे...
voice_consent_audio_urlstring--voice=custom only: इस कथन को ज़ोर से पढ़ने वाले एक ही स्पीकर के लिए एक https URL: "मैं इस आवाज़ का मालिक हूं और मैं सिंथेटिक वॉयस मॉडल बनाने के लिए इस आवाज़ का उपयोग...
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...मल्टी-स्पीकर मोड के लिए दूसरी आवाज का नाम।
speaker1_namestringSpeaker1-स्पीकर 1 (डिफ़ॉल्ट: स्पीकर1) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम।
speaker2_namestringSpeaker2-स्पीकर 2 (डिफ़ॉल्ट: स्पीकर 2) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम।
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWऑडियो फ़ाइल प्रारूप: टेलीफोनी के लिए WAV, MP3, OGG (Opus), या ALAW/MULAW।
speednumber10.25 से 2प्लेबैक दर। 1.0 = प्राकृतिक; <1 धीमा, >1 तेज।
volume_gainnumber0-96 से 16डीबी में आउटपुट लाभ। 0 = अपरिवर्तित।
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000हर्ट्ज (8000, 16000, 22050, 24000, 44100, या 48000) में आउटपुट नमूना दर।
style_promptstring--प्राकृतिक भाषा शैली दिशा (उदाहरण के लिए "गर्म, संवादात्मक" या "न्यूज़कास्टर, गंभीर")।

जानने योग्य

सीमाएं - पाठ: प्रति अनुरोध 5,000 वर्णों तक - ऑडियो बिलिंग: उत्पन्न ऑडियो के प्रति सेकंड 32 आउटपुट टोकन - 130 भाषाएँ। पाठ की भाषा स्वचालित रूप से पता चल जाती है। आवाज़ें - voice सूची में 30 आवाज़ें हर समर्थित भाषा बोलती हैं। - GET /v1/voices?model=gemini-3-8-flash-tts 30 स्थानों पर 2,000 से अधिक आवाज़ों की पूरी लाइब्रेरी को सूचीबद्ध करता है, जिसमें भाषा, उच्चारण, लिंग, पिच और प्रत्येक का विवरण शामिल है। इसे language, gender, pitch या q से फ़िल्टर करें। यह जो भी आईडी लौटाता है वह voice या voice2 के रूप में काम करता है; जब आप भी language सेट करते हैं, तो आवाज की अपनी भाषा का उपयोग करें। कस्टम आवाज़ें - voice को https URL के रूप में एक ही वयस्क स्पीकर की दो रिकॉर्डिंग GET /v1/voices?model=gemini-3-8-flash-tts 0__ और पास करने के लिए सेट करें: GET /v1/voices?model=gemini-3-8-flash-tts 1__, 10 से 30 सेकंड का प्राकृतिक भाषण, और GET /v1/voices?model=gemini-3-8-flash-tts 2__, स्पीकर पढ़ता है "मैं इस आवाज का मालिक हूं और मैं सिंथेटिक वॉयस मॉडल बनाने के लिए इस आवाज का उपयोग करने के लिए Google को सहमति देता हूं। कथन 30 भाषाओं में स्वीकार किया जाता है; उस पैरामीटर पर GET /v1/voices?model=gemini-3-8-flash-tts 3__ प्रत्येक शब्द को सूचीबद्ध करता है। - दोनों को एक ही माइक्रोफ़ोन पर एक शांत कमरे में रिकॉर्ड करें। WAV, MP3, M4A, OGG, WEBM और FLAC स्वीकार किए जाते हैं, प्रत्येक में 15 एमबी तक। - प्रतिक्रिया में GET /v1/voices?model=gemini-3-8-flash-tts 4__ और GET /v1/voices?model=gemini-3-8-flash-tts 5__ शामिल हैं। नई रिकॉर्डिंग के बिना 7 दिनों तक आवाज का पुन: उपयोग करने के लिए GET /v1/voices?model=gemini-3-8-flash-tts 6__ को GET /v1/voices?model=gemini-3-8-flash-tts 7__ या GET /v1/voices?model=gemini-3-8-flash-tts 8__ के रूप में पास करें। आईडी वाला कोई भी व्यक्ति आवाज के समाप्त होने तक उसका उपयोग कर सकता है, इसलिए इसे निजी रखें। वितरण दिशा - पूरे मार्ग के लिए दिशा पाठ के बजाय GET /v1/voices?model=gemini-3-8-flash-tts 9__ में रखें, उदाहरण के लिए "गर्म, अनियंत्रित और आश्वस्त"। - वोकल टैग इनलाइन रखें जहां ध्वनि होनी चाहिए। इन अंग्रेज़ी टैग का उपयोग तब भी करें जब पाठ किसी अन्य भाषा में हो: केवल '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__".

Gemini 3.8 Flash TTS API: आम सवाल

Gemini 3.8 Flash TTS API की कीमत कितनी है?

EmpirioLabs पर Gemini 3.8 Flash TTS का बिल उपयोग के अनुसार बनता है: इनपुट $2.60 प्रति 1M प्रॉम्प्ट टोकन; उत्पादन $46.80 प्रति 1M जेनरेट किए गए टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

Gemini 3.8 Flash TTS कौन सा endpoint उपयोग करता है?

Gemini 3.8 Flash TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में Gemini 3.8 Flash TTS आज़मा सकता हूं?

हां। EmpirioLabs playground ब्राउज़र में Gemini 3.8 Flash TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।

Gemini 3.8 Flash TTS की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।