
पॉडकास्ट, ऑडियोबुक और ग्राहक समर्थन के लिए उच्च गुणवत्ता वाले टीटीएस पूर्वावलोकन, जिसमें 23+ भाषाओं में एक्सप्रेसिव मल्टी-स्पीकर आवाज शामिल है।
पॉडकास्ट, ऑडियोबुक और ग्राहक समर्थन के लिए उच्च गुणवत्ता वाले टीटीएस पूर्वावलोकन, जिसमें 23+ भाषाओं में एक्सप्रेसिव मल्टी-स्पीकर आवाज शामिल है।
इस नाम से भी जाना जाता है Gemini Pro TTS, Gemini TTS, Google Gemini 2.5 Pro TTS, Gemini-2.5-Pro-TTS
gemini-2-5-pro-tts/v1/audio/speechgemini-2.5-pro-ttsgoogle/gemini-2.5-pro-ttsEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Gemini 2.5 Pro TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id gemini-2-5-pro-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2-5-pro-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-2-5-pro-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर Gemini 2.5 Pro TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | - | भाषण में बदलने के लिए पाठ। मल्टी-स्पीकर मोड के लिए, Speaker1:/Speaker2:: के साथ उपसर्ग लाइनें। |
| mode | enum | single | single, multi | एकल = एक आवाज, बहु = दो-आवाज संवाद (आवाज + आवाज का उपयोग करता है2 + स्पीकर नाम)। |
| language | string | en-US | - | उच्चारण संकेतों के लिए BCP-47 भाषा टैग (en-US, es-ES, आदि)। |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | प्राथमिक आवाज का नाम (जैसे कोरे, पक, एओडे)। डिफ़ॉल्ट के लिए रिक्त छोड़ दें। |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | मल्टी-स्पीकर मोड के लिए दूसरी आवाज का नाम। |
| speaker1_name | string | Speaker1 | - | स्पीकर 1 (डिफ़ॉल्ट: स्पीकर1) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम। |
| speaker2_name | string | Speaker2 | - | स्पीकर 2 (डिफ़ॉल्ट: स्पीकर 2) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम। |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | ऑडियो फ़ाइल स्वरूप (एमपी3, wav, opus, flac, आदि)। |
| speed | number | 1 | 0.25 से 2 | प्लेबैक दर। 1.0 = प्राकृतिक; <1 धीमा, >1 तेज। |
| volume_gain | number | 0 | -96 से 16 | डीबी में आउटपुट लाभ। 0 = अपरिवर्तित। |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | हर्ट्ज में आउटपुट नमूना दर (8000, 16000, 24000, 44100, 48000)। |
| style_prompt | string | - | - | प्राकृतिक भाषा शैली दिशा (उदाहरण के लिए "गर्म, संवादात्मक" या "न्यूज़कास्टर, गंभीर")। |
** मॉड्यूल* - सिंगल स्पीकर - मल्टी-स्पीकर (अधिकतम 2 आवाज़) - पाठ में होना चाहिए SpeakerName: text प्रारूप Limits - पाठ + शैली शीघ्र: 4,000 बाइट्स प्रत्येक - ऑडियो बिलिंग: उत्पन्न ऑडियो के प्रति सेकंड ~ 32 टोकन (~ 10-15 chars/s) वोइस और भाषा - 30+ आवाज विकल्प emotional/tonal वर्ण - 24+ भाषा स्थानीय लोगों का समर्थन **Output प्रारूप* - MP3, WAV, OGGG
EmpirioLabs पर Gemini 2.5 Pro TTS का बिल उपयोग के अनुसार बनता है: इनपुट $3.00 प्रति 1M शीघ्र टोकन; उत्पादन $60.00 प्रति 1M उत्पन्न टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Gemini 2.5 Pro TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में Gemini 2.5 Pro TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।