Gemini 2.5 Pro TTS एपीआई

पॉडकास्ट, ऑडियोबुक और ग्राहक समर्थन के लिए उच्च गुणवत्ता वाले टीटीएस पूर्वावलोकन, जिसमें 23+ भाषाओं में एक्सप्रेसिव मल्टी-स्पीकर आवाज शामिल है।

Googleऑडियो जनरेशनरिलीज 20 मई 2025स्वामित्व वाला एंडपॉइंट

Gemini 2.5 Pro TTS के बारे में

पॉडकास्ट, ऑडियोबुक और ग्राहक समर्थन के लिए उच्च गुणवत्ता वाले टीटीएस पूर्वावलोकन, जिसमें 23+ भाषाओं में एक्सप्रेसिव मल्टी-स्पीकर आवाज शामिल है।

इस नाम से भी जाना जाता है Gemini Pro TTS, Gemini TTS, Google Gemini 2.5 Pro TTS, Gemini-2.5-Pro-TTS

text to speechmulti speakermultilingual

Gemini 2.5 Pro TTS की विशेषताएं

मॉडल ID
gemini-2-5-pro-tts
प्रदाता
Google
श्रेणी
ऑडियो जनरेशन
रिलीज
20 मई 2025
इनपुट
टेक्स्ट
आउटपुट
ऑडियो
एंडपॉइंट
POST/v1/audio/speech
वैकल्पिक मॉडल ID
gemini-2.5-pro-ttsgoogle/gemini-2.5-pro-tts

Gemini 2.5 Pro TTS API की कीमतें

EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।

प्रकार
स्पेक
दर
इनपुट
प्रति 1M शीघ्र टोकन
$3.00
उत्पादन
प्रति 1M उत्पन्न टोकन
$60.00
पूरे कीमत पेज पर तुलना करें

Gemini 2.5 Pro TTS API को कैसे कॉल करें

Gemini 2.5 Pro TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id gemini-2-5-pro-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-2-5-pro-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-2-5-pro-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Gemini 2.5 Pro TTS API का पूरा संदर्भ

Gemini 2.5 Pro TTS API के पैरामीटर

EmpirioLabs पर Gemini 2.5 Pro TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।

पैरामीटरप्रकारडिफॉल्टरेंज / मानविवरण
inputstring--भाषण में बदलने के लिए पाठ। मल्टी-स्पीकर मोड के लिए, Speaker1:/Speaker2:: के साथ उपसर्ग लाइनें।
modeenumsinglesingle, multiएकल = एक आवाज, बहु = दो-आवाज संवाद (आवाज + आवाज का उपयोग करता है2 + स्पीकर नाम)।
languagestringen-US-उच्चारण संकेतों के लिए BCP-47 भाषा टैग (en-US, es-ES, आदि)।
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...प्राथमिक आवाज का नाम (जैसे कोरे, पक, एओडे)। डिफ़ॉल्ट के लिए रिक्त छोड़ दें।
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...मल्टी-स्पीकर मोड के लिए दूसरी आवाज का नाम।
speaker1_namestringSpeaker1-स्पीकर 1 (डिफ़ॉल्ट: स्पीकर1) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम।
speaker2_namestringSpeaker2-स्पीकर 2 (डिफ़ॉल्ट: स्पीकर 2) के लिए इनपुट उपसर्ग में उपयोग किया गया प्रदर्शन नाम।
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWऑडियो फ़ाइल स्वरूप (एमपी3, wav, opus, flac, आदि)।
speednumber10.25 से 2प्लेबैक दर। 1.0 = प्राकृतिक; <1 धीमा, >1 तेज।
volume_gainnumber0-96 से 16डीबी में आउटपुट लाभ। 0 = अपरिवर्तित।
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000हर्ट्ज में आउटपुट नमूना दर (8000, 16000, 24000, 44100, 48000)।
style_promptstring--प्राकृतिक भाषा शैली दिशा (उदाहरण के लिए "गर्म, संवादात्मक" या "न्यूज़कास्टर, गंभीर")।

जानने योग्य

** मॉड्यूल* - सिंगल स्पीकर - मल्टी-स्पीकर (अधिकतम 2 आवाज़) - पाठ में होना चाहिए SpeakerName: text प्रारूप Limits - पाठ + शैली शीघ्र: 4,000 बाइट्स प्रत्येक - ऑडियो बिलिंग: उत्पन्न ऑडियो के प्रति सेकंड ~ 32 टोकन (~ 10-15 chars/s) वोइस और भाषा - 30+ आवाज विकल्प emotional/tonal वर्ण - 24+ भाषा स्थानीय लोगों का समर्थन **Output प्रारूप* - MP3, WAV, OGGG

Gemini 2.5 Pro TTS API: आम सवाल

Gemini 2.5 Pro TTS API की कीमत कितनी है?

EmpirioLabs पर Gemini 2.5 Pro TTS का बिल उपयोग के अनुसार बनता है: इनपुट $3.00 प्रति 1M शीघ्र टोकन; उत्पादन $60.00 प्रति 1M उत्पन्न टोकन। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।

Gemini 2.5 Pro TTS कौन सा endpoint उपयोग करता है?

Gemini 2.5 Pro TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।

क्या मैं इंटीग्रेट करने से पहले ब्राउज़र में Gemini 2.5 Pro TTS आज़मा सकता हूं?

हां। EmpirioLabs playground ब्राउज़र में Gemini 2.5 Pro TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।

Gemini 2.5 Pro TTS की API key कैसे मिलेगी?

EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।