जेमिनी 3.8 फ्लैश टीटीएस और जेमिनी 3.8 फ्लैश-लाइट टीटीएस EmpirioLabs पर उपलब्ध हैं। दोनों पाठ को भाषण में बदल देते हैं पोस्ट /v1/audio/speech, ऑडियो स्ट्रीम करें पोस्ट /v1/audio/speech:stream, और 2,000 से अधिक आवाज़ों की एक ही लाइब्रेरी पर ड्रा करें। दोनों एपीआई और Playground में काम करते हैं।
दो मॉडल
gemini-3-8-flash-ttsरचनात्मक निर्देशन के लिए बनाया गया है: कथन, ऑडियोबुक, पात्र और दो-वक्ता दृश्य। इसमें 130 भाषाएँ शामिल हैं।gemini-3-8-flash-lite-ttsउच्च मात्रा वाले काम जैसे वॉयस एजेंट, डबिंग और बल्क ऑडियो के लिए बनाया गया है, जिसमें जेनरेट किए गए ऑडियो के लिए कम दर है। इसमें 101 भाषाएँ शामिल हैं।
दोनों मॉडल एक ही अनुरोध निकाय लेते हैं, इसलिए उनके बीच स्विच करना एक परिवर्तन है मॉडल।.
आपका पहला अनुरोध
कर्ल https://api.empiriolabs.ai/v1/audio/speech \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "gemini-3-8-flash-tts", "इनपुट": "वापस आपका स्वागत है। <छोटा विराम> यहाँ इस सप्ताह क्या बदल गया है। ", "आवाज": "कोरे", "style_prompt": "गर्म और जल्दबाजी" }'
प्रतिक्रिया उत्पन्न ऑडियो के लिए एक हस्ताक्षरित URL ले जाती है। डिफ़ॉल्ट प्रारूप 24,000 हर्ट्ज पर WAV है। सेट output_format सेवा मेरे एमपी3, ओजीजी, एएलएडब्ल्यू, या मुलव, और sample_rate 8,000, 16,000, 22,050, 24,000, 44,100, या 48,000 हर्ट्ज में से किसी के लिए।
प्रदर्शन का निर्देशन
- शैली की दिशा।
style_promptपूरे मार्ग के लिए टोन सेट करता है, उदाहरण के लिए "शांत और आश्वस्त" या "उत्साहित खेल कमेंटेटर"। - मुखर टैग। टैग जैसे
<laugh>,<sigh>,<breath>, और<छोटा विराम>इनलाइन पर जाएं जहां ध्वनि होनी चाहिए। पूरी सूची पर हैइनपुटपैरामीटर मॉडल संदर्भ में। अंग्रेजी टैग का उपयोग तब भी करें जब पाठ किसी अन्य भाषा में हो। - जोर। किसी शब्द को जोर देने के लिए उसे बड़े अक्षरों में लिखें।
दो-वक्ता संवाद
सेट मोड समूह सेवा मेरे बहु, प्रत्येक स्पीकर के लिए एक आवाज चुनें आवाज तथा आवाज2, और प्रत्येक पंक्ति को स्पीकर के नाम और कोलन से शुरू करें। नाम मेल खाने चाहिए speaker1_name तथा speaker2_name, जो डिफ़ॉल्ट रूप से वक्ता1 तथा वक्ता2।.
{ "मॉडल": "gemini-3-8-flash-lite-tts", "मोड": "मल्टी", "speaker1_name": "माया", "speaker2_name": "थियो", "आवाज": "एओडे", "वॉयस2": "पक", "इनपुट": "माया: क्या शिपमेंट आ गया?\nथियो: यह हुआ।<laugh> हर बॉक्स, समय पर।
आवाज चुनना
30 में आवाजें आवाज सूची, जैसे कोरे, पक, चारोन और एओडे, हर समर्थित भाषा बोलते हैं। पूरी लाइब्रेरी में 30 स्थानों पर 2,000 से अधिक आवाज़ें हैं, जिनमें से प्रत्येक में एक भाषा, उच्चारण, लिंग, पिच और विवरण है। इसे इसके साथ सूचीबद्ध करें /v1/voices और द्वारा फ़िल्टर करें भाषा, लिंग, पिच, या इसके साथ एक खोज शब्द प्रश्न:
कर्ल "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY"
कोई भी वॉयस आईडी जिसमें लिस्टिंग रिटर्न करती है, काम करती है आवाज तथा आवाज2।.
स्ट्रीमिंग
पोस्ट /v1/audio/speech:stream एक ही बॉडी लेता है और सर्वर-भेजे गए ईवेंट लौटाता है: ऑडियो.चंक ऑडियो उत्पन्न होने के रूप में 24,000 हर्ट्ज पर बेस 64 16-बिट पीसीएम ले जाने वाली घटनाएं, फिर एक ऑडियो.डन अनुरोधित प्रारूप में पूरी फ़ाइल के लिंक के साथ ईवेंट।
परिचालन नोट्स
- Gemini 3.1 Flash TTS के लिए लिखी गई स्क्रिप्ट को उनके टैग को फिर से लिखने की आवश्यकता होती है. 3.8 मॉडल कोण-ब्रैकेट टैग का उपयोग करते हैं जैसे
<whispers>तथा<laugh>वर्ग-ब्रैकेट टैग के बजाय 3.1 का उपयोग करता है। जब आप किसी स्क्रिप्ट को पार ले जाते हैं तो टैग अपडेट करें। - एक पुस्तकालय की आवाज अपनी भाषा रखती है। जब आप सेट करते हैं
भाषाएक पुस्तकालय आवाज के साथ, यह उस आवाज का स्थान होना चाहिए:fr-fr-advisor-1साथएन-यूएसअस्वीकार कर दिया जाता है। 30 बहुभाषी आवाजें किसी भी भाषा को स्वीकार करती हैं। - संवाद लेबल वक्ता के नामों से मेल खाना चाहिए। में
बहुमोड, पहली लेबल की गई पंक्ति से पहले पाठ को अस्वीकार कर दिया जाता है, और एक पंक्ति जिसका लेबल न तो मेल खाता हैspeaker1_nameन हीspeaker2_nameपिछले मोड़ के हिस्से के रूप में पढ़ा जाता है। रफ़्तारपूर्ण फ़ाइलों पर लागू होता है। स्ट्रीमिंग समापन बिंदु एक को अस्वीकार करता हैरफ़्तार1.0 के अलावा। फ़ाइल का अनुरोध करेंपोस्ट /v1/audio/speechजब आपको एक अलग गति की आवश्यकता होती है।
मूल्य निर्धारण
दोनों मॉडल बिना किसी सदस्यता के आपके जाने के साथ भुगतान करते हैं। इसके इनपुट टेक्स्ट टोकन और इसके जेनरेट किए गए ऑडियो के लिए 32 ऑडियो टोकन प्रति सेकंड भाषण पर एक अनुरोध का बिल भेजा जाता है, और फ्लैश-लाइट में जेनरेट किए गए ऑडियो के लिए कम दर होती है। वर्तमान दरें मॉडल पृष्ठों पर हैं मिथुन 3.8 फ्लैश टीटीएस तथा मिथुन 3.8 फ्लैश-लाइट टीटीएस और पर मूल्य निर्धारण पृष्ठ।.
निर्माण शुरू करें
कोशिश मिथुन 3.8 फ्लैश टीटीएस या मिथुन 3.8 फ्लैश-लाइट टीटीएस Playground में, और इसके लिए एपीआई संदर्भ पढ़ें फ्लैश तथा फ्लैश-लाइट।.
एक ही परिवार से रीयलटाइम वॉयस वार्तालापों के लिए, देखें Gemini 3.8 लाइव और लाइव विस्तारित सोच का उपयोग कैसे करें।.
प्रकटीकरण: यह लेख एआई सहायता के साथ लिखा गया था और EmpirioLabs AI द्वारा समीक्षा की गई थी।.



