घर ब्लॉग

जेमिनी 3.8 फ्लैश टीटीएस और फ्लैश-लाइट टीटीएस का उपयोग कैसे करें

जेमिनी 3.8 फ्लैश टीटीएस और फ्लैश-लाइट टीटीएस एपीआई के माध्यम से

Sep 23, 2026

EmpirioLabs AI

जेमिनी 3.8 फ्लैश टीटीएस और जेमिनी 3.8 फ्लैश-लाइट टीटीएस EmpirioLabs पर उपलब्ध हैं। दोनों पाठ को भाषण में बदल देते हैं पोस्ट /v1/audio/speech, ऑडियो स्ट्रीम करें पोस्ट /v1/audio/speech:stream, और 2,000 से अधिक आवाज़ों की एक ही लाइब्रेरी पर ड्रा करें। दोनों एपीआई और Playground में काम करते हैं।

दो मॉडल

  • gemini-3-8-flash-tts रचनात्मक निर्देशन के लिए बनाया गया है: कथन, ऑडियोबुक, पात्र और दो-वक्ता दृश्य। इसमें 130 भाषाएँ शामिल हैं।
  • gemini-3-8-flash-lite-tts उच्च मात्रा वाले काम जैसे वॉयस एजेंट, डबिंग और बल्क ऑडियो के लिए बनाया गया है, जिसमें जेनरेट किए गए ऑडियो के लिए कम दर है। इसमें 101 भाषाएँ शामिल हैं।

दोनों मॉडल एक ही अनुरोध निकाय लेते हैं, इसलिए उनके बीच स्विच करना एक परिवर्तन है मॉडल।.

आपका पहला अनुरोध

कर्ल https://api.empiriolabs.ai/v1/audio/speech \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "gemini-3-8-flash-tts", "इनपुट": "वापस आपका स्वागत है। <छोटा विराम> यहाँ इस सप्ताह क्या बदल गया है। ", "आवाज": "कोरे", "style_prompt": "गर्म और जल्दबाजी" }'

प्रतिक्रिया उत्पन्न ऑडियो के लिए एक हस्ताक्षरित URL ले जाती है। डिफ़ॉल्ट प्रारूप 24,000 हर्ट्ज पर WAV है। सेट output_format सेवा मेरे एमपी3, ओजीजी, एएलएडब्ल्यू, या मुलव, और sample_rate 8,000, 16,000, 22,050, 24,000, 44,100, या 48,000 हर्ट्ज में से किसी के लिए।

प्रदर्शन का निर्देशन

  • शैली की दिशा। style_prompt पूरे मार्ग के लिए टोन सेट करता है, उदाहरण के लिए "शांत और आश्वस्त" या "उत्साहित खेल कमेंटेटर"।
  • मुखर टैग। टैग जैसे <laugh>, <sigh>, <breath>, और <छोटा विराम> इनलाइन पर जाएं जहां ध्वनि होनी चाहिए। पूरी सूची पर है इनपुट पैरामीटर मॉडल संदर्भ में। अंग्रेजी टैग का उपयोग तब भी करें जब पाठ किसी अन्य भाषा में हो।
  • जोर। किसी शब्द को जोर देने के लिए उसे बड़े अक्षरों में लिखें।

दो-वक्ता संवाद

सेट मोड समूह सेवा मेरे बहु, प्रत्येक स्पीकर के लिए एक आवाज चुनें आवाज तथा आवाज2, और प्रत्येक पंक्ति को स्पीकर के नाम और कोलन से शुरू करें। नाम मेल खाने चाहिए speaker1_name तथा speaker2_name, जो डिफ़ॉल्ट रूप से वक्ता1 तथा वक्ता2।.

{ "मॉडल": "gemini-3-8-flash-lite-tts", "मोड": "मल्टी", "speaker1_name": "माया", "speaker2_name": "थियो", "आवाज": "एओडे", "वॉयस2": "पक", "इनपुट": "माया: क्या शिपमेंट आ गया?\nथियो: यह हुआ।<laugh> हर बॉक्स, समय पर।

आवाज चुनना

30 में आवाजें आवाज सूची, जैसे कोरे, पक, चारोन और एओडे, हर समर्थित भाषा बोलते हैं। पूरी लाइब्रेरी में 30 स्थानों पर 2,000 से अधिक आवाज़ें हैं, जिनमें से प्रत्येक में एक भाषा, उच्चारण, लिंग, पिच और विवरण है। इसे इसके साथ सूचीबद्ध करें /v1/voices और द्वारा फ़िल्टर करें भाषा, लिंग, पिच, या इसके साथ एक खोज शब्द प्रश्‍न:

कर्ल "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY"

कोई भी वॉयस आईडी जिसमें लिस्टिंग रिटर्न करती है, काम करती है आवाज तथा आवाज2।.

स्ट्रीमिंग

पोस्ट /v1/audio/speech:stream एक ही बॉडी लेता है और सर्वर-भेजे गए ईवेंट लौटाता है: ऑडियो.चंक ऑडियो उत्पन्न होने के रूप में 24,000 हर्ट्ज पर बेस 64 16-बिट पीसीएम ले जाने वाली घटनाएं, फिर एक ऑडियो.डन अनुरोधित प्रारूप में पूरी फ़ाइल के लिंक के साथ ईवेंट।

परिचालन नोट्स

  1. Gemini 3.1 Flash TTS के लिए लिखी गई स्क्रिप्ट को उनके टैग को फिर से लिखने की आवश्यकता होती है. 3.8 मॉडल कोण-ब्रैकेट टैग का उपयोग करते हैं जैसे <whispers> तथा <laugh> वर्ग-ब्रैकेट टैग के बजाय 3.1 का उपयोग करता है। जब आप किसी स्क्रिप्ट को पार ले जाते हैं तो टैग अपडेट करें।
  2. एक पुस्तकालय की आवाज अपनी भाषा रखती है। जब आप सेट करते हैं भाषा एक पुस्तकालय आवाज के साथ, यह उस आवाज का स्थान होना चाहिए: fr-fr-advisor-1 साथ एन-यूएस अस्वीकार कर दिया जाता है। 30 बहुभाषी आवाजें किसी भी भाषा को स्वीकार करती हैं।
  3. संवाद लेबल वक्ता के नामों से मेल खाना चाहिए। में बहु मोड, पहली लेबल की गई पंक्ति से पहले पाठ को अस्वीकार कर दिया जाता है, और एक पंक्ति जिसका लेबल न तो मेल खाता है speaker1_name न ही speaker2_name पिछले मोड़ के हिस्से के रूप में पढ़ा जाता है।
  4. रफ़्तार पूर्ण फ़ाइलों पर लागू होता है। स्ट्रीमिंग समापन बिंदु एक को अस्वीकार करता है रफ़्तार 1.0 के अलावा। फ़ाइल का अनुरोध करें पोस्ट /v1/audio/speech जब आपको एक अलग गति की आवश्यकता होती है।

मूल्य निर्धारण

दोनों मॉडल बिना किसी सदस्यता के आपके जाने के साथ भुगतान करते हैं। इसके इनपुट टेक्स्ट टोकन और इसके जेनरेट किए गए ऑडियो के लिए 32 ऑडियो टोकन प्रति सेकंड भाषण पर एक अनुरोध का बिल भेजा जाता है, और फ्लैश-लाइट में जेनरेट किए गए ऑडियो के लिए कम दर होती है। वर्तमान दरें मॉडल पृष्ठों पर हैं मिथुन 3.8 फ्लैश टीटीएस तथा मिथुन 3.8 फ्लैश-लाइट टीटीएस और पर मूल्य निर्धारण पृष्ठ।.

निर्माण शुरू करें

कोशिश मिथुन 3.8 फ्लैश टीटीएस या मिथुन 3.8 फ्लैश-लाइट टीटीएस Playground में, और इसके लिए एपीआई संदर्भ पढ़ें फ्लैश तथा फ्लैश-लाइट।.

एक ही परिवार से रीयलटाइम वॉयस वार्तालापों के लिए, देखें Gemini 3.8 लाइव और लाइव विस्तारित सोच का उपयोग कैसे करें।.

प्रकटीकरण: यह लेख एआई सहायता के साथ लिखा गया था और EmpirioLabs AI द्वारा समीक्षा की गई थी।.

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मॉडलों का अन्वेषण करें, या व्यावसायिक पूछताछ, कस्टम परिनियोजन, या किसी भी अन्य चीज़ के बारे में हमसे संपर्क करें।