LLM आधारित text-to-speech
इस नाम से भी जाना जाता है Z.ai GLM TTS, GLM-TTS
glm-tts/v1/audio/speechzhipu/glm-ttsEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
GLM TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id glm-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "glm-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर GLM TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | - | संश्लेषित करने के लिए पाठ। मल्टी-स्पीकर के लिए [S1]/[S2] टैग या 'स्पीकर N:' लाइनों का उपयोग करें। |
| voice | enum | emma | emma, james, arthur, xiaomei, zhigang, custom | एम्मा = अंग्रेजी महिला, जेम्स = यूएस पुरुष, आर्थर = यूएस मेल ऑल्ट, ज़ियाओमी = चीनी महिला, ज़िगांग = चीनी पुरुष, कस्टम = voice_audio_url के माध्यम से संदर्भ अपलोड करें। |
| voice_audio_url | string | - | - | कस्टम वॉयस क्लोनिंग के लिए संदर्भ ऑडियो URL। संदर्भ रिकॉर्डिंग में वक्ता को इस सटीक सहमति वाक्यांश को अपनी आवाज में जोर से पढ़ना शामिल होना चाहिए: "मैं सिंथेटिक भाषण... |
| output_format | enum | mp3 | mp3, wav | आउटपुट मीडिया फ़ाइल स्वरूप (mp3, wav, mp4, png, jpg, आदि, समापन बिंदु के आधार पर)। |
| speed | number | 1 | 0.5 से 2 | बोलने की दर गुणक। |
| model_quality | enum | quality | quality, fast | गुणवत्ता = FP16 (बेहतर), तेजी से = INT8 (तेज) |
| sample_rate | enum | 24000 | 24000, 16000 | हर्ट्ज में आउटपुट नमूना दर। |
| volume | number | 1 | 0.1 से 2 | आउटपुट लाभ गुणक। |
| use_cache | boolean | true | - | बार-बार समान पीढ़ियों को गति देता है। |
| optimize_input | boolean | true | - | तकनीकी शब्दों, परिवर्णी शब्दों और विशेष वर्णों का ऑटो-फिक्स उच्चारण। |
| seed | number | - | - | प्रजनन क्षमता बीज। |
** Limits* - मैक्स इनपुट: 5,000 वर्ण - जनरेशन: 5-10 मिनट ** Voice cloning* - संदर्भ ऑडियो: 3-10 सेकंड - स्वीकृत प्रारूप: WAV, MP3, OGG, FLAC, AAC, M4A, WebM ** प्रीसेट आवाज* - emma (English F) - james (US M) - आर्थर (UK M) - xiaomei (चीनी F) - zhigang (चीनी M)
EmpirioLabs पर GLM TTS का बिल उपयोग के अनुसार बनता है: फास्ट (INT8) $0.20 प्रति 1k वर्ण; गुणवत्ता (FP16) $0.21 प्रति 1k वर्ण। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
GLM TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में GLM TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।