
छह भाषाओं में मानव-स्तरीय भाषण संश्लेषण, 12 सिस्टम आवाजों, प्राकृतिक-भाषा वितरण दिशा और स्ट्रीमिंग प्लेबैक के साथ।
छह भाषाओं में मानव-स्तरीय भाषण संश्लेषण, 12 सिस्टम आवाजों, प्राकृतिक-भाषा वितरण दिशा और स्ट्रीमिंग प्लेबैक के साथ।
चरित्र की गिनती स्टेपफन मूल्य निर्धारण का अनुसरण करती है: एक चीनी वर्ण एक वर्ण के रूप में गिना जाता है, दो अंग्रेजी अक्षर एक वर्ण के रूप में गिने जाते हैं, और दो विराम चिह्न एक वर्ण के रूप में गिने जाते हैं।
इस नाम से भी जाना जाता है StepFun StepAudio 3 TTS
stepaudio-3-tts/v1/audio/speechPOST/v1/audio/speech:streamstepfun/stepaudio-3-ttsEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
StepAudio 3 TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id stepaudio-3-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर StepAudio 3 TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | अधिकतम 1000 | संश्लेषित करने के लिए पाठ. अधिकतम 1,000 वर्ण. कोष्ठक में सामग्री को वितरण दिशा के रूप में माना जाता है और इसे बोला नहीं जाता है. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | आधिकारिक StepFun आवाज। कस्टम क्लोन की गई वॉयस आईडी भी एपीआई के माध्यम से स्वीकार की जाती हैं। |
| instruction | string | - | अधिकतम 500 | पूरे मार्ग के लिए वैश्विक भावना या शैली मार्गदर्शन, प्राकृतिक भाषा में। अधिकतम 500 वर्ण। |
| speed | number | 1 | 0.5 से 2 | भाषण की गति। |
| volume | number | 1 | 0.1 से 2 | आउटपुट वॉल्यूम। |
| language | enum | en | en, zh, ja, ko, fr, es | लक्ष्य भाषा। जापानी, कोरियाई, फ्रेंच और स्पेनिश पूर्वावलोकन में हैं। |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | आउटपुट ऑडियो प्रारूप। |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | हर्ट्ज में आउटपुट नमूना दर। |
| markdown_filter | boolean | false | - | बोलने से पहले इनपुट से मार्कडाउन सिंटैक्स को हटा दें। |
| pronunciation_map | string | - | - | वैकल्पिक उच्चारण ओवरराइड करता है, "written/spoken" नियमों की टोन सरणी के साथ एक वस्तु के रूप में। |
अधिकतम इनपुट 1,000 वर्ण है। कोष्ठक में सामग्री को वितरण दिशा के रूप में माना जाता है और इसे बोला नहीं जाता है। वैश्विक भावना या शैली मार्गदर्शन के लिए निर्देश का उपयोग करें, 500 वर्णों तक। बारह सिस्टम आवाज़ें उपलब्ध हैं, और एक कस्टम क्लोन की गई वॉयस आईडी भी स्वीकार की जाती है। मान्यता प्राप्त भाषाएँ चीनी, अंग्रेजी, जापानी, कोरियाई, फ्रेंच और स्पेनिश हैं, पूर्वावलोकन में चीनी और अंग्रेजी के अलावा अन्य भाषाएँ हैं। आउटपुट स्वरूप mp3, wav, flac, opus और pcm 8000, 16000, 22050 या 24000 Hz पर हैं। Wav को स्ट्रीम करने के बजाय एक पूर्ण फ़ाइल के रूप में लौटाया जाता है। यह मॉडल voice_label का समर्थन नहीं करता है।
EmpirioLabs पर StepAudio 3 TTS का बिल उपयोग के अनुसार बनता है: संश्लेषण $0.36 प्रति 10,000 वर्ण। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
StepAudio 3 TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में StepAudio 3 TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।