
प्रासंगिक StepFun प्राकृतिक भाषा की आवाज दिशा और अभिव्यंजक वितरण के साथ text-to-speech मॉडल।
प्रासंगिक StepFun प्राकृतिक भाषा की आवाज दिशा और अभिव्यंजक वितरण के साथ text-to-speech मॉडल।
चरित्र की गिनती स्टेपफन मूल्य निर्धारण का अनुसरण करती है: एक चीनी वर्ण एक वर्ण के रूप में गिना जाता है, दो अंग्रेजी अक्षर एक वर्ण के रूप में गिने जाते हैं, और दो विराम चिह्न एक वर्ण के रूप में गिने जाते हैं।
इस नाम से भी जाना जाता है StepAudio TTS, StepFun StepAudio 2.5 TTS, StepAudio-2.5-TTS, stepaudio-2-5-tts
stepaudio-2-5-tts/v1/audio/speechstepaudio-2.5-ttsstepfun/stepaudio-2-5-ttsstepfun/stepaudio-2.5-ttsEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
StepAudio 2.5 TTS POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id stepaudio-2-5-tts के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-2-5-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर StepAudio 2.5 TTS API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | अधिकतम 1000 | संश्लेषित करने के लिए पाठ। अधिकतम 1,000 वर्ण। |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Official StepFun voice. Custom cloned voice IDs are also accepted via the API. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | आउटपुट ऑडियो प्रारूप। |
| speed | number | 1 | 0.5 से 2 | भाषण की गति। |
| volume | number | 1 | 0.1 से 2 | आउटपुट वॉल्यूम। |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | हर्ट्ज में आउटपुट नमूना दर। |
| instruction | string | - | अधिकतम 200 | वैश्विक भावना या शैली मार्गदर्शन। केवल StepAudio 2.5 TTS द्वारा समर्थित। |
| pronunciation_map | object | - | - | वैकल्पिक उच्चारण मानचित्रण। |
| markdown_filter | boolean | false | - | संश्लेषण से पहले मार्कडाउन सिंटैक्स फ़िल्टर करें। |
अधिकतम इनपुट 1,000 वर्ण है। कोष्ठक में सामग्री को दिशा के रूप में माना जाता है और इसे बोला नहीं जाता है। वैश्विक भावना या शैली मार्गदर्शन के लिए निर्देश का उपयोग करें। StepAudio 2.5 TTS voice_label का समर्थन नहीं करता है।
EmpirioLabs पर StepAudio 2.5 TTS का बिल उपयोग के अनुसार बनता है: संश्लेषण $0.85 प्रति 10,000 वर्ण। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
StepAudio 2.5 TTS api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में StepAudio 2.5 TTS को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।