
StepFun आधिकारिक आवाज़, कस्टम क्लोन आवाज़ों और वॉयस टैग नियंत्रण के साथ text-to-speech मॉडल।
StepFun आधिकारिक आवाज़, कस्टम क्लोन आवाज़ों और वॉयस टैग नियंत्रण के साथ text-to-speech मॉडल।
चरित्र की गिनती स्टेपफन मूल्य निर्धारण का अनुसरण करती है: एक चीनी वर्ण एक वर्ण के रूप में गिना जाता है, दो अंग्रेजी अक्षर एक वर्ण के रूप में गिने जाते हैं, और दो विराम चिह्न एक वर्ण के रूप में गिने जाते हैं।
इस नाम से भी जाना जाता है StepFun Step TTS 2, Step-TTS-2
step-tts-2/v1/audio/speechstepfun/step-tts-2EmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
Step TTS 2 POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id step-tts-2 के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "step-tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर Step TTS 2 API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | अधिकतम 1000 | संश्लेषित करने के लिए पाठ। अधिकतम 1,000 वर्ण। |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Official StepFun voice. Custom cloned voice IDs are also accepted via the API. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | आउटपुट ऑडियो प्रारूप। |
| speed | number | 1 | 0.5 से 2 | भाषण की गति। |
| volume | number | 1 | 0.1 से 2 | आउटपुट वॉल्यूम। |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | हर्ट्ज में आउटपुट नमूना दर। |
| voice_label | object | - | - | step-tts-2 के लिए भावना और बोलने की शैली के टैग। |
| pronunciation_map | object | - | - | वैकल्पिक उच्चारण मानचित्रण। |
| markdown_filter | boolean | false | - | संश्लेषण से पहले मार्कडाउन सिंटैक्स फ़िल्टर करें। |
अधिकतम इनपुट 1,000 वर्ण है। आधिकारिक वॉयस आईडी, कस्टम क्लोन की गई आवाज़, voice_label भावना टैग और voice_label स्टाइल टैग का समर्थन करता है। निर्देश पैरामीटर केवल stepaudio-2.5-tts के लिए है।
EmpirioLabs पर Step TTS 2 का बिल उपयोग के अनुसार बनता है: संश्लेषण $0.40 प्रति 10,000 वर्ण। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
Step TTS 2 api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में Step TTS 2 को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।