संक्षिप्त उत्तर: स्टेपऑडियो 3 टीटीएस StepFun का प्रमुख text-to-speech मॉडल है, जो मानक OpenAI-शैली भाषण समापन बिंदु के माध्यम से EmpirioLabs पर उपलब्ध है। अधिकतम 1,000 वर्ण भेजें पोस्ट /v1/audio/speech साथ मॉडल: "stepaudio-3-tts", बारह सिस्टम आवाज़ों में से एक चुनें, और उस डिलीवरी का वर्णन करें जिसे आप साधारण अंग्रेजी में चाहते हैं शिक्षण-प्रशिक्षण।.
आपका पहला अनुरोध
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "stepaudio-3-tts", "इनपुट": "आपकी कॉल कनेक्ट की जा रही है। प्रतीक्षा करने के लिए धन्यवाद। ", "आवाज": "जीवंत-लड़की" }'
प्रतिक्रिया उत्पन्न ऑडियो के लिए एक हस्ताक्षरित URL ले जाती है। डिफ़ॉल्ट प्रारूप 3 हर्ट्ज पर एमपी24,000 है।
आवाज चुनना
मॉडल के साथ बारह सिस्टम आवाजें जहाज करती हैं। स्टेपऑडियो 2.5 से सात कैरी ओवर हैं, और पांच नए हैं: अल्फी, एथन, मैथ्यू, किंगशुनव्शेंग, और तियानरुनवशेंग।.
| आवाज | चरित्र | के लिये अच्छा है |
|---|---|---|
जीवंत-लड़की | उज्ज्वल, ऊर्जावान महिला | सहायक, उत्पाद पूर्वाभ्यास |
जीवंत-युवा | गर्म युवा पुरुष | ऑडियोबुक, वीडियो डबिंग |
soft-spoken-gentleman | शांत, सौम्य पुरुष | लंबे समय तक वर्णन |
magnetic-voiced-male | गहरा, वजनदार पुरुष | ट्रेलर, नाटकीय रीडिंग |
सुरुचिपूर्णसज्जन-महिला | ईमानदार, आश्वस्त करने वाली महिला | समर्थन लाइनें, शिक्षा |
जीवंत हवा-महिला | हल्का और प्रेरक | विपणन, लघु वीडियो |
ज़िक्सिनानशेंग | आत्मविश्वासी पुरुष | ऑडियोबुक, प्रशिक्षण |
पूरी सूची इस पर है मॉडल संदर्भ. एक कस्टम क्लोन की गई वॉयस आईडी उसी फ़ील्ड में स्वीकार की जाती है।
वितरण का निर्देशन
प्रीसेट इमोशन टैग के बजाय, आप वही लिखते हैं जो आप चाहते हैं और मॉडल इसे करता है। शिक्षण-प्रशिक्षण पूरे मार्ग के लिए टोन सेट करता है और 500 वर्णों तक स्वीकार करता है।
{ "मॉडल": "stepaudio-3-tts", "इनपुट": "हमें लॉग में कुछ मिला", "आवाज": "magnetic-voiced-male", "निर्देश": "ट्रेलर की आवाज की तरह धीमा और जानबूझकर। विराम को उतरने दें।
एक शब्द या वाक्यांश के लिए, दिशा को कोष्ठक में अंदर रखें इनपुट इसके बजाय।
भाषाओं
सेट भाषा सेवा मेरे करवाना, जेडएच, जा, को, एफआर, या एस. जापानी, कोरियाई, फ्रेंच और स्पेनिश पूर्वावलोकन में हैं। इसे छोड़ दें और मॉडल अंग्रेजी पढ़ता है।
आउटपुट स्वरूप
चुनें एमपी3, लहर, एफएलएसी, रचना, या पीसीएम साथ response_format, और सेट करें sample_rate 8000, 16000, 22050, या 24000 तक।
तीन चीजें जो लोगों को पकड़ती हैं
- कोष्ठक दिशा हैं, शब्द नहीं। अंदर कुछ भी
()मेंइनपुटएक वितरण क्यू के रूप में पढ़ा जाता है और कभी नहीं बोला जाता है। यदि आपको ब्रैकेट की आवश्यकता है तो जोर से पढ़ें, इसे कोष्ठक के बिना फिर से लिखें। - इस मॉडल पर 48,000 हर्ट्ज उपलब्ध नहीं है। यह कुछ सामान्य text-to-speech दस्तावेज़ीकरण में दिखाई देता है, लेकिन StepAudio 3 TTS इसे अस्वीकार कर देता है। उच्चतम गुणवत्ता के लिए 24,000 हर्ट्ज पर रहें।
शिक्षण-प्रशिक्षणतथाvoice_labelविनिमेय नहीं हैं। StepAudio 3 TTS लेता हैशिक्षण-प्रशिक्षणऔर अस्वीकार करता हैvoice_label. चरण टीटीएस 2 इसके विपरीत है। उनके बीच अनुरोध को पोर्ट करने का अर्थ है उस फ़ील्ड की अदला-बदली करना।
मूल्य निर्धारण और सीमाएं
बिलिंग इनपुट के प्रति चरित्र है, जैसे ही आप जाते हैं, बिना किसी सदस्यता और न्यूनतम के भुगतान करें। एक चीनी वर्ण एक वर्ण के रूप में गिना जाता है, और दो अंग्रेजी अक्षर एक के रूप में गिने जाते हैं। लाइव दर पर है मॉडल पेज और मूल्य निर्धारण पृष्ठ. अनुरोध 1,000 वर्णों की सीमा तय करता है, इसलिए लंबी स्क्रिप्ट को वाक्य-आकार की कॉल में विभाजित करें और ऑडियो में स्वयं शामिल हों।
कोड लिखे बिना इसे आज़माएं
खुला playground में स्टेपऑडियो 3 टीटीएस आवाज़ों और निर्देशों का ऑडिशन करने के लिए, फिर सेटिंग को अपने अनुरोध में कॉपी करें। पूर्ण पैरामीटर संदर्भ: docs.empiriolabs.ai/models/stepaudio-3-tts।.



