घर ब्लॉग

StepAudio 3 TTS API का उपयोग कैसे करें

एपीआई कवर के माध्यम से स्टेपऑडियो 3 टीटीएस

Sep 15, 2026

EmpirioLabs AI

संक्षिप्त उत्तर: स्टेपऑडियो 3 टीटीएस StepFun का प्रमुख text-to-speech मॉडल है, जो मानक OpenAI-शैली भाषण समापन बिंदु के माध्यम से EmpirioLabs पर उपलब्ध है। अधिकतम 1,000 वर्ण भेजें पोस्ट /v1/audio/speech साथ मॉडल: "stepaudio-3-tts", बारह सिस्टम आवाज़ों में से एक चुनें, और उस डिलीवरी का वर्णन करें जिसे आप साधारण अंग्रेजी में चाहते हैं शिक्षण-प्रशिक्षण।.

आपका पहला अनुरोध

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "प्राधिकरण: वाहक $EMPIRIOLABS_API_KEY" \ -h "सामग्री-प्रकार: application/json" \ -d '{ "मॉडल": "stepaudio-3-tts", "इनपुट": "आपकी कॉल कनेक्ट की जा रही है। प्रतीक्षा करने के लिए धन्यवाद। ", "आवाज": "जीवंत-लड़की" }'

प्रतिक्रिया उत्पन्न ऑडियो के लिए एक हस्ताक्षरित URL ले जाती है। डिफ़ॉल्ट प्रारूप 3 हर्ट्ज पर एमपी24,000 है।

आवाज चुनना

मॉडल के साथ बारह सिस्टम आवाजें जहाज करती हैं। स्टेपऑडियो 2.5 से सात कैरी ओवर हैं, और पांच नए हैं: अल्फी, एथन, मैथ्यू, किंगशुनव्शेंग, और तियानरुनवशेंग।.

आवाजचरित्रके लिये अच्छा है
जीवंत-लड़कीउज्ज्वल, ऊर्जावान महिलासहायक, उत्पाद पूर्वाभ्यास
जीवंत-युवागर्म युवा पुरुषऑडियोबुक, वीडियो डबिंग
soft-spoken-gentlemanशांत, सौम्य पुरुषलंबे समय तक वर्णन
magnetic-voiced-maleगहरा, वजनदार पुरुषट्रेलर, नाटकीय रीडिंग
सुरुचिपूर्णसज्जन-महिलाईमानदार, आश्वस्त करने वाली महिलासमर्थन लाइनें, शिक्षा
जीवंत हवा-महिलाहल्का और प्रेरकविपणन, लघु वीडियो
ज़िक्सिनानशेंगआत्मविश्वासी पुरुषऑडियोबुक, प्रशिक्षण

पूरी सूची इस पर है मॉडल संदर्भ. एक कस्टम क्लोन की गई वॉयस आईडी उसी फ़ील्ड में स्वीकार की जाती है।

वितरण का निर्देशन

प्रीसेट इमोशन टैग के बजाय, आप वही लिखते हैं जो आप चाहते हैं और मॉडल इसे करता है। शिक्षण-प्रशिक्षण पूरे मार्ग के लिए टोन सेट करता है और 500 वर्णों तक स्वीकार करता है।

{ "मॉडल": "stepaudio-3-tts", "इनपुट": "हमें लॉग में कुछ मिला", "आवाज": "magnetic-voiced-male", "निर्देश": "ट्रेलर की आवाज की तरह धीमा और जानबूझकर। विराम को उतरने दें।

एक शब्द या वाक्यांश के लिए, दिशा को कोष्ठक में अंदर रखें इनपुट इसके बजाय।

भाषाओं

सेट भाषा सेवा मेरे करवाना, जेडएच, जा, को, एफआर, या एस. जापानी, कोरियाई, फ्रेंच और स्पेनिश पूर्वावलोकन में हैं। इसे छोड़ दें और मॉडल अंग्रेजी पढ़ता है।

आउटपुट स्वरूप

चुनें एमपी3, लहर, एफएलएसी, रचना, या पीसीएम साथ response_format, और सेट करें sample_rate 8000, 16000, 22050, या 24000 तक।

तीन चीजें जो लोगों को पकड़ती हैं

  1. कोष्ठक दिशा हैं, शब्द नहीं। अंदर कुछ भी () में इनपुट एक वितरण क्यू के रूप में पढ़ा जाता है और कभी नहीं बोला जाता है। यदि आपको ब्रैकेट की आवश्यकता है तो जोर से पढ़ें, इसे कोष्ठक के बिना फिर से लिखें।
  2. इस मॉडल पर 48,000 हर्ट्ज उपलब्ध नहीं है। यह कुछ सामान्य text-to-speech दस्तावेज़ीकरण में दिखाई देता है, लेकिन StepAudio 3 TTS इसे अस्वीकार कर देता है। उच्चतम गुणवत्ता के लिए 24,000 हर्ट्ज पर रहें।
  3. शिक्षण-प्रशिक्षण तथा voice_label विनिमेय नहीं हैं। StepAudio 3 TTS लेता है शिक्षण-प्रशिक्षण और अस्वीकार करता है voice_label. चरण टीटीएस 2 इसके विपरीत है। उनके बीच अनुरोध को पोर्ट करने का अर्थ है उस फ़ील्ड की अदला-बदली करना।

मूल्य निर्धारण और सीमाएं

बिलिंग इनपुट के प्रति चरित्र है, जैसे ही आप जाते हैं, बिना किसी सदस्यता और न्यूनतम के भुगतान करें। एक चीनी वर्ण एक वर्ण के रूप में गिना जाता है, और दो अंग्रेजी अक्षर एक के रूप में गिने जाते हैं। लाइव दर पर है मॉडल पेज और मूल्य निर्धारण पृष्ठ. अनुरोध 1,000 वर्णों की सीमा तय करता है, इसलिए लंबी स्क्रिप्ट को वाक्य-आकार की कॉल में विभाजित करें और ऑडियो में स्वयं शामिल हों।

कोड लिखे बिना इसे आज़माएं

खुला playground में स्टेपऑडियो 3 टीटीएस आवाज़ों और निर्देशों का ऑडिशन करने के लिए, फिर सेटिंग को अपने अनुरोध में कॉपी करें। पूर्ण पैरामीटर संदर्भ: docs.empiriolabs.ai/models/stepaudio-3-tts।.

बेहतर समापन बिंदुओं का उपयोग करने के लिए तैयार हैं?

हमारे मॉडलों का अन्वेषण करें, या व्यावसायिक पूछताछ, कस्टम परिनियोजन, या किसी भी अन्य चीज़ के बारे में हमसे संपर्क करें।