
लॉन्ग-फॉर्म के लिए ओपन-सोर्स वॉयस मॉडल, बहु-स्पीकर पॉडकास्ट संवाद पैरालैंगिक नियंत्रण (वध, sighs) और शून्य-शॉट वॉयस क्लोनिंग के साथ।
लॉन्ग-फॉर्म के लिए ओपन-सोर्स वॉयस मॉडल, बहु-स्पीकर पॉडकास्ट संवाद पैरालैंगिक नियंत्रण (वध, sighs) और शून्य-शॉट वॉयस क्लोनिंग के साथ।
इस नाम से भी जाना जाता है Soul AI Lab SoulX Podcast
soulx-podcast/v1/audio/speechsoul-ai-lab/soulx-podcastEmpirioLabs कैटलॉग से लाइव pay-as-you-go दरें। आप सिर्फ उतना ही भुगतान करते हैं जितना उपयोग करते हैं, कोई मासिक न्यूनतम नहीं।
SoulX Podcast POST /v1/audio/speech से आवाज़ बनाता है और चलाने योग्य ऑडियो देता है। बोला जाने वाला टेक्स्ट input के रूप में model id soulx-podcast के साथ भेजें। EmpirioLabs डैशबोर्ड से API key प्राप्त करें।
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "soulx-podcast",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "soulx-podcast", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs पर SoulX Podcast API द्वारा समर्थित request पैरामीटर। फ़ील्ड छोड़ने पर डिफ़ॉल्ट मान लागू होते हैं।
| पैरामीटर | प्रकार | डिफॉल्ट | रेंज / मान | विवरण |
|---|---|---|---|---|
| input | string | - | - | पॉडकास्ट स्क्रिप्ट। मल्टी-स्पीकर के लिए [S1]/[S2]/[S3]/[S4] टैग या 'स्पीकर N:' लाइनों का उपयोग करें। पैरालिंग्विस्टिक टैग समर्थित: <|हँसी|>, <|आह|>, <|साँस|>, <|खांसी|>। |
| voice_model | enum | base | base, dialect | आधार: अंग्रेजी + मंदारिन। बोली: सिचुआन, हेनान और कैंटोनीज़ कहते हैं। |
| voice_s1 | enum | arthur | arthur, james, lj, xiaomei, zhigang, custom_s1 | [S1] के लिए आवाज। एलजे = एम्मा। custom_s1 voice_s1_audio_url की आवश्यकता है। |
| voice_s2 | enum | lj | arthur, james, lj, xiaomei, zhigang, custom_s2 | [S2] के लिए आवाज। एलजे = एम्मा। |
| voice_s3 | enum | james | arthur, james, lj, xiaomei, zhigang, custom_s3 | [S3] के लिए आवाज। |
| voice_s4 | enum | xiaomei | arthur, james, lj, xiaomei, zhigang, custom_s4 | [S4] के लिए आवाज। |
| voice_s1_audio_url | string | - | - | [S1] कस्टम-वॉयस क्लोनिंग के लिए ऑडियो URL का संदर्भ लें। अध्यक्ष को सहमति वाक्यांश को जोर से कहना चाहिए। |
| voice_s2_audio_url | string | - | - | [S2] कस्टम-वॉयस क्लोनिंग के लिए ऑडियो URL का संदर्भ लें। |
| voice_s3_audio_url | string | - | - | [S3] कस्टम-वॉयस क्लोनिंग के लिए ऑडियो URL का संदर्भ लें। |
| voice_s4_audio_url | string | - | - | [S4] कस्टम-वॉयस क्लोनिंग के लिए संदर्भ ऑडियो URL। |
| temperature | number | 0.6 | 0.1 से 2 | नमूना तापमान। |
| top_k | number | 100 | 1 से 500 | टॉप-के सैंपलिंग कैप। |
| top_p | number | 0.9 | 0.1 से 1 | नाभिक नमूनाकरण। |
| repetition_penalty | number | 1.25 | 1 से 2 | उच्च मूल्य बार-बार वाक्यांश को हतोत्साहित करते हैं। |
लॉन्ग-फॉर्म के लिए ओपन-सोर्स वॉयस मॉडल, पैरालॉजिकल कंट्रोल और शून्य-शॉट वॉयस क्लोनिंग के साथ मल्टी-स्पीकर पॉडकास्ट संवाद।
EmpirioLabs पर SoulX Podcast का बिल उपयोग के अनुसार बनता है: बेस $0.015 प्रति 1k वर्ण; डायलेक्ट $0.015 प्रति 1k वर्ण। इस पेज की लाइव दर तालिका हमेशा API की वास्तविक बिलिंग से मेल खाती है।
SoulX Podcast api.empiriolabs.ai पर POST /v1/audio/speech के ज़रिए मिलता है, मानक Bearer टोकन प्रमाणीकरण के साथ।
हां। EmpirioLabs playground ब्राउज़र में SoulX Podcast को उन्हीं पैरामीटरों के साथ चलाता है जो API देता है, ताकि आप कोड लिखने से पहले prompt आज़मा सकें।
EmpirioLabs खाता बनाएं, फिर डैशबोर्ड में API Keys में key जनरेट करें। बिलिंग pay-as-you-go क्रेडिट से होती है, इसलिए आप सिर्फ अपनी requests का भुगतान करते हैं।
हमारे मूल्य निर्धारण की जाँच करें या यदि आप चाहते हैं कि आपका अपना मॉडल हमारे स्टैक पर तैनात किया जाए, तो पहुंचें।