
نموذج صوتي مفتوح المصدر لحوارات بودكاست طويلة الشكل متعددة مكبرات الصوت مع تحكم شبه لغوي (ضحك، تنهدات) واستنساخ صوتي بدون فرصة.
نموذج صوتي مفتوح المصدر لحوارات بودكاست طويلة الشكل متعددة مكبرات الصوت مع تحكم شبه لغوي (ضحك، تنهدات) واستنساخ صوتي بدون فرصة.
يعرف أيضا باسم Soul AI Lab SoulX Podcast
soulx-podcast/v1/audio/speechsoul-ai-lab/soulx-podcastأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يولّد SoulX Podcast الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج soulx-podcast. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "soulx-podcast",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "soulx-podcast", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)معلمات الطلب التي تدعمها واجهة SoulX Podcast API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| input | string | - | - | نص البودكاست. استخدم وسوم [S1] / [S2] / [S3] / [S4] أو أسطر 'مكبر الصوت N:' للمكبرات المتعددة. الوسوم اللالغوية مدعومة: <|ضحك|>، <|تنهد|>، <|تنفس|>، <|سعال|>. |
| voice_model | enum | base | base, dialect | القاعدة: الإنجليزية + الماندرين. اللهجة: تضيف سيتشوان، خنان، وكانتونية. |
| voice_s1 | enum | arthur | arthur, james, lj, xiaomei, zhigang, custom_s1 | صوت ل [S1]. lj = إيما. custom_s1 يتطلب voice_s1_audio_url. |
| voice_s2 | enum | lj | arthur, james, lj, xiaomei, zhigang, custom_s2 | صوت ل [S2]. lj = إيما. |
| voice_s3 | enum | james | arthur, james, lj, xiaomei, zhigang, custom_s3 | صوت ل [S3]. |
| voice_s4 | enum | xiaomei | arthur, james, lj, xiaomei, zhigang, custom_s4 | الصوت ل [S4]. |
| voice_s1_audio_url | string | - | - | رابط الصوت المرجعي لاستنساخ الصوت المخصص [S1]. يجب على المتحدث قول عبارة الموافقة بصوت عال. |
| voice_s2_audio_url | string | - | - | رابط الصوت المرجعي لاستنساخ الصوت المخصص [S2]. |
| voice_s3_audio_url | string | - | - | رابط صوتي مرجعي لاستنساخ الصوت المخصص [S3]. |
| voice_s4_audio_url | string | - | - | رابط الصوت المرجعي لاستنساخ الصوت المخصص [S4]. |
| temperature | number | 0.6 | 0.1 إلى 2 | أخذ عينات من درجة الحرارة. |
| top_k | number | 100 | 1 إلى 500 | غطاء أخذ عينات من الأعلى. |
| top_p | number | 0.9 | 0.1 إلى 1 | أخذ عينات من النواة. |
| repetition_penalty | number | 1.25 | 1 إلى 2 | القيم الأعلى تثبط تكرار العبارات. |
نموذج صوتي مفتوح المصدر لحوارات بودكاست طويلة الشكل متعددة المتحدثين مع تحكم ما بعد اللغة واستنساخ صوتي بدون طلقة.
على EmpirioLabs، تتم فوترة SoulX Podcast حسب الاستخدام: القاعدة $0.015 لكل 1000 حرف; اللهجة $0.015 لكل 1000 حرف. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم SoulX Podcast عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج SoulX Podcast في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.