
توليف الكلام على مستوى الإنسان عبر ست لغات، مع 12 صوتا نظاميا، توجيه توصيل اللغة الطبيعية، وتشغيل متدفق.
توليف الكلام على مستوى الإنسان عبر ست لغات، مع 12 صوتا نظاميا، توجيه توصيل اللغة الطبيعية، وتشغيل متدفق.
يتم عد الأحرف وفقا لتسعير StepFun: حرف صيني واحد يحسب كحرف واحد، وحرفين إنجليزيين كحرف واحد، وعلامتان علامات ترقيم تحتسب كحرف واحد.
يعرف أيضا باسم StepFun StepAudio 3 TTS
stepaudio-3-tts/v1/audio/speechPOST/v1/audio/speech:streamstepfun/stepaudio-3-ttsأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يولّد StepAudio 3 TTS الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج stepaudio-3-tts. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)معلمات الطلب التي تدعمها واجهة StepAudio 3 TTS API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| input | string | - | الحد الأقصى 1000 | النص لتركيبه. الحد الأقصى 1000 حرف. المحتوى بين قوسين يعامل كاتجاه تسليم ولا يقال بقوة. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | الصوت الرسمي للعبة StepFun. يتم أيضا قبول معرفات الصوت المستنسخة المخصصة عبر واجهة برمجة التطبيقات (API). |
| instruction | string | - | الحد الأقصى 500 | إرشادات العاطفة أو الأسلوب العام للفقرة بأكملها، بلغة طبيعية. الحد الأقصى 500 حرف. |
| speed | number | 1 | 0.5 إلى 2 | سرعة الكلام. |
| volume | number | 1 | 0.1 إلى 2 | حجم الإخراج. |
| language | enum | en | en, zh, ja, ko, fr, es | اللغة المستهدفة. اليابانية، الكورية، الفرنسية، والإسبانية في مرحلة المعاينة. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | صيغة الصوت المخرج. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | معدل العينة الناتج بالهرتز. |
| markdown_filter | boolean | false | - | قم بإزالة صياغة ماركداون من المدخل قبل أن ينطق. |
| pronunciation_map | string | - | - | النطق الاختياري يتجاوز كجسم يحتوي على مصفوفة نغمات من قواعد "written/spoken". |
الحد الأقصى للمدخلات هو 1,000 حرف. المحتوى بين قوسين يعامل كاتجاه تسليم ولا يتحدث معه. استخدم التعليمات لتوجيه المشاعر أو الأسلوب العام، حتى 500 حرف. يتوفر اثنا عشر صوتا نظاميا، كما يقبل معرف صوتي مستنسخ مخصص. اللغات المعترف بها هي الصينية، الإنجليزية، اليابانية، الكورية، الفرنسية، والإسبانية، مع لغات غير الصينية والإنجليزية في المعاينة. صيغ الإخراج هي mp3، wav، flac، opus، و pcm عند 8000، 16000، 22050، أو 24000 هرتز. يتم إرجاع Wav كملف كامل بدلا من البث. هذا النموذج لا يدعم voice_label.
على EmpirioLabs، تتم فوترة StepAudio 3 TTS حسب الاستخدام: التركيب $0.36 لكل 10,000 حرف. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم StepAudio 3 TTS عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج StepAudio 3 TTS في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.