
تولد الحوارات، والمؤثرات الصوتية، والأجواء، والموسيقى الخلفية معا في مقطع واحد من مشهد مكتوب.
تولد الحوارات، والمؤثرات الصوتية، والأجواء، والموسيقى الخلفية معا في مقطع واحد من مشهد مكتوب.
يتم عد الأحرف وفقا لتسعير StepFun: حرف صيني واحد يحسب كحرف واحد، وحرفين إنجليزيين كحرف واحد، وعلامتان علامات ترقيم تحتسب كحرف واحد.
يعرف أيضا باسم StepFun StepAudio 3 Gen
stepaudio-3-gen/v1/audio/generationsstepaudio-3-gen-previewstepfun/stepaudio-3-genأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يعمل StepAudio 3 Gen عبر POST /v1/audio/generations. يعيد الطلب job_id فورًا؛ استعلم عن GET /v1/jobs/{job_id} حتى تكتمل المهمة ثم اقرأ روابط الإخراج من النتيجة. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/generations \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-gen",
"prompt": "Describe what you want StepAudio 3 Gen to generate."
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/generations",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-3-gen",
"prompt": "Describe what you want StepAudio 3 Gen to generate.",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)معلمات الطلب التي تدعمها واجهة StepAudio 3 Gen API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| prompt | string | - | - | المشهد الذي يجب توليده. لف مؤثرات صوتية أو إشارة موسيقية بين قوسين مربعين وتوجيه التسليم بين قوسين. |
| instruction | string | - | الحد الأقصى 500 | إرشادات عامة للمكان، الموسيقى الخلفية، والنغمة العاطفية. الحد الأقصى 500 حرف. |
| roles | string | - | - | مكبرات الصوت الاختيارية، كأشياء تحمل اسما ووصف صوتي. جميع الأسماء والوصف معا محدودة بحد أقصى 500 حرف. |
| scripts | string | - | - | خطوط مرتبة اختيارية، ككائنات مع مكبر صوت ونص فقط. الحد الأقصى ب 1000 حرف إجمالا. استخدم هذا بدلا من التوجيه للمشاهد متعددة السماعات. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | صيغة الصوت المخرج. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 48000 | معدل العينة الناتج بالهرتز. |
| speed | number | 1 | 0.5 إلى 2 | سرعة الكلام. |
| volume | number | 1 | 0.1 إلى 2 | حجم الإخراج. |
| text_normalization | enum | standard | standard, enhanced | كيف تقرأ الأرقام والتواريخ والرموز بصوت عال. |
وصف مشهدا ويؤديه النموذج كمقطع مكتمل واحد: جمل منطوقة، مؤثرات صوتية، أجواء، وموسيقى خلفية معا. أرسل طلبا، أو استخدم الأدوار والنصوص للتحكم في مكبرات الصوت المتعددة. لف مؤثرات صوتية أو إشارة موسيقية بين أقواس مربعة واتجاه التسليم بين قوسين. الأدوار والتعليمات محددة ب 500 حرف لكل منها والنصوص عند 1000. صيغ الإخراج هي mp3، wav، flac، opus، وpcm. الأصوات المرجعية واستنساخ الصوت غير متوفرة في هذا النموذج. هذا النموذج في مرحلة المعاينة وقد تتغير قدراته.
على EmpirioLabs، تتم فوترة StepAudio 3 Gen حسب الاستخدام: الجيل $0.36 لكل 10,000 حرف. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم StepAudio 3 Gen عبر POST /v1/audio/generations على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج StepAudio 3 Gen في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.