
نموذج التعرف على الكلام من StepFun للبث الصوتي الصيني والإنجليزي.
نموذج التعرف على الكلام من StepFun للبث الصوتي الصيني والإنجليزي.
EmpirioLabs يعرض نقطة النهاية القياسية /v1/audio/transcriptions ويعيد النص النهائي بصيغة استجابة النسخ العادية.
يعرف أيضا باسم StepAudio ASR, StepFun StepAudio 2.5 ASR, StepAudio-2.5-ASR, stepaudio-2-5-asr
stepaudio-2-5-asr/v1/audio/transcriptionsstepaudio-2.5-asrstepfun/stepaudio-2-5-asrstepfun/stepaudio-2.5-asrأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يعمل StepAudio 2.5 ASR عبر POST /v1/audio/transcriptions. يعيد الطلب job_id فورًا؛ استعلم عن GET /v1/jobs/{job_id} حتى تكتمل المهمة ثم اقرأ روابط الإخراج من النتيجة. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-2-5-asr",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)معلمات الطلب التي تدعمها واجهة StepAudio 2.5 ASR API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| file | audio | - | - | رفع ملف صوتي للنسخ. |
| file_url | string | - | - | عنوان URL عام لملف صوتي. |
| audio_base64 | string | - | - | حمولة الصوت Base64 لطلبات JSON. |
| language | enum | en | en, zh | لغة التعرف. |
| hotwords | array | - | - | قائمة الكلمات الساخنة اختيارية. |
| enable_itn | boolean | true | - | تفعيل تطبيع النص العكسي. |
| enable_timestamp | boolean | false | - | أعد حقول الطوابع الزمنية من فعاليات StepFun SSE عندما تكون متاحة. |
| format | enum | wav | wav, mp3, ogg, pcm | صيغة حاوية الصوت. |
| codec | string | - | - | ترميز PCM مثل pcm_s16le. |
| rate | integer | 16000 | 8000 إلى 48000 | معدل عينة PCM بالهرتز. |
| bits | integer | 16 | 8 إلى 32 | عمق بت PCM. |
| channel | integer | 1 | 1 إلى 8 | عدد قنوات PCM. |
يدعم مدخلات wav وmp3 وogg وpcm. يجب أن تتضمن طلبات PCM الترميز، ومعدل العينة، وعمق البت، وعدد القنوات. لغة التعرف تدعم الصينية والإنجليزية. يتوفر إنتاج الطوابع الزمنية عبر enable_timestamp.
على EmpirioLabs، تتم فوترة StepAudio 2.5 ASR حسب الاستخدام: النسخ $0.022 لكل ساعة صوتية. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم StepAudio 2.5 ASR عبر POST /v1/audio/transcriptions على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج StepAudio 2.5 ASR في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.