
نسخ واع للسياق للأسماء الخاصة، المصطلحات التقنية، اللهجات، والصوت الصعب بما في ذلك الهمسات، الكلام السريع، والغناء.
نسخ واع للسياق للأسماء الخاصة، المصطلحات التقنية، اللهجات، والصوت الصعب بما في ذلك الهمسات، الكلام السريع، والغناء.
EmpirioLabs يعرض نقطة النهاية القياسية /v1/audio/transcriptions ويعيد النص النهائي بصيغة استجابة النسخ العادية.
يعرف أيضا باسم StepFun StepAudio 3 ASR Max
stepaudio-3-asr-max/v1/audio/transcriptionsstepfun/stepaudio-3-asr-maxأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يعمل StepAudio 3 ASR Max عبر POST /v1/audio/transcriptions. يعيد الطلب job_id فورًا؛ استعلم عن GET /v1/jobs/{job_id} حتى تكتمل المهمة ثم اقرأ روابط الإخراج من النتيجة. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/transcriptions \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-asr-max",
"audio_url": "https://example.com/meeting-recording.mp3"
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/transcriptions",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-3-asr-max",
"audio_url": "https://example.com/meeting-recording.mp3",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)معلمات الطلب التي تدعمها واجهة StepAudio 3 ASR Max API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| file | string | - | - | رفع ملف صوتي للنسخ. |
| file_url | string | - | - | عنوان URL عام لملف صوتي. |
| audio_base64 | string | - | - | حمولة الصوت Base64 لطلبات JSON. |
| enable_itn | boolean | true | - | تمكين تطبيع النص العكسي، الذي يكتب الأرقام والتواريخ والعملة في شكلها الكتابي. |
| format | enum | wav | wav, mp3, ogg, m4a, pcm | صيغة حاوية الصوت. |
| codec | string | - | - | ترميز PCM مثل pcm_s16le. |
| rate | number | - | - | معدل عينة PCM بالهرتز. |
| bits | number | - | - | عمق بت PCM. |
| channel | number | - | - | عدد قنوات PCM. |
يدعم مدخلات wav وmp3 وogg وm4a وpcm. يجب أن تتضمن طلبات PCM الترميز، معدل العينة، عمق البت، وعدد القنوات. يتم اكتشاف اللغة تلقائيا ولا يمكن تعيينها؛ يتم التعرف على الصينية، الإنجليزية، اليابانية، الكورية، الفرنسية، والإسبانية، مع وجود لغات غير الصينية والإنجليزية في المعاينة. تطبيع النص العكسي مفعل افتراضيا ويمكن إيقافه باستخدام enable_itn. الكلمات الساخنة وطوابع زمنية الكلمات غير متوفرة في هذا الطراز. يتم احتساب الصوت حسب المدة المقاسة، مع حد أدنى لثانية واحدة.
على EmpirioLabs، تتم فوترة StepAudio 3 ASR Max حسب الاستخدام: النسخ $0.24 لكل ساعة صوتية. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم StepAudio 3 ASR Max عبر POST /v1/audio/transcriptions على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج StepAudio 3 ASR Max في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.