
النسخ المباشر عبر مقبس الصورة، يعيد نتائج جزئية أثناء حديث المتحدث، مع تمييز كشف نشاط الصوت لكل جملة.
النسخ المباشر عبر مقبس الصورة، يعيد نتائج جزئية أثناء حديث المتحدث، مع تمييز كشف نشاط الصوت لكل جملة.
EmpirioLabs يعرض نقطة النهاية القياسية /v1/audio/transcriptions ويعيد النص النهائي بصيغة استجابة النسخ العادية.
يعرف أيضا باسم StepAudio ASR Stream, StepFun StepAudio 2.5 ASR Stream
stepaudio-2-5-asr-stream/v1/realtimestepaudio-2.5-asr-streamstepfun/stepaudio-2-5-asr-streamأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
ينسخ StepAudio 2.5 ASR Stream تدفقًا صوتيًا مباشرًا عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream، وليس عبر نقاط نهاية HTTP. اتصل باستخدام معرف النموذج stepaudio-2-5-asr-stream وأرسل مفتاح EmpirioLabs API في ترويسة Authorization: Bearer أثناء المصافحة. أضف صوت PCM 16-بت مرمّزًا بـ base64 واقرأ أحداث النسخ بينما لا يزال المتحدث يتكلم. لا يستطيع المتصفح ضبط الترويسات على WebSocket، لذا افتح هذا الاتصال من خادمك ومرّر الصوت إلى المتصفح عبر مقبسك الخاص. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())معلمات الطلب التي تدعمها واجهة StepAudio 2.5 ASR Stream API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| input_audio_format | enum | pcm16 | pcm16 | Encoding of the audio you append to the input buffer: base64 16-bit PCM. |
| language | string | - | - | Optional language hint. Omit to let the model detect it. |
النسخ المباشر عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=stepaudio-2-5-asr-stream، وتم التحقق منه باستخدام رأس حامل التفويض العادي. قم ببث صوت pcm16 على تردد 16 كيلوهرتز مع input_audio_buffer.append واقرأ النتائج الجزئية بينما لا يزال المتحدث يتحدث، مع تحديد مكان انتهاء كل جملة بكشف نشاط الصوت على جانب الخادم. استخدم هذا للترجمة الحية وإدخال الصوت؛ للتسجيل النهائي، يعيد POST /v1/audio/transcriptions النص الكامل في مكالمة واحدة. تتبع الفوترة مدة الصوت الذي تبثه، وتسويه عند إغلاق الجلسة.
على EmpirioLabs، تتم فوترة StepAudio 2.5 ASR Stream حسب الاستخدام: النسخ $0.18 لكل ساعة صوتية. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم StepAudio 2.5 ASR Stream عبر WEBSOCKET /v1/realtime على api.empiriolabs.ai مع مصادقة Bearer القياسية.
يعمل StepAudio 2.5 ASR Stream عبر WebSocket بدلاً من طلب واستجابة، لذا ابدأ من دليل البدء السريع للصوت الفوري. اتصل من خادمك باستخدام مفتاح EmpirioLabs API ومعرف النموذج stepaudio-2-5-asr-stream، ثم مرّر الصوت في الاتجاهين.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.