
النسخ المباشر عبر مقبس الصورة، يعيد النتائج المؤقتة بينما المتحدث لا يزال يتحدث ونص ثابت بمجرد انتهاء كل جملة.
النسخ المباشر عبر مقبس الصورة، يعيد النتائج المؤقتة بينما المتحدث لا يزال يتحدث ونص ثابت بمجرد انتهاء كل جملة.
يرتفع الصوت كإطارات ثنائية خام لوحدة تحكم أحادية 16 بكهرتز 16-بت. تعود النصوص المؤقتة والثابتة كأحداث نتائج.
يعرف أيضا باسم Deepgram-Nova-3-Stream
deepgram-nova-3-stream/v1/realtimenova-3-streamdeepgram/deepgram-nova-3-streamأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
ينسخ Deepgram Nova-3 Stream تدفقًا صوتيًا مباشرًا عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=deepgram-nova-3-stream، وليس عبر نقاط نهاية HTTP. اتصل باستخدام معرف النموذج deepgram-nova-3-stream وأرسل مفتاح EmpirioLabs API في ترويسة Authorization: Bearer أثناء المصافحة. أضف صوت PCM 16-بت مرمّزًا بـ base64 واقرأ أحداث النسخ بينما لا يزال المتحدث يتكلم. لا يستطيع المتصفح ضبط الترويسات على WebSocket، لذا افتح هذا الاتصال من خادمك ومرّر الصوت إلى المتصفح عبر مقبسك الخاص. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=deepgram-nova-3-stream",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
import base64
# 16-bit PCM microphone audio, base64 encoded, in small chunks.
for chunk in read_microphone_chunks():
await ws.send(json.dumps({
"type": "input_audio_buffer.append",
"audio": base64.b64encode(chunk).decode(),
}))
await ws.send(json.dumps({"type": "input_audio_buffer.commit"}))
async for raw in ws:
event = json.loads(raw)
if event["type"].endswith("input_audio_transcription.delta"):
# "text" is settled transcript; "stash" is still in progress.
if event.get("text"):
print(event["text"], end="", flush=True)
asyncio.run(main())معلمات الطلب التي تدعمها واجهة Deepgram Nova-3 Stream API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| input_audio_format | enum | linear16 | linear16 | Encoding of the audio you send up: 16 kHz mono 16-bit PCM, as raw binary frames rather than base64. |
| language | string | - | - | Optional language hint. Omit to let the model detect it. |
النسخ المباشر عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=deepgram-nova-3-stream، ويتم التحقق منه باستخدام رأس حامل التفويض العادي. أرسل PCM أحادي 16 كيلوهرتز 16 بت كإطارات ثنائية واقرأ أحداث النص مرة أخرى؛ تصل النتائج المؤقتة بينما لا يزال المتحدث يتحدث، وكل عبارة تستقر مع is_final. أضف language= إلى عنوان URL الخاص بالاتصال لنسخ لغة معينة. الفوترة هي لكل دقيقة من الصوت الذي ترسله.
على EmpirioLabs، تتم فوترة Deepgram Nova-3 Stream حسب الاستخدام: النسخ $0.025 لكل دقيقة من الصوت. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم Deepgram Nova-3 Stream عبر WEBSOCKET /v1/realtime على api.empiriolabs.ai مع مصادقة Bearer القياسية.
يعمل Deepgram Nova-3 Stream عبر WebSocket بدلاً من طلب واستجابة، لذا ابدأ من دليل البدء السريع للصوت الفوري. اتصل من خادمك باستخدام مفتاح EmpirioLabs API ومعرف النموذج deepgram-nova-3-stream، ثم مرّر الصوت في الاتجاهين.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.