
يتم إدخال إطارات الكلام والفيديو الحي، وخروج الصوت عبر مقبس واحد، مع 56 صوتا، واستدعاء الأدوات أثناء المحادثة، ومعدلات منفصلة للرموز النصية والصوتية.
يتم إدخال إطارات الكلام والفيديو الحي، وخروج الصوت عبر مقبس واحد، مع 56 صوتا، واستدعاء الأدوات أثناء المحادثة، ومعدلات منفصلة للرموز النصية والصوتية.
يتم تكوين الجلسة باستخدام أحداث session.update عبر المقبس بدلا من معلمات الطلب. تفرض رموز النص والصوت فواتير بمعدلات منفصلة.
يعرف أيضا باسم Alibaba Cloud Qwen3.8 Omni Flash Realtime
qwen3-8-omni-flash-realtime/v1/realtimeqwen3.8-omni-flash-realtimealibaba/qwen3-8-omni-flash-realtimeأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يجري Qwen3.8 Omni Flash Realtime محادثة مباشرة عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime، وليس عبر نقاط نهاية HTTP. اتصل باستخدام معرف النموذج qwen3-8-omni-flash-realtime وأرسل مفتاح EmpirioLabs API في ترويسة Authorization: Bearer أثناء المصافحة. ينتقل الصوت في الاتجاهين بصيغة PCM 16-بت مرمّزة بـ base64. لا يستطيع المتصفح ضبط الترويسات على WebSocket، لذا افتح هذا الاتصال من خادمك ومرّر الصوت إلى المتصفح عبر مقبسك الخاص. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())معلمات الطلب التي تدعمها واجهة Qwen3.8 Omni Flash Realtime API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| voice | enum | Tina | Tina, Cindy, Liora Mira, Raymond, Zane, Katerina, Ryan, Mia, ... | صوت التحدث للجلسة. قم بضبطه مع session.update قبل أن ينتج النموذج أي صوت. هذه الأصوات خاصة بهذا النموذج. |
| instructions | string | - | - | إرشادات النظام لكيفية تصرف النموذج وكيفية حديثه أثناء المحادثة. |
| modalities | string | ["text","audio"] | - | أي نوع من الإخراج يعيدها النموذج للدور. اترك الصوت للرد النصي فقط. |
| input_audio_format | enum | pcm16 | pcm16 | ترميز الصوت الذي تضيفه إلى مخزن الإدخال: base64 PCM 16-بت عند 16 كيلوهرتز. |
| output_audio_format | enum | pcm24 | pcm24 | ترميز الصوت الذي يبثه النموذج مرة أخرى: PCM 16-بت عند 24 كيلوهرتز. |
| turn_detection | string | {"type":"server_vad"} | - | اكتشاف نشاط الصوت على جانب الخادم. يقرر متى توقفت عن الكلام ويجب أن يرد النموذج. يكون الجهاز مفعلا بشكل افتراضي في هذا النموذج. |
الاتصال الصوت الكامل عبر WebSocket عند wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime، مصادق عليه باستخدام رأس حامل التفويض العادي. قم بتكوين الجلسة مع session.update عبر المقبس: الصوت، التعليمات، الوسائط، واكتشاف الدوران. إرسال الصوت والفيديو - إضافة صوت الميكروفون كأحداث input_audio_buffer.append. - إضافة إطارات فيديو حية كأحداث input_image_buffer.append. الإطارات ليست محتوى رسائل، لذا يتم رفض صورة داخل عنصر المحادثة. - كشف نشاط الصوت يحدد متى تتوقف عن الكلام، لذا استمر في البث لمدة ثانية تقريبا بعد انتهاء الكلام. الأصوات الأصوات في هذا النموذج ليست نفس مجموعة نماذج Qwen3.5 Omni الفورية. اختر واحدة من قائمة الأصوات بدلا من حمل صوت عبر الصورة، أو اتركها غير مضبوطة ويتم توفير الإعداد الافتراضي لك. الفوترة يتم تسعير رموز الصوت والنص بشكل منفصل في كلا الاتجاهين، ويتم احتساب كل دور مكتمل بمفعوله بناء على الاستخدام الذي يبلغ عنه النموذج.
على EmpirioLabs، تتم فوترة Qwen3.8 Omni Flash Realtime حسب الاستخدام: الإدخال: الصوت $1.86 لكل 1M رموز إدخال صوت; المدخلات $0.46 لكل 1M رموز مطالبة; الإنتاج $1.40 لكل مليون رمز مولد; المخرج: الصوت $3.74 لكل مليون رمز صوتي مولد. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يدعم Qwen3.8 Omni Flash Realtime نافذة سياق من 192K رمز، مع ما يصل إلى 65,536 رمز إخراج لكل استجابة.
يُقدَّم Qwen3.8 Omni Flash Realtime عبر WEBSOCKET /v1/realtime على api.empiriolabs.ai مع مصادقة Bearer القياسية.
افتح ملعب EmpirioLabs واضغط Start session لتجربته في المتصفح. يعمل Qwen3.8 Omni Flash Realtime عبر WebSocket بدلاً من طلب واستجابة، لذا ابدأ من دليل البدء السريع للصوت الفوري عند الدمج. اتصل من خادمك باستخدام مفتاح EmpirioLabs API ومعرف النموذج qwen3-8-omni-flash-realtime، ثم مرّر الصوت في الاتجاهين.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.