
محادثة صوتية مزدوجة عبر مقبس واحد، مع 27 صوتا، بحث ويب أصلي، استدعاء أدوات، ومعدلات رموز نصية وصوتية منفصلة.
محادثة صوتية مزدوجة عبر مقبس واحد، مع 27 صوتا، بحث ويب أصلي، استدعاء أدوات، ومعدلات رموز نصية وصوتية منفصلة.
يتم تكوين الجلسة باستخدام أحداث session.update عبر المنفذ بدلا من معلمات الطلب. البحث على الويب يكون مغلقا بشكل افتراضي ولا يمكن دمجها مع استدعاء الدوال. يتم فوترة رموز النص والصوت بمعدلات منفصلة.
يعرف أيضا باسم Qwen Audio Realtime Plus, Qwen Audio Realtime, Alibaba Cloud Qwen Audio 3.1 Realtime Plus
qwen-audio-3-1-realtime-plus/v1/realtimeqwen-audio-3.1-realtime-plusalibaba/qwen-audio-3-1-realtime-plusأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يجري Qwen Audio 3.1 Realtime Plus محادثة مباشرة عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus، وليس عبر نقاط نهاية HTTP. اتصل باستخدام معرف النموذج qwen-audio-3-1-realtime-plus وأرسل مفتاح EmpirioLabs API في ترويسة Authorization: Bearer أثناء المصافحة. ينتقل الصوت في الاتجاهين بصيغة PCM 16-بت مرمّزة بـ base64. لا يستطيع المتصفح ضبط الترويسات على WebSocket، لذا افتح هذا الاتصال من خادمك ومرّر الصوت إلى المتصفح عبر مقبسك الخاص. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
import asyncio, json, os, websockets
async def main():
async with websockets.connect(
"wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus",
additional_headers=[
("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
],
max_size=None,
) as ws:
print(json.loads(await ws.recv())["type"]) # session.created
await ws.send(json.dumps({
"type": "conversation.item.create",
"item": {
"type": "message",
"role": "user",
"content": [{"type": "input_text", "text": "Say hello."}],
},
}))
await ws.send(json.dumps({"type": "response.create"}))
async for raw in ws:
event = json.loads(raw)
if event["type"] == "response.audio.delta":
... # base64 audio chunk, append to your playback buffer
elif event["type"] == "response.done":
break
asyncio.run(main())معلمات الطلب التي تدعمها واجهة Qwen Audio 3.1 Realtime Plus API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| voice | enum | longanqian_v3.1 | longanqian_v3.1, longanhuan_v3.1, longanlingxin_v3.1, longanf... | صوت التحدث للجلسة. قم بضبطه مع session.update قبل أن ينتج النموذج أي صوت. هذه الأصوات خاصة بهذا النموذج. |
| instructions | string | - | - | إرشادات النظام لكيفية تصرف النموذج وكيفية حديثه أثناء المحادثة. |
| enable_search | boolean | false | - | ابحث في الويب عن معلومات في الوقت الحقيقي. لا يمكن استخدامها في نفس جلسة استدعاء الدوال. تضاف نتائج البحث إلى المحادثة وتحتسب كرموز إدخال. |
| modalities | string | ["text","audio"] | - | أي نوع من الإخراج يعيدها النموذج للدور. اترك الصوت للرد النصي فقط. |
| input_audio_format | enum | pcm16 | pcm16 | ترميز الصوت الذي تضيفه إلى مخزن الإدخال: base64 PCM 16-بت عند 16 كيلوهرتز. |
| output_audio_format | enum | pcm24 | pcm24 | ترميز الصوت الذي يبثه النموذج مرة أخرى: PCM 16-بت عند 24 كيلوهرتز. |
| turn_detection | string | {"type":"server_vad"} | - | اكتشاف نشاط الصوت على جانب الخادم. يقرر متى توقفت عن الكلام ويجب أن يرد النموذج. يكون الجهاز مفعلا بشكل افتراضي في هذا النموذج. |
الاتصال صوت مزدوج بالكامل عبر WebSocket عند wss://api.empiriolabs.ai/v1/realtime?model=qwen-audio-3-1-realtime-plus، مصادق عليه باستخدام رأس حامل التفويض العادي. قم بتكوين الجلسة باستخدام session.update عبر المقبس: الصوت، التعليمات، الوسائط، واكتشاف الدوران. إرسال الصوت - إضافة صوت الميكروفون كأحداث input_audio_buffer.append. - كشف نشاط الصوت يحدد متى توقفت عن الكلام، لذا استمر في البث لمدة ثانية تقريبا بعد انتهاء الكلام. الأصوات الأصوات في هذا النموذج هي مجموعة منفصلة. اختر واحدة من قائمة الأصوات بدلا من حمل صوت عبر نموذج آخر، أو اتركها غير مضبوطة ويتم توفير الإعداد الافتراضي لك. بحث على الويب البحث على الويب مغلق افتراضيا. قم بتفعيله باستخدام enable_search. لا يمكن تفعيله في نفس جلسة استدعاء الوظائف، ويتم إضافة نتائج البحث إلى المحادثة وتحتسب كرموز إدخال. الفوترة يتم تسعير رموز الصوت والنص بشكل منفصل في كلا الاتجاهين، ويتم احتساب كل دور مكتمل بمفعوله بناء على الاستخدام الذي يبلغ عنه النموذج.
على EmpirioLabs، تتم فوترة Qwen Audio 3.1 Realtime Plus حسب الاستخدام: الإدخال: الصوت $12.80 لكل 1M رموز إدخال صوت; المدخلات $1.60 لكل 1M رموز مطالبة; الإنتاج $12.80 لكل مليون رمز مولد; المخرج: الصوت $48.00 لكل مليون رمز صوتي مولد; البحث على الويب $0.00 لكل نداء عند استدعائه. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يدعم Qwen Audio 3.1 Realtime Plus نافذة سياق من 256K رمز، مع ما يصل إلى 16,384 رمز إخراج لكل استجابة.
يُقدَّم Qwen Audio 3.1 Realtime Plus عبر WEBSOCKET /v1/realtime على api.empiriolabs.ai مع مصادقة Bearer القياسية.
افتح ملعب EmpirioLabs واضغط Start session لتجربته في المتصفح. يعمل Qwen Audio 3.1 Realtime Plus عبر WebSocket بدلاً من طلب واستجابة، لذا ابدأ من دليل البدء السريع للصوت الفوري عند الدمج. اتصل من خادمك باستخدام مفتاح EmpirioLabs API ومعرف النموذج qwen-audio-3-1-realtime-plus، ثم مرّر الصوت في الاتجاهين.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.