Qwen3.5 Omni Flash Realtime واجهة برمجة التطبيقات

الكلام يدخل، الكلام خارج، عبر مقبس واحد، مع معدلات رموز نصية وصوتية منفصلة وفوترة لكل دور.

Alibaba Cloudتوليد الصوت256K السياقSingaporeنقطة نهاية مملوكةجديد

حول Qwen3.5 Omni Flash Realtime

الكلام يدخل، الكلام خارج، عبر مقبس واحد، مع معدلات رموز نصية وصوتية منفصلة وفوترة لكل دور.

يتم تكوين الجلسة باستخدام أحداث session.update عبر المقبس بدلا من معلمات الطلب. تفرض رموز النص والصوت فواتير بمعدلات منفصلة.

يعرف أيضا باسم Alibaba Cloud Qwen3.5 Omni Flash Realtime

realtimespeech to speechaudio inaudio outmultilingual

مواصفات Qwen3.5 Omni Flash Realtime

معرّف النموذج
qwen3-5-omni-flash-realtime
المطور
Alibaba Cloud
الفئة
توليد الصوت
تاريخ الإصدار
-
نافذة السياق
256K رمز
أقصى إخراج
32,768 رمز
الإدخال
صوتنص
الإخراج
صوتنص
المنطقة
Singapore
نقاط النهاية
WEBSOCKET/v1/realtime
معرّفات نموذج بديلة
qwen3.5-omni-flash-realtimealibaba/qwen3-5-omni-flash-realtime

أسعار واجهة Qwen3.5 Omni Flash Realtime API

أسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.

النوع
المواصفة
السعر
الإدخال: الصوت
لكل 1M رموز إدخال صوت
$9.00
المدخلات
لكل 1M رموز مطالبة
$1.10
الإنتاج
لكل مليون رمز مولد
$6.60
المخرج: الصوت
لكل مليون رمز صوتي مولد
$35.40
قارن في صفحة الأسعار الكاملة

كيفية استدعاء واجهة Qwen3.5 Omni Flash Realtime API

يجري Qwen3.5 Omni Flash Realtime محادثة مباشرة عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=qwen3-5-omni-flash-realtime، وليس عبر نقاط نهاية HTTP. اتصل باستخدام معرف النموذج qwen3-5-omni-flash-realtime وأرسل مفتاح EmpirioLabs API في ترويسة Authorization: Bearer أثناء المصافحة. ينتقل الصوت في الاتجاهين بصيغة PCM 16-بت مرمّزة بـ base64. لا يستطيع المتصفح ضبط الترويسات على WebSocket، لذا افتح هذا الاتصال من خادمك ومرّر الصوت إلى المتصفح عبر مقبسك الخاص. احصل على مفتاح API من لوحة تحكم EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=qwen3-5-omni-flash-realtime",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
المرجع الكامل لواجهة Qwen3.5 Omni Flash Realtime API

معلمات واجهة Qwen3.5 Omni Flash Realtime API

معلمات الطلب التي تدعمها واجهة Qwen3.5 Omni Flash Realtime API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.

المعاملالنوعالافتراضيالنطاق / القيمالوصف
voiceenumTinaTina, Serena, Ethan, Dylan, Sunny, Peter, Kiki, Ericالصوت المتحدث للجلسة. ضبطه مع session.update قبل أن ينتج النموذج أي صوت.
instructionsstring--إرشادات النظام لكيفية تصرف النموذج وكيفية حديثه أثناء المحادثة.
modalitiesstring["text","audio"]-أي نوع من الإخراج يعيدها النموذج للدور. اترك "audio" للرد النصي فقط.
input_audio_formatenumpcmpcmترميز الصوت الذي ترفقه إلى مخزن الإدخال: base64 PCM 16-بت.
output_audio_formatenumpcmpcmترميز الصوت الذي يبثه النموذج مرة أخرى: base64 PCM 16-بت.
turn_detectionstring{"type":"server_vad"}-اكتشاف نشاط الصوت على جانب الخادم. يقرر متى توقفت عن الكلام ويجب على النموذج الرد. بدونه يستمع النموذج لكنه لا يجيب أبدا، لذا اتركه مفعلا إلا إذا كنت تقود السيارة...

معلومات مفيدة

الصوت الكامل المزدوج عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=qwen3-5-omni-flash-realtime، ويتم التحقق منه باستخدام رأس حامل التفويض العادي. قم بتكوين الجلسة باستخدام session.update عبر المقبس: الصوت، التعليمات، الودياليات، واكتشاف الأدوار. تختلف أصوات هذا النموذج عن الجيل السابق من Omni، لذا يتم تعيين واحد يقبل أو يغادر الإعداد الافتراضي؛ ينهي صوت غير معروف الجلسة بدلا من إعادة الخطأ. يتم تسعير رموز النص والصوت بشكل منفصل، ويتم احتساب كل دور مكتمل بشكل مستقل بناء على الاستخدام الذي يبلغ عنه النموذج.

واجهة Qwen3.5 Omni Flash Realtime API: أسئلة شائعة

كم تكلف واجهة Qwen3.5 Omni Flash Realtime API؟

على EmpirioLabs، تتم فوترة Qwen3.5 Omni Flash Realtime حسب الاستخدام: الإدخال: الصوت $9.00 لكل 1M رموز إدخال صوت; المدخلات $1.10 لكل 1M رموز مطالبة; الإنتاج $6.60 لكل مليون رمز مولد; المخرج: الصوت $35.40 لكل مليون رمز صوتي مولد. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.

ما حجم نافذة السياق في Qwen3.5 Omni Flash Realtime؟

يدعم Qwen3.5 Omni Flash Realtime نافذة سياق من 256K رمز، مع ما يصل إلى 32,768 رمز إخراج لكل استجابة.

أي نقطة نهاية يستخدم Qwen3.5 Omni Flash Realtime؟

يُقدَّم Qwen3.5 Omni Flash Realtime عبر WEBSOCKET /v1/realtime على api.empiriolabs.ai مع مصادقة Bearer القياسية.

هل يمكنني تجربة Qwen3.5 Omni Flash Realtime في المتصفح قبل الدمج؟

افتح ملعب EmpirioLabs واضغط Start session لتجربته في المتصفح. يعمل Qwen3.5 Omni Flash Realtime عبر WebSocket بدلاً من طلب واستجابة، لذا ابدأ من دليل البدء السريع للصوت الفوري عند الدمج. اتصل من خادمك باستخدام مفتاح EmpirioLabs API ومعرف النموذج qwen3-5-omni-flash-realtime، ثم مرّر الصوت في الاتجاهين.

كيف أحصل على مفتاح API لنموذج Qwen3.5 Omni Flash Realtime؟

أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.