نموذجان جديدان من صوت علي بابا موجودان على EmpirioLabs، وكلاهما محادثات وليس طلبات. تفتح منفذ WebSocket، وتبث صوت الميكروفون، ويعود الصوت بينما لا يزال السماعة يتحدث.
Qwen3.8 أومني فلاش في الوقت الحقيقي هو الذي يمكنه أيضا الرؤية. إلى جانب الصوت الذي ترسله بالفعل، يمكنك دفع إطارات فيديو مباشرة، وسيجيب على أسئلة حول ما هو على الشاشة في نفس الدور. يحمل 56 صوتا ويتصل بوظائفك أثناء المحادثة.
كوين أوديو 3.1 ريلتر بلس هو الذي يمكنه البحث عن الأشياء. يحتوي على بحث ويب أصلي يمكنك تفعيله في كل جلسة، و27 صوتا خاصا به، وسياق 256 كيلوبايت.
جرب أيا منهما في playground: أومني فلاش الوقت الحقيقي أو الصوت 3.1 الوقت الحقيقي بلس. انقر على بدء الجلسة وتحدث.
الاتصال
هناك نقطة نهاية واحدة في الوقت الحقيقي لكل نموذج على المنصة، وتختار النموذج الذي يحتوي على معامل استعلام. تحقق من مصادقة المصافحة بنفس مفتاح API الذي تستخدمه في كل مكان آخر:
wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime التفويض: حامل YOUR_EMPIRIOLABS_API_KEY
يتبع البروتوكول شكل الحدث الحقيقي المستخدم على نطاق واسع، لذا فإن العميل المكتوب وفقا لهذا العرف يعمل دون تغيير. قم بتكوين الجلسة عبر السوكت باستخدام session.update، أضف صوت الميكروفون ك input_audio_buffer.append، وقراءة الصوت من response.audio.delta مع تشغيل النص المطابق. response.audio_transcript.دلتا.
{"type": "session.update", "session": { "voice": "Tina", "modalities": ["text", "audio"] }}
الصوت ينتقل في الاتجاهين كجهاز PCM 16-بت. هذان الطرازان يستعيدان 16 كيلوهرتز عند الصعود ويعيدان 24 كيلوهرتز عند العودة. ال session.created تقارير الحدث الذي تتلقاه على Connect، تقارير تلك الجلسة، لذا اقرأها هناك بدلا من الافتراض.
إطارات الفيديو على أومني فلاش في الوقت الحقيقي
الإطارات توضع في مخزن مؤقت خاص بها، بجانب مخزن الصوت:
{"type": "input_image_buffer.append", "image": "<base64 JPEG أو PNG>"}
أرسلها كما تفعل مع إطارات من الكاميرا، ثم اسأل عما تعرضه في نفس الدور المنطوق. يحتفظ بسجل فيديو يصل إلى 50 دورة و240 ثانية، وحتى 100 دورة و600 ثانية من الصوت. التاريخ القديم يخرج عن سياقه مع تجاوز تلك القيود.
البحث على الإنترنت على الصوت 3.1
البحث غير فعال إلا إذا طلبته، وطلبته في الجلسة:
{"type": "session.update", "session": {"enable_search": true}}
مع تشغيله، يمكن للنموذج الإجابة على أسئلة حول الأشياء التي حدثت بعد تدريبه. تضاف النتائج إلى المحادثة، بحيث يبلغ دور البحث عن عدد رموز إدخال أكبر بشكل ملحوظ مقارنة بدور لا يفعل.
التسعير
كلا الطرازين يحتركان كل دور مكتمل حسب الاستخدام الذي يبلغ عنه النموذج، مع معدلات منفصلة للرموز الصوتية والرموز النصية في كلا الاتجاهين. هذا التقسيم مهم: الرد المنطوق هو في الغالب رموز صوتية، وطلب رد نصي فقط عن طريق إسقاط الصوت من الأساليب فعلا تكلفة أقل. الأسعار الحالية موجودة على أومني فلاش الوقت الحقيقي و الصوت 3.1 الوقت الحقيقي بلس صفحات النماذج وعلى صفحة الأسعار، والتي تبقى متزامنة مع ما يتم تحصيله عليك. لا يوجد أي من الطرازين يحتوي على طبقة إدخال مخزنة، لذا كل رمز إدخال يفرض عليه السعر العادي.
أشياء تستحق المعرفة قبل جلستك الأولى
- لا ترسل الصوت الذي تقارير الجلسة. كلا الطرازين يعلنان عن صوت على الاتصال ثم يرفض مولدهما الخاص، مما يوقف الدور الأول. اترك الصوت غير مضبوط وتحدد المنصة وضع افتراضي يعمل لذلك الطراز، أو اختر صوتا من قائمة الأصوات بنفسك. القائمتان لا تشتركان في أي اسم، لذا الصوت الذي يعمل على إحداهما لن يعمل على الآخر.
- كشف نشاط الصوت يحتاج إلى دقيقة صمت ليبدأ في التشغيل. هؤلاء النماذج يقررون أنك توقفت عن الكلام بمجرد سماعك أنك توقفت. إذا قطع العميل تدفق الصوت بمجرد أن ينهي المتحدث الكلمة الأخيرة، لا يتم الالتزام بأي شيء ولا يأتي رد، وهذا يبدو تماما كجلسة معطلة. استمر في البث لمدة ثانية تقريبا بعد انتهاء الخطاب.
- إطارات الفيديو ليست محتوى رسائل. يمرون
input_image_buffer.append. وضع صورة داخلconversation.item.createيتم رفض مصفوفة المحتوى، وفي بعض النماذج تترك الدور بدون أي رسالة مستخدم على الإطلاق. - في الصوت 3.1، البحث عبر الويب واستدعاء الوظائف متعارضان. قم بتفعيل واحدة في كل جلسة، وليس كلاهما.
- المقبس الجديد هو محادثة جديدة. لا توجد ذاكرة على جانب الخادم عبر الاتصالات، لذا يجب على العميل الذي يعيد الاتصال تشغيل السياق الذي يريد أن يبقى في النموذج.
جداول الفعاليات الكاملة، قوائم الأصوات، وصيغ الصوت موجودة في واجهة برمجة التطبيقات للصوت في الوقت الحقيقي وثائق. كلا الطرازين متوفران الآن.



