المنزل المدونة

كيفية استخدام Gemini 3.8 Live وLive Extended Thinking

التفكير الممتد الحي والحي في Gemini 3.8 عبر واجهة برمجة التطبيقات

Sep 24, 2026

EmpirioLabs AI

جيميني 3.8 Live و Gemini 3.8 Live Extended Thinking متوفران على EmpirioLabs. كلاهما نماذج صوتية في الوقت الحقيقي: تفتح WebSocket، تبث صوت الميكروفون، والرد المنطوق يبث مرة أخرى على نفس الاتصال.

جيميني 3.8 لايف هو خيار التأخير المنخفض لوكلاء الصوت والحوار الحي. يقبل إطارات الفيديو الحية مع الصوت، ويتصل بوظائفك أثناء المحادثة، ويرد باللغة التي يتحدث بها المتصل.

التفكير الممتد الحي في Gemini 3.8 الأسباب في الخلفية أثناء حديثه، لأسئلة تحتاج إلى أكثر من إجابة سريعة. تحدد كم تفكر مع reasoning_effort.

جرب أيا منهما في Playground: جيميني 3.8 لايف أو التفكير الممتد الحي. اختر صوتا، اضغط على بدء الجلسة وتحدث.

الاتصال

كل نموذج في الوقت الحقيقي على المنصة يستخدم نقطة نهاية واحدة، يتم اختيارها باستخدام النموذج معلمة الاستعلام. تحقق من مصادقة المصافحة باستخدام مفتاح واجهة برمجة التطبيقات EmpirioLabs الخاصة بك:

wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live التفويض: حامل YOUR_EMPIRIOLABS_API_KEY

يتبع البروتوكول تنسيق الأحداث الفوري المستخدم على نطاق واسع. تكوين الجلسة مع session.update قبل إرسال الصوت الأول، أضف صوت الميكروفون مع input_audio_buffer.append، واقرأ الرد من response.audio.delta، مع نصه المقال response.audio_transcript.دلتا.

{"type": "session.update", "session": { "voice": "Kore", "instructions": "أنت مساعد سفر موجز." }}

الصوت هو PCM 16-بت في كلا الاتجاهين: 16 كيلوهرتز من الميكروفون، أو 24 كيلوهرتز مع input_audio_format تم ضبطه على PCM24، و24 كيلوهرتز للرد. يتم تشغيل كشف نشاط الصوت من البداية، لذا يرد النموذج عندما يتوقف المتصل عن الكلام، ويقاطعه التحدث عبر الرد.

إطارات الفيديو

كلا النموذجين يمكنهم رؤية ما يعرضه لهم المتصل. أرسل إطارات من كاميرا أو شاشة كصور base64 JPEG أو PNG في مخزن مؤقت خاص بها، واسأل عنها في نفس الدور:

{"type": "input_image_buffer.append", "image": "<base64 JPEG أو PNG>"}

استدعاء الدوال

إعلان الدوال في session.update مع معلمات مخطط JSON. عندما يستدعي النموذج واحدا، تستقبل response.function_call_arguments.done مع call_id، اسم الدالة وحجمها. أعد النتيجة ك function_call_output العنصر والنموذج يواصلون التحدث معه.

التفكير الموسع

{"type": "session.update", "session": {"reasoning_effort": "high"}}

reasoning_effort يقبل منخفض, الوسيط (الافتراضي) أو عالي. غالبا ما يعترف النموذج بالسؤال أولا ثم يجيب في إجابة ثانية، لذا استمر في الاستماع بعد الأول الرد. تم.

التسعير

كلا النموذجين يفوتران كل دور مكتمل حسب الاستخدام الذي يبلغ عنه النموذج، مع معدلات منفصلة لرموز الصوت والرموز النصية في كلا الاتجاهين. إطارات الفيديو تحسب كرموز إدخال، وتستدعي الاستدلال كرموز إخراج. تحسب Extended Thinking عن المزيد من رموز الإدخال في كل دور، لذا نفس المحادثة تكلف أكثر منها على البث المباشر. الأسعار الحالية على جيميني 3.8 لايف و التفكير الممتد الحي صفحات النماذج وعلى صفحة الأسعار.

أشياء تستحق المعرفة قبل جلستك الأولى

  • حدد الجلسة قبل أن تتحدث. الصوت، التعليمات، اكتشاف الأدوار، الأدوات، درجة الحرارة وجهد التفكير تصلح بمجرد بدء المحادثة. تغييرها لاحقا يعيد خطأ؛ افتح جلسة جديدة بدلا من ذلك.
  • استخدم أحد الأصوات الثلاثين المدرجة. القرص هو الافتراضي. أي قيمة أخرى ترفض بسبب خطأ.
  • لا يوجد إعداد لغوي. يرد النموذج باللغة التي يتحدث بها المتصل.
  • استمر في البث لفترة وجيزة بعد توقف المتصل. يتطلب اكتشاف نشاط الصوت صمتا قصيرا ليقرر أن الدور انتهى، لذا ينتظر العميل الذي يقطع الصوت في الكلمة الأخيرة رد.
  • المقبس الجديد هو محادثة جديدة. احتفظ بسجل الكشف الخاص بك إذا كان العميل الذي يعيد الاتصال يحتاج إلى السياق المبكر.

جداول الأحداث، قائمة الأصوات، وصيغ الصوت موجودة في واجهة برمجة التطبيقات للصوت في الوقت الحقيقي وثائق. بالنسبة text-to-speech من نفس العائلة، انظر كيفية استخدام Gemini 3.8 Flash TTS و Flash-Lite TTS. كلا الطرازين المباشرين متوفران الآن.

إفصاح: كتب هذا المقال بمساعدة الذكاء الاصطناعي وتمت مراجعته من قبل EmpirioLabs AI.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

استكشف نماذجنا، أو تواصل معنا بشأن استفسارات الأعمال، أو النشر المخصص، أو أي شيء آخر.