Gemini 3.8 Live Extended Thinking واجهة برمجة التطبيقات

محادثة صوتية تستمر في الحديث بينما تبحث في الخلفية، مع 30 صوتا، إدخال فيديو مباشر، استدعاء أدوات، وجهد تفكير قابل للتعديل.

Googleتوليد الصوت128K السياقتاريخ الإصدار 15 سبتمبر 2026نقطة نهاية مملوكةجديد

حول Gemini 3.8 Live Extended Thinking

محادثة صوتية تستمر في الحديث بينما تبحث في الخلفية، مع 30 صوتا، إدخال فيديو مباشر، استدعاء أدوات، وجهد تفكير قابل للتعديل.

يتم تكوين الجلسة باستخدام أحداث session.update عبر المقبس بدلا من معلمات الطلب. تفرض رموز النص والصوت فواتير بمعدلات منفصلة.

يعرف أيضا باسم Gemini Live Extended Thinking, Google Gemini 3.8 Live Extended Thinking

realtimespeech to speechaudio inaudio outvideofunction callingreasoningmultilingual

مواصفات Gemini 3.8 Live Extended Thinking

معرّف النموذج
gemini-3-8-live-extended-thinking
المطور
Google
الفئة
توليد الصوت
تاريخ الإصدار
15 سبتمبر 2026
نافذة السياق
128K رمز
أقصى إخراج
65,536 رمز
الإدخال
صوتنصفيديو
الإخراج
صوتنص
نقاط النهاية
WEBSOCKET/v1/realtime
معرّفات نموذج بديلة
gemini-3.8-live-extended-thinkinggoogle/gemini-3.8-live-extended-thinking

أسعار واجهة Gemini 3.8 Live Extended Thinking API

أسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.

النوع
المواصفة
السعر
الإدخال: الصوت
لكل 1M رموز إدخال صوت
$7.80
المدخلات
لكل 1M رموز مطالبة
$2.60
الإنتاج
لكل مليون رمز مولد
$11.70
المخرج: الصوت
لكل مليون رمز صوتي مولد
$31.20
قارن في صفحة الأسعار الكاملة

كيفية استدعاء واجهة Gemini 3.8 Live Extended Thinking API

يجري Gemini 3.8 Live Extended Thinking محادثة مباشرة عبر WebSocket على wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking، وليس عبر نقاط نهاية HTTP. اتصل باستخدام معرف النموذج gemini-3-8-live-extended-thinking وأرسل مفتاح EmpirioLabs API في ترويسة Authorization: Bearer أثناء المصافحة. ينتقل الصوت في الاتجاهين بصيغة PCM 16-بت مرمّزة بـ base64. لا يستطيع المتصفح ضبط الترويسات على WebSocket، لذا افتح هذا الاتصال من خادمك ومرّر الصوت إلى المتصفح عبر مقبسك الخاص. احصل على مفتاح API من لوحة تحكم EmpirioLabs.

Python (websockets)
import asyncio, json, os, websockets

async def main():
    async with websockets.connect(
        "wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking",
        additional_headers=[
            ("Authorization", f"Bearer {os.environ['EMPIRIOLABS_API_KEY']}"),
        ],
        max_size=None,
    ) as ws:
        print(json.loads(await ws.recv())["type"])  # session.created

        await ws.send(json.dumps({
            "type": "conversation.item.create",
            "item": {
                "type": "message",
                "role": "user",
                "content": [{"type": "input_text", "text": "Say hello."}],
            },
        }))
        await ws.send(json.dumps({"type": "response.create"}))

        async for raw in ws:
            event = json.loads(raw)
            if event["type"] == "response.audio.delta":
                ...  # base64 audio chunk, append to your playback buffer
            elif event["type"] == "response.done":
                break

asyncio.run(main())
المرجع الكامل لواجهة Gemini 3.8 Live Extended Thinking API

معلمات واجهة Gemini 3.8 Live Extended Thinking API

معلمات الطلب التي تدعمها واجهة Gemini 3.8 Live Extended Thinking API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.

المعاملالنوعالافتراضيالنطاق / القيمالوصف
voiceenumPuckZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...صوت التحدث للجلسة. ضبطه مع session.update قبل بدء المحادثة؛ لا يمكن تغييره بعد ذلك.
instructionsstring--إرشادات النظام لكيفية تصرف النموذج وتحدثه. ضبطه مع session.update قبل بدء المحادثة.
reasoning_effortenummediumlow, medium, highكم يفكر النموذج في الخلفية أثناء حديثه. الجهد الأعلى يستخدم رموز مخرجات أكثر. ضبطه قبل بدء المحادثة.
temperaturenumber-0 إلى 2قياس درجة الحرارة من 0 إلى 2. القيم الأقل تجعل الردود أكثر اتساقا. ضبطها قبل بدء المحادثة.
input_audio_formatenumpcm16pcm16, pcm24ترميز الصوت الذي ترفقه إلى مخزن الإدخال: pcm16 هو PCM 16-بت base64 عند 16 كيلوهرتز، وpcm24 هو نفسه عند 24 كيلوهرتز.
output_audio_formatenumpcm24pcm24ترميز الصوت الذي يبثه النموذج مرة أخرى: PCM 16-بت عند 24 كيلوهرتز.
turn_detectionstring{"type":"server_vad"}-كشف نشاط الصوت على جانب الخادم. يقرر متى توقفت عن الكلام ويجب أن يرد النموذج. يعمل افتراضيا؛ اضبطه على الصفر لإنهاء كل دور بنفسك باستخدام input_audio_buffer.commit.

معلومات مفيدة

الاتصال صوت ثنائي الجنس بالكامل عبر WebSocket عند wss://api.empiriolabs.ai/v1/realtime?model=gemini-3-8-live-extended-thinking، تم التحقق منه باستخدام رأس حامل التفويض العادي. قم بتكوين الجلسة باستخدام session.update قبل إرسال الصوت الأول: الصوت، التعليمات، كشف الأدوار، والأدوات. يتم إصلاح هذه الإعدادات بمجرد بدء المحادثة. إرسال الصوت والفيديو - إضافة صوت الميكروفون كأحداث input_audio_buffer.append: PCM 16-بت عند 16 كيلوهرتز، أو على 24 كيلوهرتز مع input_audio_format على pcm24. - إضافة إطارات فيديو حية كأحداث input_image_buffer.append، كصور JPEG أو PNG على أساس 64. - كشف نشاط الصوت مفعل افتراضيا، لذا استمر في البث لمدة ثانية تقريبا بعد انتهاء الكلام. اضبط turn_detection على الصفر لإنهاء كل دور بنفسك ب input_audio_buffer.commit. الأصوات واللغة - استخدم أحد الأصوات الثلاثين في قائمة voice، مثل Puck، Kore أو Charon. يتم رفض أي قيمة أخرى. - يرد النموذج باللغة التي تتحدثها. الردود - تدفقات الكلام كأحداث response.audio.delta، PCM 16-بت عند 24 كيلوهرتز، مع الكلمات كأحداث session.update 0__. كلامك الخاص ينسخ أيضا. - التحدث أثناء رد النموذج يقاطعه. المنطق session.update 1__ يحدد مدى تفكير النموذج في الخلفية أثناء حديثه: منخفض، متوسط (الافتراضي) أو عالي. ضبطه قبل بدء المحادثة. - غالبا ما يعترف النموذج بسؤال أولا ويجيب في الدور الثاني. يتم احتساب كل دور بشكل مستقل. الأدوات - استدعاء الدوال باستخدام معلمات مخطط JSON. أعد كل نتيجة كعنصر session.update 2__ مع session.update 3__ الخاص بها. الفوترة يتم تسعير رموز الصوت والنص بشكل منفصل في كلا الاتجاهين، إطارات الفيديو تحسب كرموز إدخال، ورموز الاستدلال تحسب كرموز إخراج. يتم احتساب كل دور مكتمل بمفته من الاستخدام الذي يبلغ عنه النموذج، بما في ذلك رد تقاطعه.

واجهة Gemini 3.8 Live Extended Thinking API: أسئلة شائعة

كم تكلف واجهة Gemini 3.8 Live Extended Thinking API؟

على EmpirioLabs، تتم فوترة Gemini 3.8 Live Extended Thinking حسب الاستخدام: الإدخال: الصوت $7.80 لكل 1M رموز إدخال صوت; المدخلات $2.60 لكل 1M رموز مطالبة; الإنتاج $11.70 لكل مليون رمز مولد; المخرج: الصوت $31.20 لكل مليون رمز صوتي مولد. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.

ما حجم نافذة السياق في Gemini 3.8 Live Extended Thinking؟

يدعم Gemini 3.8 Live Extended Thinking نافذة سياق من 128K رمز، مع ما يصل إلى 65,536 رمز إخراج لكل استجابة.

أي نقطة نهاية يستخدم Gemini 3.8 Live Extended Thinking؟

يُقدَّم Gemini 3.8 Live Extended Thinking عبر WEBSOCKET /v1/realtime على api.empiriolabs.ai مع مصادقة Bearer القياسية.

هل يمكنني تجربة Gemini 3.8 Live Extended Thinking في المتصفح قبل الدمج؟

افتح ملعب EmpirioLabs واضغط Start session لتجربته في المتصفح. يعمل Gemini 3.8 Live Extended Thinking عبر WebSocket بدلاً من طلب واستجابة، لذا ابدأ من دليل البدء السريع للصوت الفوري عند الدمج. اتصل من خادمك باستخدام مفتاح EmpirioLabs API ومعرف النموذج gemini-3-8-live-extended-thinking، ثم مرّر الصوت في الاتجاهين.

كيف أحصل على مفتاح API لنموذج Gemini 3.8 Live Extended Thinking؟

أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.