المنزل المدونة

كيفية استخدام Gemini 3.8 Flash TTS و Flash-Lite TTS

فلاش TTS وFlash-Lite في Gemini 3.8 عبر واجهة برمجة التطبيقات

Sep 23, 2026

EmpirioLabs AI

تتوفر أجهزة جيميني 3.8 فلاش TTS وجيميني 3.8 فلاش-لايت TTS على EmpirioLabs. كلاهما يحول النص إلى كلام من خلال ما بعد /v1/audio/speech، بث الصوت من خلال ما بعد /v1/audio/speech:stream، ويستمد على نفس المكتبة التي تضم أكثر من 2000 صوت. كلاهما يعمل في واجهة برمجة التطبيقات وفي Playground.

الطرازان

  • gemini-3-8-flash-tts تم تصميمه للتوجيه الإبداعي: السرد، الكتب الصوتية، الشخصيات، والمشاهد ذات المتحدثين المزدوجين. يغطي 130 لغة.
  • gemini-3-8-flash-lite-tts تم تصميمه للأعمال ذات الحجم العالي مثل وكلاء الصوت، الدبلجة، والصوت الجماعي، مع معدل أقل للصوت المولد. يغطي 101 لغة.

كلا الطرازين يأخذان نفس جسم الطلب، لذا التبديل بينهما هو تغيير النموذج.

طلبك الأول

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -H "CONTENT-TYPE: application/json" \ -d '{ "model": "gemini-3-8-flash-tts", "input": "مرحبا بعودتك. <توقف قصير> هذا ما تغير هذا الأسبوع.", "voice": "Kore", "style_prompt": "دافئ وغير مستعجل" }'

تحمل الاستجابة عنوان URL الموقع للصوت المولد. الصيغة الافتراضية هي WAV عند 24,000 هرتز. التعيين output_format إلى MP3, OGG, ألو، أو مولاو، و sample_rate إلى أي من 8,000، 16,000، 22,050، 24,000، 44,100، أو 48,000 هرتز.

إخراج العرض

  • توجيه الأسلوب. style_prompt تحدد نغمة المقطع بأكمله، مثل "هادئ ومطمئن" أو "معلق رياضي متحمس".
  • علامات صوتية. وسوم مثل <laugh>, <sigh>, <breath>، و <توقف قصير> ادخل إلى الخط حيث يجب أن يحدث الصوت. القائمة الكاملة موجودة على المدخلات المعلمة في مرجع النموذج. استخدم العلامات الإنجليزية حتى عندما يكون النص بلغة أخرى.
  • تأكيد. اكتب كلمة بحرف كبير لتأكيد ذلك.

حوار مكون من متحدثين

المجموعة الوضع إلى متعدد، اختر صوتا لكل مكبر مع الصوت و صوت 2، وتبدأ كل سطر باسم المتحدث ونقطتين. يجب أن تتطابق الأسماء speaker1_name و speaker2_name، والتي تطلق افتراضيا على المتحدث1 و المتحدث2.

{ "model": "gemini-3-8-flash-lite-tts", "mode": "multi", "speaker1_name": "Maya", "speaker2_name": "Theo", "voice": "Aoede", "voice2": "Puck", "input": "Maya: هل وصلت الشحنة؟\nثيو: وصلت.<laugh> كل صندوق، في الوقت المحدد." }

اختيار الصوت

الثلاثون صوتا في الصوت قائمة مثل كوري، بوك، شارون، وأويدي، تتحدث كل اللغات المدعومة. تحتوي المكتبة الكاملة على أكثر من 2000 صوت عبر 30 موقعا، كل منها له لغة، لهجة، جنس، نغمة، ووصف. أدرجها مع اذهب /v1/voices وتصفية بواسطة اللغة, الجنس, الزاوية، أو مصطلح بحث مع q:

curl "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY"

أي معرف صوتي يعود إليه الإعلان يعمل الصوت و صوت 2.

البث المباشر

ما بعد /v1/audio/speech:stream يأخذ نفس الجسم ويعيد الأحداث المرسلة من الخادم: audio.chunk الأحداث التي تحمل PCM 16-بت base64 عند 24,000 هرتز أثناء توليد الصوت، ثم واحدة audio.done حدث مع رابط للملف الكامل بالتنسيق المطلوب.

ملاحظات تشغيلية

  1. النصوص المكتوبة ل Gemini 3.1 Flash TTS تحتاج إلى إعادة كتابة وسومها. تستخدم موديلات 3.8 علامات بزاوية حوامل مثل <whispers> و <laugh> بدلا من الوسوم ذات الأقواس المربعة التي يستخدمها 3.1. قم بتحديث العلامات عند نقل السكريبت عبر الوسوم المربعة.
  2. صوت المكتبة يحتفظ بلغته الخاصة. عندما تضبط اللغة مع صوت المكتبة، يجب أن يكون موقع ذلك الصوت: fr-fr-advisor-1 مع أمريكا مرفوض. تقبل الأصوات الثلاثون متعددة اللغات أي لغة.
  3. يجب أن تتطابق تسميات الحوار مع أسماء المتحدثين. في متعدد الوضع، النص قبل رفض السطر الأول المعنون، والسطر الذي لا يتطابق تسميته مع أي منهما speaker1_name ولا speaker2_name يقرأ كجزء من الدور السابق.
  4. السرعة ينطبق على الملفات الكاملة. نقطة النهاية المتدفقة ترفض السرعة باستثناء الإصدار 1.0. اطلب الملف من ما بعد /v1/audio/speech عندما تحتاج إلى سرعة مختلفة.

التسعير

كلا الطرازين يقدمان الدفع حسب الاستخدام، بدون اشتراك. يتم احتساب الطلب على رموز النص المدخلة والصوت المولد، بمعدل 32 رمزا صوتيا في الثانية من الكلام، وFlash-Lite لديه معدل أقل للصوت المولد. المعدلات الحالية موجودة في صفحات النماذج ل جيميني 3.8 فلاش TTS و جيميني 3.8 فلاش-لايت TTS وعلى صفحة الأسعار.

ابدأ البناء

حاول جيميني 3.8 فلاش TTS أو جيميني 3.8 فلاش-لايت TTS في Playground، واقرأ مرجع API ل فلاش و فلاش-لايت.

للمحادثات الصوتية الفورية من نفس العائلة، انظر كيفية استخدام Gemini 3.8 Live وLive Extended Thinking.

إفصاح: كتب هذا المقال بمساعدة الذكاء الاصطناعي وتمت مراجعته من قبل EmpirioLabs AI.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

استكشف نماذجنا، أو تواصل معنا بشأن استفسارات الأعمال، أو النشر المخصص، أو أي شيء آخر.