تتوفر أجهزة جيميني 3.8 فلاش TTS وجيميني 3.8 فلاش-لايت TTS على EmpirioLabs. كلاهما يحول النص إلى كلام من خلال ما بعد /v1/audio/speech، بث الصوت من خلال ما بعد /v1/audio/speech:stream، ويستمد على نفس المكتبة التي تضم أكثر من 2000 صوت. كلاهما يعمل في واجهة برمجة التطبيقات وفي Playground.
الطرازان
gemini-3-8-flash-ttsتم تصميمه للتوجيه الإبداعي: السرد، الكتب الصوتية، الشخصيات، والمشاهد ذات المتحدثين المزدوجين. يغطي 130 لغة.gemini-3-8-flash-lite-ttsتم تصميمه للأعمال ذات الحجم العالي مثل وكلاء الصوت، الدبلجة، والصوت الجماعي، مع معدل أقل للصوت المولد. يغطي 101 لغة.
كلا الطرازين يأخذان نفس جسم الطلب، لذا التبديل بينهما هو تغيير النموذج.
طلبك الأول
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -H "CONTENT-TYPE: application/json" \ -d '{ "model": "gemini-3-8-flash-tts", "input": "مرحبا بعودتك. <توقف قصير> هذا ما تغير هذا الأسبوع.", "voice": "Kore", "style_prompt": "دافئ وغير مستعجل" }'
تحمل الاستجابة عنوان URL الموقع للصوت المولد. الصيغة الافتراضية هي WAV عند 24,000 هرتز. التعيين output_format إلى MP3, OGG, ألو، أو مولاو، و sample_rate إلى أي من 8,000، 16,000، 22,050، 24,000، 44,100، أو 48,000 هرتز.
إخراج العرض
- توجيه الأسلوب.
style_promptتحدد نغمة المقطع بأكمله، مثل "هادئ ومطمئن" أو "معلق رياضي متحمس". - علامات صوتية. وسوم مثل
<laugh>,<sigh>,<breath>، و<توقف قصير>ادخل إلى الخط حيث يجب أن يحدث الصوت. القائمة الكاملة موجودة علىالمدخلاتالمعلمة في مرجع النموذج. استخدم العلامات الإنجليزية حتى عندما يكون النص بلغة أخرى. - تأكيد. اكتب كلمة بحرف كبير لتأكيد ذلك.
حوار مكون من متحدثين
المجموعة الوضع إلى متعدد، اختر صوتا لكل مكبر مع الصوت و صوت 2، وتبدأ كل سطر باسم المتحدث ونقطتين. يجب أن تتطابق الأسماء speaker1_name و speaker2_name، والتي تطلق افتراضيا على المتحدث1 و المتحدث2.
{ "model": "gemini-3-8-flash-lite-tts", "mode": "multi", "speaker1_name": "Maya", "speaker2_name": "Theo", "voice": "Aoede", "voice2": "Puck", "input": "Maya: هل وصلت الشحنة؟\nثيو: وصلت.<laugh> كل صندوق، في الوقت المحدد." }
اختيار الصوت
الثلاثون صوتا في الصوت قائمة مثل كوري، بوك، شارون، وأويدي، تتحدث كل اللغات المدعومة. تحتوي المكتبة الكاملة على أكثر من 2000 صوت عبر 30 موقعا، كل منها له لغة، لهجة، جنس، نغمة، ووصف. أدرجها مع اذهب /v1/voices وتصفية بواسطة اللغة, الجنس, الزاوية، أو مصطلح بحث مع q:
curl "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY"
أي معرف صوتي يعود إليه الإعلان يعمل الصوت و صوت 2.
البث المباشر
ما بعد /v1/audio/speech:stream يأخذ نفس الجسم ويعيد الأحداث المرسلة من الخادم: audio.chunk الأحداث التي تحمل PCM 16-بت base64 عند 24,000 هرتز أثناء توليد الصوت، ثم واحدة audio.done حدث مع رابط للملف الكامل بالتنسيق المطلوب.
ملاحظات تشغيلية
- النصوص المكتوبة ل Gemini 3.1 Flash TTS تحتاج إلى إعادة كتابة وسومها. تستخدم موديلات 3.8 علامات بزاوية حوامل مثل
<whispers>و<laugh>بدلا من الوسوم ذات الأقواس المربعة التي يستخدمها 3.1. قم بتحديث العلامات عند نقل السكريبت عبر الوسوم المربعة. - صوت المكتبة يحتفظ بلغته الخاصة. عندما تضبط
اللغةمع صوت المكتبة، يجب أن يكون موقع ذلك الصوت:fr-fr-advisor-1معأمريكامرفوض. تقبل الأصوات الثلاثون متعددة اللغات أي لغة. - يجب أن تتطابق تسميات الحوار مع أسماء المتحدثين. في
متعددالوضع، النص قبل رفض السطر الأول المعنون، والسطر الذي لا يتطابق تسميته مع أي منهماspeaker1_nameولاspeaker2_nameيقرأ كجزء من الدور السابق. السرعةينطبق على الملفات الكاملة. نقطة النهاية المتدفقة ترفضالسرعةباستثناء الإصدار 1.0. اطلب الملف منما بعد /v1/audio/speechعندما تحتاج إلى سرعة مختلفة.
التسعير
كلا الطرازين يقدمان الدفع حسب الاستخدام، بدون اشتراك. يتم احتساب الطلب على رموز النص المدخلة والصوت المولد، بمعدل 32 رمزا صوتيا في الثانية من الكلام، وFlash-Lite لديه معدل أقل للصوت المولد. المعدلات الحالية موجودة في صفحات النماذج ل جيميني 3.8 فلاش TTS و جيميني 3.8 فلاش-لايت TTS وعلى صفحة الأسعار.
ابدأ البناء
حاول جيميني 3.8 فلاش TTS أو جيميني 3.8 فلاش-لايت TTS في Playground، واقرأ مرجع API ل فلاش و فلاش-لايت.
للمحادثات الصوتية الفورية من نفس العائلة، انظر كيفية استخدام Gemini 3.8 Live وLive Extended Thinking.
إفصاح: كتب هذا المقال بمساعدة الذكاء الاصطناعي وتمت مراجعته من قبل EmpirioLabs AI.



