
خطاب تعبيري مع علامات صوتية متداخلة، وتوجيه أسلوب، وحوار بين مكبرين اثنين، عبر 130 لغة ومكتبة تضم أكثر من 2000 صوت.
خطاب تعبيري مع علامات صوتية متداخلة، وتوجيه أسلوب، وحوار بين مكبرين اثنين، عبر 130 لغة ومكتبة تضم أكثر من 2000 صوت.
يعرف أيضا باسم Gemini Flash TTS, Google Gemini 3.8 Flash TTS
gemini-3-8-flash-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesgemini-3.8-flash-ttsgoogle/gemini-3.8-flash-ttsأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يولّد Gemini 3.8 Flash TTS الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج gemini-3-8-flash-tts. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3-8-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)معلمات الطلب التي تدعمها واجهة Gemini 3.8 Flash TTS API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| input | string | - | الحد الأقصى 5000 | نص لتحويله إلى كلام. لوضع تعدد مكبرات الصوت، ضع أسطر بادئة مع Speaker1: / Speaker2:. حتى 5,000 حرف. ضع اتجاه العزاء في style_prompt، وضع هذه العلامات الصوتية في الصف... |
| mode | enum | single | single, multi | المفرد = صوت واحد، متعدد = حوارين بصوتين (يستخدم الصوت + الصوت 2 + أسماء المتحدثين). |
| language | string | - | - | وسم لغة اختياري ل BCP-47 (en-US، es-ES، إلخ). يتم اكتشاف لغة النص تلقائيا. تتحدث الأصوات الثلاثون المدرجة كل لغة مدعومة؛ يجب استخدام صوت المكتبة بلغته الخاصة. |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | اسم الصوت الأساسي (مثل Kore، Puck، Aoede). اترك فارغا للإعداد الافتراضي. هذه ال 30 صوتا تتحدث كل اللغات المدعومة. يعرض /v1/voices GET المكتبة الكاملة لأكثر من 2000... |
| voice_audio_url | string | - | - | voice=مخصص فقط: رابط HTTPS لتسجيل من 10 إلى 30 ثانية لصوت نظيف وطبيعي من الصوت إلى النسخة (WAV، MP3، M4A، OGG، WEBM أو FLAC). سجله في غرفة هادئة، على نفس الميكروفون... |
| voice_consent_audio_url | string | - | - | voice=مخصص فقط: رابط https لنفس المتحدث يقرأ هذا البيان بصوت عال: "أنا مالك هذا الصوت وأوافق على استخدام جوجل لهذا الصوت لإنشاء نموذج صوت اصطناعي." نفس العبارة... |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | الاسم الصوتي الثاني لوضع السماعات المتعددة. |
| speaker1_name | string | Speaker1 | - | اسم العرض المستخدم في بادئة الإدخال لسماعة 1 (الافتراضي: مكبر الصوت 1). |
| speaker2_name | string | Speaker2 | - | اسم العرض المستخدم في بادئة الإدخال لمكبر الصوت 2 (الافتراضي: مكبر صوت2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | تنسيق ملف الصوت: WAV، MP3، OGG (أوبوس)، أو ALAW / MULAW للهاتف. |
| speed | number | 1 | 0.25 إلى 2 | معدل التشغيل. 1.0 = طبيعي؛ <1 أبطأ، >1 أسرع. |
| volume_gain | number | 0 | -96 إلى 16 | كسب الإخراج بالديسيبل. 0 = دون تغيير. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | معدل العينة الناتج بالهرتز (8000، 16000، 22050، 24000، 44100، أو 48000). |
| style_prompt | string | - | - | توجيه بأسلوب اللغة الطبيعية (مثل "دافئ، محادثي" أو "مذيع أخبار، جاد"). |
الحدود - النص: حتى 5,000 حرف لكل طلب - الفوترة الصوتية: 32 رمزا في الثانية من الصوت المولد - 130 لغة. يتم اكتشاف لغة النص تلقائيا. الأصوات - تتحدث 30 صوتا في قائمة voice كل اللغات المدعومة. - GET /v1/voices?model=gemini-3-8-flash-tts تسرد المكتبة الكاملة التي تضم أكثر من 2,000 صوت عبر 30 موقعا، مع اللغة، واللكجة، والجنس، والنغمة، ووصف لكل منها. تصفيتها باستخدام language أو gender أو pitch أو q. أي معرف يعيده يعمل ك voice أو voice2؛ وعندما تضبط language أيضا، استخدم لغة الصوت نفسها. الأصوات المخصصة - اضبط voice على GET /v1/voices?model=gemini-3-8-flash-tts 0__ ومرر تسجيلين لنفس المتحدث البالغ كروابط https: GET /v1/voices?model=gemini-3-8-flash-tts 1__، 10 إلى 30 ثانية من الكلام الطبيعي، و GET /v1/voices?model=gemini-3-8-flash-tts 2__، يقرأ المتحدث "أنا مالك هذا الصوت وأوافق على استخدام جوجل لهذا الصوت لإنشاء نموذج صوت اصطناعي." يتم قبول البيان ب 30 لغة؛ GET /v1/voices?model=gemini-3-8-flash-tts 3__ في هذا المعامل يسرد كل كلمة. - تسجيل كلاهما في غرفة هادئة على نفس الميكروفون. تقبل WAV، MP3، M4A، OGG، WEBM وFLAC، حتى 15 ميجابايت لكل منها. - يشمل الرد GET /v1/voices?model=gemini-3-8-flash-tts 4__ و GET /v1/voices?model=gemini-3-8-flash-tts 5__. مرر GET /v1/voices?model=gemini-3-8-flash-tts 6__ ك GET /v1/voices?model=gemini-3-8-flash-tts 7__ أو GET /v1/voices?model=gemini-3-8-flash-tts 8__ لإعادة استخدام الصوت لمدة 7 أيام دون تسجيلات جديدة. أي شخص لديه التعريف يمكنه استخدام الصوت حتى ينتهي، لذا احتفظ به خاصا. توجيه الإداء - ضع التوجيه للمقطع بأكمله في GET /v1/voices?model=gemini-3-8-flash-tts 9__ بدلا من النص، مثل "دافئ، غير مستعجل، ومطمئن". - ضع علامات الصوت في الصف حيث يجب أن يحدث الصوت. استخدم هذه العلامات الإنجليزية حتى عندما يكون النص بلغة أخرى: '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__' فقط.
على EmpirioLabs، تتم فوترة Gemini 3.8 Flash TTS حسب الاستخدام: المدخلات $2.60 لكل 1M رموز مطالبة; الإنتاج $46.80 لكل مليون رمز مولد. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم Gemini 3.8 Flash TTS عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج Gemini 3.8 Flash TTS في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.