
text-to-speech منخفض التأخير مع أصوات مكبرات صوت واحدة ومتعددة وأسلوب ولهجة ونبرة تعبيرية قابلة للتحكم في تطبيقات الإنتاج.
text-to-speech منخفض التأخير مع أصوات مكبرات صوت واحدة ومتعددة وأسلوب ولهجة ونبرة تعبيرية قابلة للتحكم في تطبيقات الإنتاج.
يعرف أيضا باسم Gemini Flash TTS, Google Gemini 2.5 Flash TTS, Gemini-2.5-Flash-TTS, gemini-2-5-flash-tts
gemini-2-5-flash-tts/v1/audio/speechgemini-2.5-flash-ttsgoogle/gemini-2.5-flash-ttsأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يولّد Gemini 2.5 Flash TTS الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج gemini-2-5-flash-tts. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2-5-flash-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "gemini-2-5-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)معلمات الطلب التي تدعمها واجهة Gemini 2.5 Flash TTS API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| input | string | - | - | نص لتحويله إلى كلام. لوضع السماعات المتعددة، الأسطر التي تحمل بادئة Speaker1: / Speaker2:. |
| mode | enum | single | single, multi | المفرد = صوت واحد، متعدد = حوارين بصوتين (يستخدم الصوت + الصوت 2 + أسماء المتحدثين). |
| language | string | en-US | - | وسم اللغة BCP-47 (en-US، es-ES، إلخ) لإشارات النطق. |
| voice | enum | Charon | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | اسم الصوت الأساسي (مثل كوري، بوك، أويدي). اترك الرقم فارغا للافتراضي. |
| voice2 | enum | Kore | Zephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir... | الاسم الصوتي الثاني لوضع السماعات المتعددة. |
| speaker1_name | string | Speaker1 | - | اسم العرض المستخدم في بادئة الإدخال لسماعة 1 (الافتراضي: مكبر الصوت 1). |
| speaker2_name | string | Speaker2 | - | اسم العرض المستخدم في بادئة الإدخال لمكبر الصوت 2 (الافتراضي: مكبر صوت2). |
| output_format | enum | WAV | WAV, MP3, OGG, ALAW, MULAW | تنسيق ملفات الصوت (mp3، wav، opus، flac، إلخ). |
| speed | number | 1 | 0.25 إلى 2 | معدل التشغيل. 1.0 = طبيعي؛ <1 أبطأ، >1 أسرع. |
| volume_gain | number | 0 | -96 إلى 16 | كسب الإخراج بالديسيبل. 0 = دون تغيير. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | معدل العينة الناتج بالهرتز (8000، 16000، 24000، 44100، 48000). |
| style_prompt | string | - | - | توجيه بأسلوب اللغة الطبيعية (مثل "دافئ، محادثي" أو "مذيع أخبار، جاد"). |
الأوضاع - مكبر صوت واحد - متعدد مكبرات الصوت (بحد أقصى صوتين), يجب أن يكون النص بصيغة SpeakerName: text القيد - نص + موجه الأسلوب: 4,000 بايت لكل منها - الفوترة الصوتية: ~32 رمزا في الثانية من الصوت المولد (~10-15 chars/s) الأصوات واللغات - 30+ خيار صوتي عبر emotional/tonal حرف - 24+ موقع لغوي مدعوم صيغ الإخراج - MP3، WAV، OGG
على EmpirioLabs، تتم فوترة Gemini 2.5 Flash TTS حسب الاستخدام: المدخلات $1.50 لكل 1M رموز مطالبة; الإنتاج $30.00 لكل مليون رمز مولد. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم Gemini 2.5 Flash TTS عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج Gemini 2.5 Flash TTS في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.