Gemini 3.8 Flash TTS واجهة برمجة التطبيقات

خطاب تعبيري مع علامات صوتية متداخلة، وتوجيه أسلوب، وحوار بين مكبرين اثنين، عبر 130 لغة ومكتبة تضم أكثر من 2000 صوت.

Googleتوليد الصوتتاريخ الإصدار 22 سبتمبر 2026نقطة نهاية مملوكةجديد

حول Gemini 3.8 Flash TTS

خطاب تعبيري مع علامات صوتية متداخلة، وتوجيه أسلوب، وحوار بين مكبرين اثنين، عبر 130 لغة ومكتبة تضم أكثر من 2000 صوت.

يعرف أيضا باسم Gemini Flash TTS, Google Gemini 3.8 Flash TTS

text to speechmulti speakermultilingualvoice tagsvoice controlstreamingvoice cloning

مواصفات Gemini 3.8 Flash TTS

معرّف النموذج
gemini-3-8-flash-tts
المطور
Google
الفئة
توليد الصوت
تاريخ الإصدار
22 سبتمبر 2026
الإدخال
نص
الإخراج
صوت
نقاط النهاية
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
معرّفات نموذج بديلة
gemini-3.8-flash-ttsgoogle/gemini-3.8-flash-tts

أسعار واجهة Gemini 3.8 Flash TTS API

أسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.

النوع
المواصفة
السعر
المدخلات
لكل 1M رموز مطالبة
$2.60
الإنتاج
لكل مليون رمز مولد
$46.80
قارن في صفحة الأسعار الكاملة

كيفية استدعاء واجهة Gemini 3.8 Flash TTS API

يولّد Gemini 3.8 Flash TTS الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج gemini-3-8-flash-tts. احصل على مفتاح API من لوحة تحكم EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-8-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-8-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
المرجع الكامل لواجهة Gemini 3.8 Flash TTS API

معلمات واجهة Gemini 3.8 Flash TTS API

معلمات الطلب التي تدعمها واجهة Gemini 3.8 Flash TTS API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.

المعاملالنوعالافتراضيالنطاق / القيمالوصف
inputstring-الحد الأقصى 5000نص لتحويله إلى كلام. لوضع تعدد مكبرات الصوت، ضع أسطر بادئة مع Speaker1: / Speaker2:. حتى 5,000 حرف. ضع اتجاه العزاء في style_prompt، وضع هذه العلامات الصوتية في الصف...
modeenumsinglesingle, multiالمفرد = صوت واحد، متعدد = حوارين بصوتين (يستخدم الصوت + الصوت 2 + أسماء المتحدثين).
languagestring--وسم لغة اختياري ل BCP-47 (en-US، es-ES، إلخ). يتم اكتشاف لغة النص تلقائيا. تتحدث الأصوات الثلاثون المدرجة كل لغة مدعومة؛ يجب استخدام صوت المكتبة بلغته الخاصة.
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...اسم الصوت الأساسي (مثل Kore، Puck، Aoede). اترك فارغا للإعداد الافتراضي. هذه ال 30 صوتا تتحدث كل اللغات المدعومة. يعرض /v1/voices GET المكتبة الكاملة لأكثر من 2000...
voice_audio_urlstring--voice=مخصص فقط: رابط HTTPS لتسجيل من 10 إلى 30 ثانية لصوت نظيف وطبيعي من الصوت إلى النسخة (WAV، MP3، M4A، OGG، WEBM أو FLAC). سجله في غرفة هادئة، على نفس الميكروفون...
voice_consent_audio_urlstring--voice=مخصص فقط: رابط https لنفس المتحدث يقرأ هذا البيان بصوت عال: "أنا مالك هذا الصوت وأوافق على استخدام جوجل لهذا الصوت لإنشاء نموذج صوت اصطناعي." نفس العبارة...
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...الاسم الصوتي الثاني لوضع السماعات المتعددة.
speaker1_namestringSpeaker1-اسم العرض المستخدم في بادئة الإدخال لسماعة 1 (الافتراضي: مكبر الصوت 1).
speaker2_namestringSpeaker2-اسم العرض المستخدم في بادئة الإدخال لمكبر الصوت 2 (الافتراضي: مكبر صوت2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWتنسيق ملف الصوت: WAV، MP3، OGG (أوبوس)، أو ALAW / MULAW للهاتف.
speednumber10.25 إلى 2معدل التشغيل. 1.0 = طبيعي؛ <1 أبطأ، >1 أسرع.
volume_gainnumber0-96 إلى 16كسب الإخراج بالديسيبل. 0 = دون تغيير.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000معدل العينة الناتج بالهرتز (8000، 16000، 22050، 24000، 44100، أو 48000).
style_promptstring--توجيه بأسلوب اللغة الطبيعية (مثل "دافئ، محادثي" أو "مذيع أخبار، جاد").

معلومات مفيدة

الحدود - النص: حتى 5,000 حرف لكل طلب - الفوترة الصوتية: 32 رمزا في الثانية من الصوت المولد - 130 لغة. يتم اكتشاف لغة النص تلقائيا. الأصوات - تتحدث 30 صوتا في قائمة voice كل اللغات المدعومة. - GET /v1/voices?model=gemini-3-8-flash-tts تسرد المكتبة الكاملة التي تضم أكثر من 2,000 صوت عبر 30 موقعا، مع اللغة، واللكجة، والجنس، والنغمة، ووصف لكل منها. تصفيتها باستخدام language أو gender أو pitch أو q. أي معرف يعيده يعمل ك voice أو voice2؛ وعندما تضبط language أيضا، استخدم لغة الصوت نفسها. الأصوات المخصصة - اضبط voice على GET /v1/voices?model=gemini-3-8-flash-tts 0__ ومرر تسجيلين لنفس المتحدث البالغ كروابط https: GET /v1/voices?model=gemini-3-8-flash-tts 1__، 10 إلى 30 ثانية من الكلام الطبيعي، و GET /v1/voices?model=gemini-3-8-flash-tts 2__، يقرأ المتحدث "أنا مالك هذا الصوت وأوافق على استخدام جوجل لهذا الصوت لإنشاء نموذج صوت اصطناعي." يتم قبول البيان ب 30 لغة؛ GET /v1/voices?model=gemini-3-8-flash-tts 3__ في هذا المعامل يسرد كل كلمة. - تسجيل كلاهما في غرفة هادئة على نفس الميكروفون. تقبل WAV، MP3، M4A، OGG، WEBM وFLAC، حتى 15 ميجابايت لكل منها. - يشمل الرد GET /v1/voices?model=gemini-3-8-flash-tts 4__ و GET /v1/voices?model=gemini-3-8-flash-tts 5__. مرر GET /v1/voices?model=gemini-3-8-flash-tts 6__ ك GET /v1/voices?model=gemini-3-8-flash-tts 7__ أو GET /v1/voices?model=gemini-3-8-flash-tts 8__ لإعادة استخدام الصوت لمدة 7 أيام دون تسجيلات جديدة. أي شخص لديه التعريف يمكنه استخدام الصوت حتى ينتهي، لذا احتفظ به خاصا. توجيه الإداء - ضع التوجيه للمقطع بأكمله في GET /v1/voices?model=gemini-3-8-flash-tts 9__ بدلا من النص، مثل "دافئ، غير مستعجل، ومطمئن". - ضع علامات الصوت في الصف حيث يجب أن يحدث الصوت. استخدم هذه العلامات الإنجليزية حتى عندما يكون النص بلغة أخرى: '' language 0__' language 1__speaker1_name language 2__speaker2_name language 3__POST language 4 language 5__speed language 6__POST language 7__' فقط.

واجهة Gemini 3.8 Flash TTS API: أسئلة شائعة

كم تكلف واجهة Gemini 3.8 Flash TTS API؟

على EmpirioLabs، تتم فوترة Gemini 3.8 Flash TTS حسب الاستخدام: المدخلات $2.60 لكل 1M رموز مطالبة; الإنتاج $46.80 لكل مليون رمز مولد. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.

أي نقطة نهاية يستخدم Gemini 3.8 Flash TTS؟

يُقدَّم Gemini 3.8 Flash TTS عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.

هل يمكنني تجربة Gemini 3.8 Flash TTS في المتصفح قبل الدمج؟

نعم. يشغّل ملعب EmpirioLabs نموذج Gemini 3.8 Flash TTS في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.

كيف أحصل على مفتاح API لنموذج Gemini 3.8 Flash TTS؟

أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.