Gemini 3.1 Flash TTS واجهة برمجة التطبيقات

TTS قابل للتحكم بدرجة عالية مع علامات صوتية جديدة لأسلوب دقيق، ونبرة، وسرعة، وأداء عبر السرد والمساعدين وتطبيقات الصوت.

Googleتوليد الصوتتاريخ الإصدار 13 أبريل 2026نقطة نهاية مملوكة

حول Gemini 3.1 Flash TTS

TTS قابل للتحكم بدرجة عالية مع علامات صوتية جديدة لأسلوب دقيق، ونبرة، وسرعة، وأداء عبر السرد والمساعدين وتطبيقات الصوت.

يعرف أيضا باسم Gemini Flash TTS, Google Gemini 3.1 Flash TTS, Gemini-3.1-Flash-TTS, gemini-3-1-flash-tts

text to speechmulti speakermultilingual

مواصفات Gemini 3.1 Flash TTS

معرّف النموذج
gemini-3-1-flash-tts
المزود
Google
الفئة
توليد الصوت
تاريخ الإصدار
13 أبريل 2026
الإدخال
نص
الإخراج
صوت
نقاط النهاية
POST/v1/audio/speech
معرّفات نموذج بديلة
gemini-3.1-flash-ttsgoogle/gemini-3.1-flash-tts

أسعار واجهة Gemini 3.1 Flash TTS API

أسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.

النوع
المواصفة
السعر
المدخلات
لكل 1M رموز مطالبة
$2.60
الإنتاج
لكل مليون رمز مولد
$52.00
قارن في صفحة الأسعار الكاملة

كيفية استدعاء واجهة Gemini 3.1 Flash TTS API

يولّد Gemini 3.1 Flash TTS الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج gemini-3-1-flash-tts. احصل على مفتاح API من لوحة تحكم EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3-1-flash-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "gemini-3-1-flash-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
المرجع الكامل لواجهة Gemini 3.1 Flash TTS API

معلمات واجهة Gemini 3.1 Flash TTS API

معلمات الطلب التي تدعمها واجهة Gemini 3.1 Flash TTS API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.

المعاملالنوعالافتراضيالنطاق / القيمالوصف
inputstring--نص لتحويله إلى كلام. لوضع السماعات المتعددة، الأسطر التي تحمل بادئة Speaker1: / Speaker2:.
modeenumsinglesingle, multiالمفرد = صوت واحد، متعدد = حوارين بصوتين (يستخدم الصوت + الصوت 2 + أسماء المتحدثين).
languagestringen-US-وسم اللغة BCP-47 (en-US، es-ES، إلخ) لإشارات النطق.
voiceenumCharonZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...اسم الصوت الأساسي (مثل كوري، بوك، أويدي). اترك الرقم فارغا للافتراضي.
voice2enumKoreZephyr, Puck, Charon, Kore, Fenrir, Leda, Orus, Aoede, Callir...الاسم الصوتي الثاني لوضع السماعات المتعددة.
speaker1_namestringSpeaker1-اسم العرض المستخدم في بادئة الإدخال لسماعة 1 (الافتراضي: مكبر الصوت 1).
speaker2_namestringSpeaker2-اسم العرض المستخدم في بادئة الإدخال لمكبر الصوت 2 (الافتراضي: مكبر صوت2).
output_formatenumWAVWAV, MP3, OGG, ALAW, MULAWتنسيق ملفات الصوت (mp3، wav، opus، flac، إلخ).
speednumber10.25 إلى 2معدل التشغيل. 1.0 = طبيعي؛ <1 أبطأ، >1 أسرع.
volume_gainnumber0-96 إلى 16كسب الإخراج بالديسيبل. 0 = دون تغيير.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000معدل العينة الناتج بالهرتز (8000، 16000، 24000، 44100، 48000).
style_promptstring--توجيه بأسلوب اللغة الطبيعية (مثل "دافئ، محادثي" أو "مذيع أخبار، جاد").

معلومات مفيدة

أكثر أجهزة Gemini TTS قابلية للتحكم حتى الآن. الحدود - طلب النص + الأسلوب: 4,000 بايت لكل منها (8,000 مجتمعة) - أقصى إخراج: ~10 دقائق - الفوترة الصوتية: ~25 رمزا في الثانية (~15 chars/s) - اللغة يتم اكتشافها تلقائيا؛ إعداد اللغة هو تلميح، وليس قيدا علامات صوتية داخلية (توصيل التحكم) - المشاعر: [whispers]، [shouts]، [laughs]، [sighs]، [cheerful]، [sad]، [angry]، إلخ. - السرعة: [slow]، [fast]، [whispers] 0__، [whispers] 1__ - التوقفات: [whispers] 2__، [whispers] 3__، [whispers] 4__ - التأكيد: [whispers] 5__، [whispers] 6__، [whispers] 7__، [whispers] 8__، [whispers] 9__، [shouts] 0__

واجهة Gemini 3.1 Flash TTS API: أسئلة شائعة

كم تكلف واجهة Gemini 3.1 Flash TTS API؟

على EmpirioLabs، تتم فوترة Gemini 3.1 Flash TTS حسب الاستخدام: المدخلات $2.60 لكل 1M رموز مطالبة; الإنتاج $52.00 لكل مليون رمز مولد. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.

أي نقطة نهاية يستخدم Gemini 3.1 Flash TTS؟

يُقدَّم Gemini 3.1 Flash TTS عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.

هل يمكنني تجربة Gemini 3.1 Flash TTS في المتصفح قبل الدمج؟

نعم. يشغّل ملعب EmpirioLabs نموذج Gemini 3.1 Flash TTS في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.

كيف أحصل على مفتاح API لنموذج Gemini 3.1 Flash TTS؟

أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.