
نموذج صوتي في الوقت الحقيقي يأخذ اتجاه التوصيل باللغة الإنجليزية البسيطة، ويحمل هوية صوتية واحدة عبر 200+ لغة، ويبث مع طوابع زمنية للكلمات.
نموذج صوتي في الوقت الحقيقي يأخذ اتجاه التوصيل باللغة الإنجليزية البسيطة، ويحمل هوية صوتية واحدة عبر 200+ لغة، ويبث مع طوابع زمنية للكلمات.
يعرف أيضا باسم Inworld TTS 2
tts-2/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2أسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يولّد TTS 2 الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج tts-2. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)معلمات الطلب التي تدعمها واجهة TTS 2 API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| input | string | - | الحد الأقصى 2000 | النص ليتم تركيبه. الحد الأقصى 2000 حرف لكل طلب؛ قطع نص أطول عند حدود الجمل على العميل. اختياريا، فتح النص باتجاه تسليم بين قوسين بالإنجليزية البسيطة، مثل... |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | ضبط الصوت مسبقا. 20 صوتا مختارا بعناية تغطي الإنجليزية والإسبانية والبرتغالية والهندية ولهجات متنوعة. للحصول على كتالوج الأصوات الكامل (بما في ذلك الأصوات... |
| voice_id | string | - | - | معرف الصوت الحر. يتجاوز الصوت عند تعيينه. استخدم هذا لمعالجة أي صوت خارج قائمة ال 20 الإعداد المختارة، بما في ذلك الأصوات المستنسخة والإقليمية. مرر أي اسم صوتي من... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | رمز لغة BCP-47. هذا النموذج يحمل هوية صوت واحدة عبر 200+ لغة ومحل، لذا يمكنك تمرير أي كود مدعوم هنا حتى لو لم يكن موجودا في القائمة المنسدلة. |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | container/codec صوتي. WAV = LINEAR16 داخل RIFF (منتشر في كل مكان). MP3 / OGG = مضغوط. PCM = خام بدون رؤوس، مفيد للتشغيل الفوري المجزأ. FLAC = بدون فقدان. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | معدل العينة الناتج بتردد 24000 هو الافتراضي في Inworld وهو ما تتدرب عليه نماذج الصوت لديهم؛ رفعت إلى 48000 لجودة البث. |
| speed | number | 1 | 0.5 إلى 1.5 | مضاعف معدل التحدث (Speech rate) المضاعف. 0.5 = نصف سرعة، 1.5 = أسرع بنسبة 50٪. |
| temperature | number | 1 | 0.1 إلى 2 | تعبير الصوت / التنوع. أقل = أكثر اتساقا / "مسطحا"؛ أعلى = أكثر تعبيرا ولكن هناك تنوع أكبر بين التصاميم. |
| bit_rate | number | 128000 | 32000 إلى 320000 | معدل البت بوحدة bps ل MP3 / OGG_OPUS. تم تجاهلها في ترميزات أخرى. |
| apply_text_normalization | enum | ON | ON, OFF | عند ON، توسع Inworld الأرقام / الاختصارات / التواريخ إلى شكل منطوق ("USD 5" → "خمسة دولارات أمريكية"). |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | إذا لم يكن هناك أي رسم، يتضمن الرد طوابع زمنية لكل كلمة أو لكل حرف في timestamp_info. مفيد للترجمة / واجهات الإضاءة (IL). |
الحدود - الحد الأقصى للإدخال: 2,000 حرف لكل طلب (نص أطول عند حدود الجمل) - WebSocket: 20 اتصالا متزامن، 5 contexts/connection - رسالة لكل WS: 1,000 حرف اتجاه الصوت - افتح النص بتعليمات بين قوسين بالإنجليزية البسيطة لتوجيه التسليم، مثل [whispering] أو [excited] أو [Speak warmly, like you are greeting an old friend] - يعامل النص بين قوسين كاتجاه ولا يقرأ بصوت عال - يحتسب نص الاتجاه ضمن إجمالي الحرف المفوترة، لذا اجعلها قصيرة التأخير - p90 TTFB: أقل من 100 مللي ثانية (معيار Inworld) الأصوات - هوية صوتية واحدة محفوظة عبر 200+ لغة ومحل، بما في ذلك تبديل اللغة في منتصف الجيل - إعدادات منسقة في القائمة المنسدلة؛ تمرير أي معرف صوتي آخر عبر voice_id
على EmpirioLabs، تتم فوترة TTS 2 حسب الاستخدام. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم TTS 2 عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج TTS 2 في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.