
text-to-speech مبنية على نماذج اللغة الكبيرة مع استنساخ صوتي بدون لقطة من 3 إلى 10 ثوان من الصوت وإخراج قابل للتحكم في التعبير عن المشاعر عبر التعلم المعزز متعدد المكافآت.
text-to-speech مبنية على نماذج اللغة الكبيرة مع استنساخ صوتي بدون لقطة من 3 إلى 10 ثوان من الصوت وإخراج قابل للتحكم في التعبير عن المشاعر عبر التعلم المعزز متعدد المكافآت.
يعرف أيضا باسم Z.ai GLM TTS, GLM-TTS
glm-tts/v1/audio/speechzhipu/glm-ttsأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يولّد GLM TTS الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج glm-tts. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "glm-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)معلمات الطلب التي تدعمها واجهة GLM TTS API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| input | string | - | - | نص لتركيبه. لاستخدام علامات [S1] / [S2] أو أسطر 'مكبر الصوت N:'. |
| voice | enum | emma | emma, james, arthur, xiaomei, zhigang, custom | إيما = أنثى إنجليزية، جيمس = ذكر أمريكي، آرثر = ذكر أمريكي بديل، شياومي = أنثى صينية، تشيغانغ = ذكر صيني، مخصص = رفع مرجع عبر voice_audio_url. |
| voice_audio_url | string | - | - | مرجع عنوان الصوت لاستنساخ الصوت المخصص. يجب أن يحتوي التسجيل المرجعي على أن المتحدث يقرأ هذه العبارة بالضبط بصوت عال، بصوته الخاص: "أوافق على Empirio Labs استنساخ... |
| output_format | enum | mp3 | mp3, wav | تنسيق ملف وسائط الإخراج (mp3، wav، mp4، png، jpg، إلخ، حسب نقطة النهاية). |
| speed | number | 1 | 0.5 إلى 2 | مضاعف معدل التحدث (Speech rate) المضاعف. |
| model_quality | enum | quality | quality, fast | الجودة=FP16 (أفضل)، سريع=INT8 (أسرع) |
| sample_rate | enum | 24000 | 24000, 16000 | معدل العينة الناتج بالهرتز. |
| volume | number | 1 | 0.1 إلى 2 | مضاعف كسب الإخراج. |
| use_cache | boolean | true | - | يسرع الأجيال المتطابقة المتكررة. |
| optimize_input | boolean | true | - | تصحيح النطق التلقائي للمصطلحات التقنية، والاختصارات، والأحرف الخاصة. |
| seed | number | - | - | بذور قابلية التكرار. |
الحدود - الحد الأقصى للإدخال: 5,000 حرف - التوليد: 5-10 دقائق استنساخ الصوت - الصوت المرجعي: 3-10 ثوان - الصيغ المقبولة: WAV، MP3، OGG، FLAC، AAC، M4A، WebM الأصوات المسبقة - إيما (الإنجليزية F) - جيمس (US M) - آرثر (بريطاني M) - xiaomei (صينية F) - zhigang (صينية M)
على EmpirioLabs، تتم فوترة GLM TTS حسب الاستخدام: فاست (INT8) $0.20 لكل 1000 حرف; الجودة (FP16) $0.21 لكل 1000 حرف. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم GLM TTS عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج GLM TTS في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.