
تركيب الكلام الطبقي مع أكثر من 1000 صوت، 16 لغة، 20 لهجة صينية، توجيه للتعبير باللغة الطبيعية، وعلامات المشاعر الداخلية.
تركيب الكلام الطبقي مع أكثر من 1000 صوت، 16 لغة، 20 لهجة صينية، توجيه للتعبير باللغة الطبيعية، وعلامات المشاعر الداخلية.
اختيار الصوت مطابق للمستوى: معرفات الصوت الأساسية تعمل على كلا المستويين ويتم مطابقتها تلقائيا مع model_tier المختار، بينما الأصوات الستة في النظام مقفلة بمستوى واحد. النغمة أيضا تغير وتيرة الصوت المعروض، لذا قم بإقناعه بالسرعة عندما تريد الحفاظ على المدة الأصلية.
يعرف أيضا باسم Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS
qwen-audio-3-0-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesqwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flashأسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.
يولّد Qwen Audio 3.0 TTS الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج qwen-audio-3-0-tts. احصل على مفتاح API من لوحة تحكم EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-0-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)معلمات الطلب التي تدعمها واجهة Qwen Audio 3.0 TTS API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.
| المعامل | النوع | الافتراضي | النطاق / القيم | الوصف |
|---|---|---|---|---|
| input | string | - | الحد الأقصى 20000 | نص لتركيبه. يصل إلى 20,000 حرف لكل طلب. يدعم علامات التعبير الداخلي الموضوعة مباشرة في النص، مثل [متحمس]، [ضحك]، [همس]، [تنهد]، [شهقة]، و[ساخر]. |
| model_tier | enum | plus | plus, flash | بالإضافة إلى ذلك: أعلى جودة صوتية وتعبير، الأفضل لإنشاء المحتوى، الكتب الصوتية، الدبلجة، والعمل الصوتي للعلامة التجارية. فلاش: مضبوط للتفاعل في الوقت الحقيقي مع... |
| voice | enum | loongjameszhao | loongjameszhao, loongolivialin, loonglunawang, loongnorahu, l... | إعداد الصوت مسبقا. الأصوات الأساسية تعمل في كلا المستويين، لذا تغيير model_tier يحافظ على اختيارك. ستة أصوات رئيسية تم تثبيت المستوى: longanlingxin و longanlufeng... |
| voice_id | string | - | - | معرف الصوت الحر، الذي يتجاوز الصوت عند تعيينه. يقبل أي صوت أساسي من GET /v1/voices، إما كمعرف فارغ (موصى به، يعمل على كلا المستويين) أو كمعرف مؤهل بالكامل. يتم... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | معدل عينة الإخراج بالهرتز. 24000 يناسب تشغيل الكلام، و48000 يعطي إخراج بجودة بث عند حجم ملف أكبر. |
| speed | number | 1 | 0.5 إلى 2 | مضاعف معدل التحدث. 0.5 هو نصف السرعة و2.0 هو ضعف السرعة. |
| pitch | number | 1 | 0.5 إلى 2 | مضاعف النغمة. القيم التي تقل عن 1.0 تخفض الصوت والقيم الأعلى ترفعه. النغمة أيضا تغير وتيرة الصوت المعروض، لذا قم بإقناعه بالسرعة عندما تريد الحفاظ على المدة الأصلية. |
| volume | integer | 50 | 0 إلى 100 | شدة الإخراج، حيث 50 هو المستوى المرجعي. |
| instruction | string | - | الحد الأقصى 128 | توجيه باللغة الطبيعية للإلقاء حتى 128 حرفا. يتحكم في المشاعر، النبرة، الشخصية، الإيقاع، وأسلوب الكلام، مثل 'تحدث بسرعة بنبرة حماسية ومبهجة' أو 'اقرأ ببطء مثل مقدم... |
| language_hints | array | - | zh, en | رموز لغوية تميل إلى نطق النصوص المختلطة، مثل ["zh"، "en"]. اترك غير مضبوط ليتمكن النموذج من اكتشاف اللغة. |
| seed | integer | 0 | 0 إلى 65535 | أخذ عينات بذرة. أعد استخدام بذرة بنفس الإدخال والإعدادات لعرض قابل للتكرار. |
| bit_rate | integer | 32000 | 16000 إلى 64000 | معدل بت المشفر بوحدة bps. ينطبق فقط على تنسيق أوبوس، ويتجاهل في mp3 وwav وpcm. |
| pronunciation | object | - | - | النطق يتجاوز الشكل المكتوب على المفتاح المحدد، مثل {"重要": "zhong4 yao4"}. استخدمه لتثبيت الأسماء والاختصارات والأشكال المتجانسة. |
| replace | object | - | - | تطبق البدائل الحرفية للنصوص قبل التركيب، مثل {"EmpirioLabs": "Empirio Labs"}. مفيد لأسماء العلامات التجارية والاختصارات. |
المستويات - بالإضافة إلى ذلك: أعلى جودة صوتية وتعبير، لإنشاء المحتوى، الكتب الصوتية، الدبلجة، والعمل الصوتي على العلامة التجارية - الفلاش: مضبوط للتفاعل في الوقت الحقيقي مع تأخير أقل في الحزمة الأولى، للمساعدين الصوتيين والوكلاء المباشرين - التبديل باستخدام معامل model_tier، أو إرسال qwen-audio-3.0-tts-plus أو qwen-audio-3.0-tts-flash كمعرف نموذج الأصوات - أكثر من 1000 صوت أساسي، جميعها متاحة في كلا المستويين، لذا تغيير المستوى يحافظ على صوتك المختار - ستة أصوات رئيسية للنظام مخصصة لكل مستوى: longanlingxin وlonganlufeng على Plus، وlonganhuan_v3.6، longjielidou_v3.6، loongeva_v3.6، loongjohn على Flash - تصفح الكتالوج الكامل مع GET /v1/voices، ومرر أي صوت عبر qwen-audio-3.0-tts-plus 0__ حدود الإدخال - حتى 20,000 حرف لكل طلب qwen-audio-3.0-tts-plus 1__ يقبل حتى 128 حرفا - إدخال SSML غير مدعوم. استخدم qwen-audio-3.0-tts-plus 2__ لتوجيه التسليم، والوسوم المضمنة مثل qwen-audio-3.0-tts-plus 3__ أو qwen-audio-3.0-tts-plus 4__ داخل النص الفوترة - يتم احتساب المبلغ لكل حرف من نص الإدخال بمعدل الطبقة المختارة
على EmpirioLabs، تتم فوترة Qwen Audio 3.0 TTS حسب الاستخدام: بالإضافة إلى التوليف $0.20 لكل 10,000 حرف; توليف الفلاش $0.15 لكل 10,000 حرف. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.
يُقدَّم Qwen Audio 3.0 TTS عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.
نعم. يشغّل ملعب EmpirioLabs نموذج Qwen Audio 3.0 TTS في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.
أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.
تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.