Qwen Audio 3.0 TTS واجهة برمجة التطبيقات

تركيب الكلام الطبقي مع أكثر من 1000 صوت، 16 لغة، 20 لهجة صينية، توجيه للتعبير باللغة الطبيعية، وعلامات المشاعر الداخلية.

Alibaba Cloudتوليد الصوتتاريخ الإصدار 20 يوليو 2026Singaporeنقطة نهاية مملوكةجديد

حول Qwen Audio 3.0 TTS

تركيب الكلام الطبقي مع أكثر من 1000 صوت، 16 لغة، 20 لهجة صينية، توجيه للتعبير باللغة الطبيعية، وعلامات المشاعر الداخلية.

اختيار الصوت مطابق للمستوى: معرفات الصوت الأساسية تعمل على كلا المستويين ويتم مطابقتها تلقائيا مع model_tier المختار، بينما الأصوات الستة في النظام مقفلة بمستوى واحد. النغمة أيضا تغير وتيرة الصوت المعروض، لذا قم بإقناعه بالسرعة عندما تريد الحفاظ على المدة الأصلية.

يعرف أيضا باسم Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS

text to speechmultilingualexpressive prosodyemotion controlvoice tagsdialectlow latency

مواصفات Qwen Audio 3.0 TTS

معرّف النموذج
qwen-audio-3-0-tts
المطور
Alibaba Cloud
الفئة
توليد الصوت
تاريخ الإصدار
20 يوليو 2026
الإدخال
نص
الإخراج
صوت
المنطقة
Singapore
نقاط النهاية
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
معرّفات نموذج بديلة
qwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash

أسعار واجهة Qwen Audio 3.0 TTS API

أسعار الدفع حسب الاستخدام مباشرة من كتالوج EmpirioLabs. تدفع فقط مقابل ما تستخدمه، بدون حد أدنى شهري.

النوع
المواصفة
السعر
بالإضافة إلى التوليف
لكل 10,000 حرف
$0.20
توليف الفلاش
لكل 10,000 حرف
$0.15
قارن في صفحة الأسعار الكاملة

كيفية استدعاء واجهة Qwen Audio 3.0 TTS API

يولّد Qwen Audio 3.0 TTS الكلام عبر POST /v1/audio/speech ويعيد صوتًا قابلًا للتشغيل. أرسل النص المطلوب نطقه في input مع معرّف النموذج qwen-audio-3-0-tts. احصل على مفتاح API من لوحة تحكم EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3-0-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
المرجع الكامل لواجهة Qwen Audio 3.0 TTS API

معلمات واجهة Qwen Audio 3.0 TTS API

معلمات الطلب التي تدعمها واجهة Qwen Audio 3.0 TTS API على EmpirioLabs. تُطبق القيم الافتراضية عند حذف أي حقل.

المعاملالنوعالافتراضيالنطاق / القيمالوصف
inputstring-الحد الأقصى 20000نص لتركيبه. يصل إلى 20,000 حرف لكل طلب. يدعم علامات التعبير الداخلي الموضوعة مباشرة في النص، مثل [متحمس]، [ضحك]، [همس]، [تنهد]، [شهقة]، و[ساخر].
model_tierenumplusplus, flashبالإضافة إلى ذلك: أعلى جودة صوتية وتعبير، الأفضل لإنشاء المحتوى، الكتب الصوتية، الدبلجة، والعمل الصوتي للعلامة التجارية. فلاش: مضبوط للتفاعل في الوقت الحقيقي مع...
voiceenumloongjameszhaoloongjameszhao, loongolivialin, loonglunawang, loongnorahu, l...إعداد الصوت مسبقا. الأصوات الأساسية تعمل في كلا المستويين، لذا تغيير model_tier يحافظ على اختيارك. ستة أصوات رئيسية تم تثبيت المستوى: longanlingxin و longanlufeng...
voice_idstring--معرف الصوت الحر، الذي يتجاوز الصوت عند تعيينه. يقبل أي صوت أساسي من GET /v1/voices، إما كمعرف فارغ (موصى به، يعمل على كلا المستويين) أو كمعرف مؤهل بالكامل. يتم...
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000معدل عينة الإخراج بالهرتز. 24000 يناسب تشغيل الكلام، و48000 يعطي إخراج بجودة بث عند حجم ملف أكبر.
speednumber10.5 إلى 2مضاعف معدل التحدث. 0.5 هو نصف السرعة و2.0 هو ضعف السرعة.
pitchnumber10.5 إلى 2مضاعف النغمة. القيم التي تقل عن 1.0 تخفض الصوت والقيم الأعلى ترفعه. النغمة أيضا تغير وتيرة الصوت المعروض، لذا قم بإقناعه بالسرعة عندما تريد الحفاظ على المدة الأصلية.
volumeinteger500 إلى 100شدة الإخراج، حيث 50 هو المستوى المرجعي.
instructionstring-الحد الأقصى 128توجيه باللغة الطبيعية للإلقاء حتى 128 حرفا. يتحكم في المشاعر، النبرة، الشخصية، الإيقاع، وأسلوب الكلام، مثل 'تحدث بسرعة بنبرة حماسية ومبهجة' أو 'اقرأ ببطء مثل مقدم...
language_hintsarray-zh, enرموز لغوية تميل إلى نطق النصوص المختلطة، مثل ["zh"، "en"]. اترك غير مضبوط ليتمكن النموذج من اكتشاف اللغة.
seedinteger00 إلى 65535أخذ عينات بذرة. أعد استخدام بذرة بنفس الإدخال والإعدادات لعرض قابل للتكرار.
bit_rateinteger3200016000 إلى 64000معدل بت المشفر بوحدة bps. ينطبق فقط على تنسيق أوبوس، ويتجاهل في mp3 وwav وpcm.
pronunciationobject--النطق يتجاوز الشكل المكتوب على المفتاح المحدد، مثل {"重要": "zhong4 yao4"}. استخدمه لتثبيت الأسماء والاختصارات والأشكال المتجانسة.
replaceobject--تطبق البدائل الحرفية للنصوص قبل التركيب، مثل {"EmpirioLabs": "Empirio Labs"}. مفيد لأسماء العلامات التجارية والاختصارات.
2 معلمات إضافية في الوثائق

معلومات مفيدة

المستويات - بالإضافة إلى ذلك: أعلى جودة صوتية وتعبير، لإنشاء المحتوى، الكتب الصوتية، الدبلجة، والعمل الصوتي على العلامة التجارية - الفلاش: مضبوط للتفاعل في الوقت الحقيقي مع تأخير أقل في الحزمة الأولى، للمساعدين الصوتيين والوكلاء المباشرين - التبديل باستخدام معامل model_tier، أو إرسال qwen-audio-3.0-tts-plus أو qwen-audio-3.0-tts-flash كمعرف نموذج الأصوات - أكثر من 1000 صوت أساسي، جميعها متاحة في كلا المستويين، لذا تغيير المستوى يحافظ على صوتك المختار - ستة أصوات رئيسية للنظام مخصصة لكل مستوى: longanlingxin وlonganlufeng على Plus، وlonganhuan_v3.6، longjielidou_v3.6، loongeva_v3.6، loongjohn على Flash - تصفح الكتالوج الكامل مع GET /v1/voices، ومرر أي صوت عبر qwen-audio-3.0-tts-plus 0__ حدود الإدخال - حتى 20,000 حرف لكل طلب qwen-audio-3.0-tts-plus 1__ يقبل حتى 128 حرفا - إدخال SSML غير مدعوم. استخدم qwen-audio-3.0-tts-plus 2__ لتوجيه التسليم، والوسوم المضمنة مثل qwen-audio-3.0-tts-plus 3__ أو qwen-audio-3.0-tts-plus 4__ داخل النص الفوترة - يتم احتساب المبلغ لكل حرف من نص الإدخال بمعدل الطبقة المختارة

واجهة Qwen Audio 3.0 TTS API: أسئلة شائعة

كم تكلف واجهة Qwen Audio 3.0 TTS API؟

على EmpirioLabs، تتم فوترة Qwen Audio 3.0 TTS حسب الاستخدام: بالإضافة إلى التوليف $0.20 لكل 10,000 حرف; توليف الفلاش $0.15 لكل 10,000 حرف. جدول الأسعار المباشر في هذه الصفحة يطابق دائمًا ما تحتسبه الواجهة.

أي نقطة نهاية يستخدم Qwen Audio 3.0 TTS؟

يُقدَّم Qwen Audio 3.0 TTS عبر POST /v1/audio/speech على api.empiriolabs.ai مع مصادقة Bearer القياسية.

هل يمكنني تجربة Qwen Audio 3.0 TTS في المتصفح قبل الدمج؟

نعم. يشغّل ملعب EmpirioLabs نموذج Qwen Audio 3.0 TTS في المتصفح بنفس المعلمات التي تتيحها الواجهة، لتجربة المطالبات قبل كتابة الكود.

كيف أحصل على مفتاح API لنموذج Qwen Audio 3.0 TTS؟

أنشئ حساب EmpirioLabs ثم أنشئ مفتاحًا من API Keys في لوحة التحكم. الفوترة برصيد الدفع حسب الاستخدام، فلا تدفع إلا مقابل الطلبات التي تنفذها.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

تحقق من تسعيرنا أو تواصل إذا كنت ترغب في نشر نموذجك الخاص على مجموعتنا.