المنزل المدونة

كيفية استخدام واجهة برمجة تطبيقات Qwen Audio 3.0 TTS

Qwen Audio 3.0 TTS عبر واجهة برمجة التطبيقات على EmpirioLabs

Jul 23, 2026

EmpirioLabs AI

يتوفر Qwen Audio 3.0 TTS على EmpirioLabs. إنه نموذج توليف الكلام من علي بابا، ونعرضه كنموذج واحد مع مفتاح مستوى: Plus لأعلى جودة صوت وتعبير، وFlash للتفاعل في الوقت الحقيقي مع تأخير أقل في الحزمة الأولى. كلا المستويين يشتركان في نفس المعايير ونفس مكتبة الصوت، لذا تختار صوتا مرة واحدة وتغير المستويات مع حقل واحد.

ما الذي يجيده Qwen Audio 3.0 TTS

تغطي 16 لغة، منها العربية، الصينية، الإنجليزية، الفرنسية، الألمانية، الإندونيسية، الإيطالية، اليابانية، الكورية، الماليزية، البرتغالية، الروسية، الإسبانية، التاغالوغية، التايلاندية، والفيتنامية، بالإضافة إلى 20 منطقة باللهجة الصينية. يتم تقديم اللعبة بطريقتين: الإنجليزية البسيطة التعليم هذا يحدد المشاعر، والنغمة، والشخصية، والإيقاع، والأسلوب للعرض بالكامل، والوسوم المضمنة مثل [متحمس], [همس], [ضحك]، أو [تنهد] وضعت مباشرة في النص لتغيير التعبير في منتصف الجملة.

مكتبة الأصوات هي السبب في أن تبديل المستويات سهل للغاية. هناك أكثر من 1000 صوت أساسي، وكل واحد منها موجود في كلا المستويين تحت نفس المعرف، لذا التنقل بين Plus وفلاش لا يغير من يتحدث. فوق ذلك، لكل مستوى مجموعة صغيرة من أصوات النظام الرئيسي الخاصة به.

تقديم طلب

هي نقطة نهاية الكلام القياسية على شكل OpenAI، لذا يحتاج معظم العملاء إلى تغيير رابط أساسي واحد:

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -H "CONTENT-TYPE: application/json" \ -d '{ "model": "qwen-audio-3-0-tts", "model_tier": "وميض"، "إدخال": "[متحمس] النتائج وصلت، وقد تجاوزت توقعاتنا! [ يضحك]", "صوت": "loongjameszhao", "تعليمات": "تحدث بسرعة بنبرة حماسية ومتفائلة", "response_format": "mp3", "sample_rate": 24000 }'

تحصل على رابط صوتي موقع. يدعم الإخراج MP3، WAV، PCM بدون رؤوس، وOpus، بمعدلات عينة من 8 كيلوهرتز حتى 48 كيلوهرتز. السرعة، النغمة، الصوت، والبذور كلها مكشوفة، إلى جانب تجاوزات النطق للأسماء والاختصارات، واستبدال النصوص الحرفية لأسماء العلامات التجارية، ومرشح Markdown حتى لا تقرأ أحرف التنسيق بصوت عال.

لتصفح الكتالوج الصوتي الكامل، اتصل اذهب /v1/voices. يدعم التصفية حسب اللغة، والجنس، والدرجة، والبحث النصي الحر عبر أسماء الأصوات، السمات، وحالات الاستخدام.

ثلاثة أشياء تستحق المعرفة قبل البناء

الأصوات الأساسية قابلة للنقل عبر المستويات، أما أصوات النظام فلا. أي معرف صوتي أساسي يعمل على كل من Plus وFlash، لذا يمكنك A/B المستويات مع تثبيت الصوت ثابتا. الأصوات الستة الرئيسية في النظام مقفلة بمستوى واحد لكل منها، وإذا أرسلت صوتا إلى المستوى الخطأ تخبرك واجهة برمجة التطبيقات أي مستوى يخدمها بدلا من أن تفشل بشكل غامض.

SSML غير مدعوم من قبل هذا النموذج. الاستخدام التعليم لتوجيه التسليم العالمي والعلامات الداخلية لتغييرات التعبير المحلي. هذا المزيج يغطي معظم ما يسعى إليه الناس من SSML، وهو أسهل في التأليف.

الرمية أيضا تغير الوتيرة. خفض النغمة يمدد المشبك ورفعه يضغط على المشبك، فإذا أردت نغمة مختلفة في المدة الأصلية، عدل السرعة للتعويض.

التسعير والبدء

الفوترة تكون حسب حرف من نص الإدخال، في أي مستوى اخترته، وهي pay-as-you-go. الفلاش هو الأرخص من الاثنين. الأسعار الحالية لكلا المستويين موجودة على صفحة نموذج Qwen Audio 3.0 TTS وهكذا صفحة التسعير.

يمكنك تجربته دون كتابة أي كود في الملعب، حيث مفتاح المستوى، ومختارة الصوت، وكل معلمة هي عناصر تحكم حية. المرجع الكامل للمعلمات موجود في توثيق واجهة برمجة التطبيقات.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

استكشف نماذجنا، أو تواصل معنا بشأن استفسارات الأعمال، أو النشر المخصص، أو أي شيء آخر.