الإجابة المختصرة: ستيب أوديو 3 TTS هو نموذج text-to-speech الرئيسي من StepFun، متوفر على EmpirioLabs عبر نقطة النهاية القياسية لأسلوب OpenAI. إرسال ما يصل إلى 1000 حرف إلى ما بعد /v1/audio/speech مع العارض: "stepaudio-3-tts"، اختر واحدا من اثني عشر صوتا نظاميا، ووصف طريقة التوصيل التي تريد بها بالإنجليزية العادية التعليم.
طلبك الأول
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -H "CONTENT-TYPE: application/json" \ -D '{ "MODEL": "stepaudio-3-tts", "INPUT": "مكالمتك تتواصل. شكرا على الانتظار.", "voice": "الفتاة الحيوية" }'
تحمل الاستجابة عنوان URL موقع للصوت المولد. الصيغة الافتراضية هي mp3 عند 24,000 هرتز.
اختيار الصوت
تم إرسال اثنا عشر صوتا نظاميا مع النموذج. سبعة منها تم نقلها من StepAudio 2.5، وخمسة منها جديدة: ألفي, إيثان, ماثيو, تشينغشونفشنغ، و تيان روننوشنغ.
| الصوت | الشخصية | جيد ل |
|---|---|---|
الفتاة الحيوية | أنثى ذكية ونشيطة | المساعدون، جولات المنتجات |
شباب نابض بالحياة | ذكر شاب دافئ | كتب صوتية، دبلجة فيديو |
soft-spoken-gentleman | رجل هادئ ولطيف | السرد الطويل |
magnetic-voiced-male | رجل عميق وثقيل | الإعلانات الدعائية، القراءات الدرامية |
أنثى أنيقة ولطيفة | امرأة صادقة ومطمئنة | خطوط الدعم، التعليم |
أنثى حيوية | خفيف ومقنع | تسويق، فيديو قصير |
زيشينانشنغ | رجل واثق | كتب صوتية، تدريب |
القائمة الكاملة موجودة في مرجع النموذج. يتم قبول معرف صوتي مستنسخ مخصص في نفس الحقل.
توجيه التسليم
بدلا من وضع علامات عاطفية محددة مسبقا، تكتب ما تريد والنموذج ينفذه. التعليم يحدد نغمة المقطع بأكمله ويقبل حتى 500 حرف.
{ "model": "stepaudio-3-tts", "input": "وجدنا شيئا في السجلات.", "صوت": "magnetic-voiced-male", "تعليمات": "بطيء ومتعمد، مثل صوت مقطورة. دع التوقف يهبط." }
لكلمة أو عبارة واحدة، ضع الاتجاه بين قوسين داخل الداخل المدخلات بدلا من ذلك.
اللغات
المجموعة اللغة إلى en, zh, نعم, كو, fr، أو es. اليابانية، الكورية، الفرنسية، والإسبانية في مرحلة المعاينة. اتركها خارج اللعبة ويظهر النموذج الإنجليزية.
صيغ الإخراج
اختر mp3, wav, FLAC, العمل الكبير، أو PCM مع response_format، و set sample_rate إلى 8000، 16000، 22050، أو 24000.
ثلاثة أشياء تثير مشاكل الناس
- الأقواسي هي توجيه، وليست كلمات. أي شيء بداخله
()فيالمدخلاتتقرأ كإشارة للتسليم ولا تنطق أبدا. إذا كنت بحاجة إلى قراءة جانبية بصوت عال، أعد كتابتها بدون أقواس. - تردد 48,000 هرتز غير متوفر في هذا الطراز. يظهر في بعض الوثائق العامة text-to-speech، لكن StepAudio 3 TTS يرفضه. ابق على 24,000 هرتز للحصول على أعلى جودة.
التعليموvoice_labelليست قابلة للاستبدال. تجارب StepAudio 3 TTSالتعليموالرفضvoice_label. خطوة TTS 2 هي العكس. نقل طلب بينهما يعني تبديل ذلك الحقل.
التسعير والحدود
الفوترة تعتمد على كل حرف من الإدخال، ادفع حسب الاستخدام، بدون اشتراك ولا حد أدنى. حرف صيني واحد يحتسب كحرف واحد، وحرفين إنجليزيين كحرف واحد. السعر المباشر على صفحة النماذج و صفحة الأسعار. الطلبات تصل إلى 1000 حرف، لذا قسم السكريبتات الأطول إلى نداءات بحجم جملة وانضم إلى الصوت بنفسك.
جربها بدون كتابة كود
مفتوح StepAudio 3 TTS في playground لاختبار الأصوات والتعليمات، ثم نسخ الإعدادات إلى طلبك. المرجع الكامل للمعلمات: docs.empiriolabs.ai/models/stepaudio-3-tts.



