المنزل المدونة

كيفية استخدام واجهة برمجة تطبيقات StepAudio 3 TTS

StepAudio 3 TTS عبر غطاء API

Sep 15, 2026

EmpirioLabs AI

الإجابة المختصرة: ستيب أوديو 3 TTS هو نموذج text-to-speech الرئيسي من StepFun، متوفر على EmpirioLabs عبر نقطة النهاية القياسية لأسلوب OpenAI. إرسال ما يصل إلى 1000 حرف إلى ما بعد /v1/audio/speech مع العارض: "stepaudio-3-tts"، اختر واحدا من اثني عشر صوتا نظاميا، ووصف طريقة التوصيل التي تريد بها بالإنجليزية العادية التعليم.

طلبك الأول

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "التفويض: حامل $EMPIRIOLABS_API_KEY" \ -H "CONTENT-TYPE: application/json" \ -D '{ "MODEL": "stepaudio-3-tts", "INPUT": "مكالمتك تتواصل. شكرا على الانتظار.", "voice": "الفتاة الحيوية" }'

تحمل الاستجابة عنوان URL موقع للصوت المولد. الصيغة الافتراضية هي mp3 عند 24,000 هرتز.

اختيار الصوت

تم إرسال اثنا عشر صوتا نظاميا مع النموذج. سبعة منها تم نقلها من StepAudio 2.5، وخمسة منها جديدة: ألفي, إيثان, ماثيو, تشينغشونفشنغ، و تيان روننوشنغ.

الصوتالشخصيةجيد ل
الفتاة الحيويةأنثى ذكية ونشيطةالمساعدون، جولات المنتجات
شباب نابض بالحياةذكر شاب دافئكتب صوتية، دبلجة فيديو
soft-spoken-gentlemanرجل هادئ ولطيفالسرد الطويل
magnetic-voiced-maleرجل عميق وثقيلالإعلانات الدعائية، القراءات الدرامية
أنثى أنيقة ولطيفةامرأة صادقة ومطمئنةخطوط الدعم، التعليم
أنثى حيويةخفيف ومقنعتسويق، فيديو قصير
زيشينانشنغرجل واثقكتب صوتية، تدريب

القائمة الكاملة موجودة في مرجع النموذج. يتم قبول معرف صوتي مستنسخ مخصص في نفس الحقل.

توجيه التسليم

بدلا من وضع علامات عاطفية محددة مسبقا، تكتب ما تريد والنموذج ينفذه. التعليم يحدد نغمة المقطع بأكمله ويقبل حتى 500 حرف.

{ "model": "stepaudio-3-tts", "input": "وجدنا شيئا في السجلات.", "صوت": "magnetic-voiced-male", "تعليمات": "بطيء ومتعمد، مثل صوت مقطورة. دع التوقف يهبط." }

لكلمة أو عبارة واحدة، ضع الاتجاه بين قوسين داخل الداخل المدخلات بدلا من ذلك.

اللغات

المجموعة اللغة إلى en, zh, نعم, كو, fr، أو es. اليابانية، الكورية، الفرنسية، والإسبانية في مرحلة المعاينة. اتركها خارج اللعبة ويظهر النموذج الإنجليزية.

صيغ الإخراج

اختر mp3, wav, FLAC, العمل الكبير، أو PCM مع response_format، و set sample_rate إلى 8000، 16000، 22050، أو 24000.

ثلاثة أشياء تثير مشاكل الناس

  1. الأقواسي هي توجيه، وليست كلمات. أي شيء بداخله () في المدخلات تقرأ كإشارة للتسليم ولا تنطق أبدا. إذا كنت بحاجة إلى قراءة جانبية بصوت عال، أعد كتابتها بدون أقواس.
  2. تردد 48,000 هرتز غير متوفر في هذا الطراز. يظهر في بعض الوثائق العامة text-to-speech، لكن StepAudio 3 TTS يرفضه. ابق على 24,000 هرتز للحصول على أعلى جودة.
  3. التعليم و voice_label ليست قابلة للاستبدال. تجارب StepAudio 3 TTS التعليم والرفض voice_label. خطوة TTS 2 هي العكس. نقل طلب بينهما يعني تبديل ذلك الحقل.

التسعير والحدود

الفوترة تعتمد على كل حرف من الإدخال، ادفع حسب الاستخدام، بدون اشتراك ولا حد أدنى. حرف صيني واحد يحتسب كحرف واحد، وحرفين إنجليزيين كحرف واحد. السعر المباشر على صفحة النماذج و صفحة الأسعار. الطلبات تصل إلى 1000 حرف، لذا قسم السكريبتات الأطول إلى نداءات بحجم جملة وانضم إلى الصوت بنفسك.

جربها بدون كتابة كود

مفتوح StepAudio 3 TTS في playground لاختبار الأصوات والتعليمات، ثم نسخ الإعدادات إلى طلبك. المرجع الكامل للمعلمات: docs.empiriolabs.ai/models/stepaudio-3-tts.

هل أنت مستعد لاستخدام نقاط نهاية أفضل؟

استكشف نماذجنا، أو تواصل معنا بشأن استفسارات الأعمال، أو النشر المخصص، أو أي شيء آخر.