Accueil Blog

Comment utiliser l’API TTS StepAudio 3

StepAudio 3 TTS via une couverture API

Sep 15, 2026

EmpirioLabs AI

Réponse courte: StepAudio 3 TTS est le modèle phare de text-to-speech de StepFun, disponible sur EmpirioLabs via le point de terminaison vocal standard de type OpenAI. Envoyez jusqu’à 1 000 caractères vers APRÈS /v1/audio/speech avec Modèle: « stepaudio-3-tts », choisissez l’une des douze voix du système, et décrivez la prestation que vous souhaitez en anglais ordinaire avec Enseignement.

Votre première demande

curl https://api.empiriolabs.ai/v1/audio/speech \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « stepaudio-3-tts », « entrée »: « Votre appel est connecté. Merci d’avoir attendu. », « voice »: « fille-vivante » }'

La réponse porte une URL signée vers l’audio généré. Le format par défaut est mp3 à 24 000 Hz.

Choisir une voix

Douze voix système sont fournies avec le modèle. Sept sont retenues de StepAudio 2.5, et cinq sont neuves: Alfie, Ethan, Matthew, Qingshunvsheng, et tianrunnvsheng.

VoixCaractèreBon pour
Fille pleine de vieFemme brillante et énergiqueAssistants, guides de produit
jeunesse vibranteJeune homme chaleureuxLivres audio, doublage vidéo
soft-spoken-gentlemanHomme calme et douxNarration longue durée
magnetic-voiced-maleMâle profond et lourdBandes-annonces, lectures dramatiques
élégante-douce femmeFemme sincère et rassuranteLignes de soutien, éducation
Femelle vivanteLéger et persuasifMarketing, courte vidéo
zixinnanshengHomme confiantLivres audio, formation

La liste complète se trouve sur le Référence du modèle. Un identifiant vocal cloné personnalisé est accepté dans le même domaine.

Diriger la prestation

Au lieu de tags émotionnels prédéfinis, vous écrivez ce que vous voulez et le modèle l’exécute. Enseignement donne le ton de tout le passage et accepte jusqu’à 500 caractères.

{ « modèle »: « stepaudio-3-tts », « entrée »: « Nous avons trouvé quelque chose dans les journaux. », « voix »: « magnetic-voiced-male », « instruction »: « Lentement et délibéré, comme une voix de bande-annonce. Laisse tomber la pause. » }

Pour un seul mot ou une expression, mettez la direction entre parenthèses à l’intérieur Entrée à la place.

Langues

Jeu Langue à en, zh, Ja, Ko, fr, ou es. Le japonais, le coréen, le français et l’espagnol sont en aperçu. Laissez de côté et le modèle affiche anglais.

Formats de sortie

Choisir mp3, WAV, FLAC, Œuvre, ou PCM avec response_format, et ensemble sample_rate à 8000, 16000, 22050 ou 24000.

Trois choses qui prennent les gens par surprise

  1. Les parenthèses sont des directions, pas des mots. Tout ce qu’il y a à l’intérieur () dans Entrée se lit comme un signal de livraison et jamais prononcé. Si vous avez besoin d’une mention entre crochets, réécrivez-la sans parenthèses.
  2. Le 48 000 Hz n’est pas disponible sur ce modèle. Il apparaît dans une documentation générale text-to-speech, mais StepAudio 3 TTS le rejette. Restez à 24 000 Hz pour la meilleure qualité.
  3. Enseignement et voice_label ne sont pas interchangeables. StepAudio 3 TTS prend Enseignement et rejette voice_label. Step TTS 2 est l’inverse. Porter une requête entre eux signifie échanger ce champ.

Tarification et limites

La facturation est faite par caractère d’entrée, payez au fur et à mesure, sans abonnement ni minimum. Un caractère chinois compte comme un caractère, et deux lettres anglaises comptent comme un seul. Le tarif en direct est indiqué sur le page modèle et les page de prix. Les requêtes plafonnent à 1 000 caractères, donc divisez les scripts plus longs en appels de la taille d’une phrase et rejoignez l’audio vous-même.

Essayez sans écrire de code

Ouvrir StepAudio 3 TTS dans le playground Pour auditionner les voix et les instructions, puis copier les réglages dans votre demande. Référence complète des paramètres: docs.empiriolabs.ai/models/stepaudio-3-tts.

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.