Réponse courte: StepAudio 3 TTS est le modèle phare de text-to-speech de StepFun, disponible sur EmpirioLabs via le point de terminaison vocal standard de type OpenAI. Envoyez jusqu’à 1 000 caractères vers APRÈS /v1/audio/speech avec Modèle: « stepaudio-3-tts », choisissez l’une des douze voix du système, et décrivez la prestation que vous souhaitez en anglais ordinaire avec Enseignement.
Votre première demande
curl https://api.empiriolabs.ai/v1/audio/speech \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « stepaudio-3-tts », « entrée »: « Votre appel est connecté. Merci d’avoir attendu. », « voice »: « fille-vivante » }'
La réponse porte une URL signée vers l’audio généré. Le format par défaut est mp3 à 24 000 Hz.
Choisir une voix
Douze voix système sont fournies avec le modèle. Sept sont retenues de StepAudio 2.5, et cinq sont neuves: Alfie, Ethan, Matthew, Qingshunvsheng, et tianrunnvsheng.
| Voix | Caractère | Bon pour |
|---|---|---|
Fille pleine de vie | Femme brillante et énergique | Assistants, guides de produit |
jeunesse vibrante | Jeune homme chaleureux | Livres audio, doublage vidéo |
soft-spoken-gentleman | Homme calme et doux | Narration longue durée |
magnetic-voiced-male | Mâle profond et lourd | Bandes-annonces, lectures dramatiques |
élégante-douce femme | Femme sincère et rassurante | Lignes de soutien, éducation |
Femelle vivante | Léger et persuasif | Marketing, courte vidéo |
zixinnansheng | Homme confiant | Livres audio, formation |
La liste complète se trouve sur le Référence du modèle. Un identifiant vocal cloné personnalisé est accepté dans le même domaine.
Diriger la prestation
Au lieu de tags émotionnels prédéfinis, vous écrivez ce que vous voulez et le modèle l’exécute. Enseignement donne le ton de tout le passage et accepte jusqu’à 500 caractères.
{ « modèle »: « stepaudio-3-tts », « entrée »: « Nous avons trouvé quelque chose dans les journaux. », « voix »: « magnetic-voiced-male », « instruction »: « Lentement et délibéré, comme une voix de bande-annonce. Laisse tomber la pause. » }
Pour un seul mot ou une expression, mettez la direction entre parenthèses à l’intérieur Entrée à la place.
Langues
Jeu Langue à en, zh, Ja, Ko, fr, ou es. Le japonais, le coréen, le français et l’espagnol sont en aperçu. Laissez de côté et le modèle affiche anglais.
Formats de sortie
Choisir mp3, WAV, FLAC, Œuvre, ou PCM avec response_format, et ensemble sample_rate à 8000, 16000, 22050 ou 24000.
Trois choses qui prennent les gens par surprise
- Les parenthèses sont des directions, pas des mots. Tout ce qu’il y a à l’intérieur
()dansEntréese lit comme un signal de livraison et jamais prononcé. Si vous avez besoin d’une mention entre crochets, réécrivez-la sans parenthèses. - Le 48 000 Hz n’est pas disponible sur ce modèle. Il apparaît dans une documentation générale text-to-speech, mais StepAudio 3 TTS le rejette. Restez à 24 000 Hz pour la meilleure qualité.
Enseignementetvoice_labelne sont pas interchangeables. StepAudio 3 TTS prendEnseignementet rejettevoice_label. Step TTS 2 est l’inverse. Porter une requête entre eux signifie échanger ce champ.
Tarification et limites
La facturation est faite par caractère d’entrée, payez au fur et à mesure, sans abonnement ni minimum. Un caractère chinois compte comme un caractère, et deux lettres anglaises comptent comme un seul. Le tarif en direct est indiqué sur le page modèle et les page de prix. Les requêtes plafonnent à 1 000 caractères, donc divisez les scripts plus longs en appels de la taille d’une phrase et rejoignez l’audio vous-même.
Essayez sans écrire de code
Ouvrir StepAudio 3 TTS dans le playground Pour auditionner les voix et les instructions, puis copier les réglages dans votre demande. Référence complète des paramètres: docs.empiriolabs.ai/models/stepaudio-3-tts.



