StepAudio 3 TTS API

Synthèse vocale au niveau humain à travers six langues, avec 12 voix systèmes, une direction de diffusion en langage naturel et une lecture en streaming.

StepFunProduction audioPublié 9 sept. 2026InternationalEndpoint propriétaireNouveau

À propos de StepAudio 3 TTS

Synthèse vocale au niveau humain à travers six langues, avec 12 voix systèmes, une direction de diffusion en langage naturel et une lecture en streaming.

Le comptage des caractères suit la tarification StepFun: un caractère chinois compte pour un caractère, deux lettres anglaises pour un caractère, et deux signes de ponctuation pour un seul caractère.

Aussi connu sous le nom StepFun StepAudio 3 TTS

text to speechcontextual ttsvoice controlmultilingual

Caractéristiques de StepAudio 3 TTS

ID du modèle
stepaudio-3-tts
Auteur
StepFun
Catégorie
Production audio
Publié
9 sept. 2026
Entrée
Texte
Sortie
Audio
Région
International
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:stream
Identifiants de modèle alternatifs
stepfun/stepaudio-3-tts

Tarifs de l'API StepAudio 3 TTS

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Synthèse
par 10 000 caractères
$0.36
Comparer sur la page complète des tarifs

Comment appeler l'API StepAudio 3 TTS

StepAudio 3 TTS génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle stepaudio-3-tts. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Référence complète de l'API StepAudio 3 TTS

Paramètres de l'API StepAudio 3 TTS

Paramètres de requête pris en charge par l'API StepAudio 3 TTS sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
inputstring-max 1000Texte à synthétiser. Maximum 1 000 caractères. Le contenu entre parenthèses est traité comme une direction de livraison et n’est pas prononcé.
voiceenumlively-girllively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v...Voix officielle de StepFun. Des identifiants vocaux clonés personnalisés sont également acceptés via l’API.
instructionstring-max 500Émotion globale ou guide de style pour tout le passage, en langage naturel. Maximum 500 caractères.
speednumber10.5 à 2Vitesse de parole.
volumenumber10.1 à 2Volume de sortie.
languageenumenen, zh, ja, ko, fr, esLangue cible. Le japonais, le coréen, le français et l’espagnol sont en aperçu.
response_formatenummp3mp3, wav, flac, opus, pcmFormat audio de sortie.
sample_rateenum240008000, 16000, 22050, 24000Taux d’échantillonnage de sortie en Hz.
markdown_filterbooleanfalse-Retirez la syntaxe Markdown de l’entrée avant qu’elle ne soit prononcée.
pronunciation_mapstring--La prononciation optionnelle prend le dessus, en tant qu’objet avec un ensemble de tons de règles « written/spoken ».

Bon à savoir

L’entrée maximale est de 1 000 caractères. Le contenu entre parenthèses est traité comme une direction de diffusion et n’est pas prononcé. Utilisez l’instruction pour l’émotion globale ou le style de guidage, jusqu’à 500 caractères. Douze voix système sont disponibles, et un identifiant vocal cloné personnalisé est également accepté. Les langues reconnues sont le chinois, l’anglais, le japonais, le coréen, le français et l’espagnol, avec d’autres langues que le chinois et l’anglais en aperçu. Les formats de sortie sont mp3, wav, flac, opus et pcm à 8000, 16000, 22050 ou 24000 Hz. Wav est retourné comme un fichier complet plutôt que diffusé en streaming. Ce modèle ne prend pas en charge voice_label.

API StepAudio 3 TTS : questions fréquentes

Combien coûte l'API StepAudio 3 TTS ?

Sur EmpirioLabs, StepAudio 3 TTS est facturé à l'usage : Synthèse $0.36 par 10 000 caractères. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quel endpoint StepAudio 3 TTS utilise-t-il ?

StepAudio 3 TTS est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer StepAudio 3 TTS dans le navigateur avant d'intégrer ?

Oui. Le playground EmpirioLabs exécute StepAudio 3 TTS dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.

Comment obtenir une clé API StepAudio 3 TTS ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.