
Synthèse vocale au niveau humain à travers six langues, avec 12 voix systèmes, une direction de diffusion en langage naturel et une lecture en streaming.
Synthèse vocale au niveau humain à travers six langues, avec 12 voix systèmes, une direction de diffusion en langage naturel et une lecture en streaming.
Le comptage des caractères suit la tarification StepFun: un caractère chinois compte pour un caractère, deux lettres anglaises pour un caractère, et deux signes de ponctuation pour un seul caractère.
Aussi connu sous le nom StepFun StepAudio 3 TTS
stepaudio-3-tts/v1/audio/speechPOST/v1/audio/speech:streamstepfun/stepaudio-3-ttsTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
StepAudio 3 TTS génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle stepaudio-3-tts. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Paramètres de requête pris en charge par l'API StepAudio 3 TTS sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| input | string | - | max 1000 | Texte à synthétiser. Maximum 1 000 caractères. Le contenu entre parenthèses est traité comme une direction de livraison et n’est pas prononcé. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Voix officielle de StepFun. Des identifiants vocaux clonés personnalisés sont également acceptés via l’API. |
| instruction | string | - | max 500 | Émotion globale ou guide de style pour tout le passage, en langage naturel. Maximum 500 caractères. |
| speed | number | 1 | 0.5 à 2 | Vitesse de parole. |
| volume | number | 1 | 0.1 à 2 | Volume de sortie. |
| language | enum | en | en, zh, ja, ko, fr, es | Langue cible. Le japonais, le coréen, le français et l’espagnol sont en aperçu. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | Format audio de sortie. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | Taux d’échantillonnage de sortie en Hz. |
| markdown_filter | boolean | false | - | Retirez la syntaxe Markdown de l’entrée avant qu’elle ne soit prononcée. |
| pronunciation_map | string | - | - | La prononciation optionnelle prend le dessus, en tant qu’objet avec un ensemble de tons de règles « written/spoken ». |
L’entrée maximale est de 1 000 caractères. Le contenu entre parenthèses est traité comme une direction de diffusion et n’est pas prononcé. Utilisez l’instruction pour l’émotion globale ou le style de guidage, jusqu’à 500 caractères. Douze voix système sont disponibles, et un identifiant vocal cloné personnalisé est également accepté. Les langues reconnues sont le chinois, l’anglais, le japonais, le coréen, le français et l’espagnol, avec d’autres langues que le chinois et l’anglais en aperçu. Les formats de sortie sont mp3, wav, flac, opus et pcm à 8000, 16000, 22050 ou 24000 Hz. Wav est retourné comme un fichier complet plutôt que diffusé en streaming. Ce modèle ne prend pas en charge voice_label.
Sur EmpirioLabs, StepAudio 3 TTS est facturé à l'usage : Synthèse $0.36 par 10 000 caractères. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
StepAudio 3 TTS est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Oui. Le playground EmpirioLabs exécute StepAudio 3 TTS dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.