
Modèle text-to-speech Contextual StepFun avec une direction vocale en langage naturel et une interprétation expressive.
Modèle text-to-speech Contextual StepFun avec une direction vocale en langage naturel et une interprétation expressive.
Le comptage des caractères suit la tarification StepFun: un caractère chinois compte pour un caractère, deux lettres anglaises pour un caractère, et deux signes de ponctuation pour un seul caractère.
Aussi connu sous le nom StepAudio TTS, StepFun StepAudio 2.5 TTS, StepAudio-2.5-TTS, stepaudio-2-5-tts
stepaudio-2-5-tts/v1/audio/speechstepaudio-2.5-ttsstepfun/stepaudio-2-5-ttsstepfun/stepaudio-2.5-ttsTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
StepAudio 2.5 TTS génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle stepaudio-2-5-tts. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-2-5-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Paramètres de requête pris en charge par l'API StepAudio 2.5 TTS sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| input | string | - | max 1000 | Texte à synthèse. Maximum 1 000 caractères. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Official StepFun voice. Custom cloned voice IDs are also accepted via the API. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | Format audio de sortie. |
| speed | number | 1 | 0.5 à 2 | Vitesse de parole. |
| volume | number | 1 | 0.1 à 2 | Volume de sortie. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | Taux d’échantillonnage de sortie en Hz. |
| instruction | string | - | max 200 | Émotion ou guide de style global. Pris en charge uniquement par StepAudio 2.5 TTS. |
| pronunciation_map | object | - | - | Cartographie optionnelle de la prononciation. |
| markdown_filter | boolean | false | - | Filtrez la syntaxe du markdown avant la synthèse. |
L’entrée maximale est de 1 000 caractères. Le contenu entre parenthèses est traité comme une direction et n’est pas exprimé. Utilisez l’instruction pour des conseils d’émotion globale ou de style. StepAudio 2.5 TTS ne prend pas en charge voice_label.
Sur EmpirioLabs, StepAudio 2.5 TTS est facturé à l'usage : Synthèse $0.85 par 10 000 caractères. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
StepAudio 2.5 TTS est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Oui. Le playground EmpirioLabs exécute StepAudio 2.5 TTS dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.