
Modèle de voix en temps réel qui suit la direction de diffusion en anglais simple, détient une identité vocale sur 200+ langues, et diffuse avec des horodatages de mots.
Modèle de voix en temps réel qui suit la direction de diffusion en anglais simple, détient une identité vocale sur 200+ langues, et diffuse avec des horodatages de mots.
Aussi connu sous le nom Inworld TTS 2
tts-2/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
TTS 2 génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle tts-2. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Paramètres de requête pris en charge par l'API TTS 2 sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| input | string | - | max 2000 | Texte à synthétiser. Maximum 2 000 caractères par requête; ajouter une copie plus longue aux limites de phrase sur le client. Éventuellement, ouvrir le texte avec... |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | Préréglage de voix. 20 voix soigneusement sélectionnées couvrant l’anglais, l’espagnol, le portugais, l’hindi et divers accents. Pour le catalogue complet des voix... |
| voice_id | string | - | - | ID vocal libre. Prend le dessus sur la voix une fois réglé. Utilisez ceci pour traiter toute voix au-delà de la liste prédéfinie sélectionnée de 20 prédéfinis, y... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | Code de langue BCP-47. Ce modèle possède une identité vocale à travers 200+ langues et localités, donc vous pouvez passer n’importe quel code supporté ici même s’il... |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | Audio container/codec. WAV = LINEAR16 à l’intérieur du RIFF (omniprésent). MP3 / OGG = compressé. PCM = raw sans en-tête, utile pour la lecture en temps réel en... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | La fréquence d’échantillonnage de sortie en Hz. 24000 est la valeur par défaut d’Inworld et celle à laquelle leurs modèles vocaux s’entraînent; Augmentez à 48000... |
| speed | number | 1 | 0.5 à 1.5 | Multiplicateur de débit de parole. 0,5 = demi-vitesse, 1,5 = 50 % plus rapide. |
| temperature | number | 1 | 0.1 à 2 | L’expressivité / la variabilité de la voix. Plus bas = plus cohérent / « plat »; plus élevé = plus expressif mais plus varié entre les rendus. |
| bit_rate | number | 128000 | 32000 à 320000 | Débit binaire en bps pour MP3 / OGG_OPUS. Ignoré pour d’autres encodages. |
| apply_text_normalization | enum | ON | ON, OFF | Lors de ON, Inworld élargit les chiffres / abréviations / dates en forme orale (« 5 USD » → « cinq dollars US »). |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | Si non AUCUNE FOIS, la réponse inclut des horodatages par mot ou par caractère dans timestamp_info. Utile pour les interfaces de légendes / surlignes. |
Limites - Entrée maximale: 2 000 caractères par requête (texte plus long aux limites de phrase) - WebSocket: 20 connexions simultanées, 5 contexts/connection - Message par WS: 1 000 caractères Direction vocale - Ouvrir le texte avec une instruction crochetée en anglais clair pour orienter la livraison, par exemple [whispering], [excited] ou [Speak warmly, like you are greeting an old friend] - Le texte entre crochets est traité comme une direction et n’est pas lu à voix haute - Le texte de direction compte dans le total des caractères facturés, donc restez court Latence - p90 TTFB: moins de 100 ms (benchmark Inworld) Voix - Une identité vocale détenue dans 200+ langues et lieux, y compris le changement de langue en milieu de génération - Presets sélectionnés dans le menu déroulant; transmet toute autre identification vocale via voice_id
Sur EmpirioLabs, TTS 2 est facturé à l'usage. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
TTS 2 est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Oui. Le playground EmpirioLabs exécute TTS 2 dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.