TTS 2 Flash API

Une synthèse vocale en temps réel avec latence first, détenant une identité vocale unique sur 200+ langues, réglée pour des charges de travail de streaming à haut volume.

InworldProduction audioPublié 2 sept. 2026Endpoint propriétaireNouveau

À propos de TTS 2 Flash

Une synthèse vocale en temps réel avec latence first, détenant une identité vocale unique sur 200+ langues, réglée pour des charges de travail de streaming à haut volume.

Aussi connu sous le nom Inworld TTS 2 Flash

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingual

Caractéristiques de TTS 2 Flash

ID du modèle
tts-2-flash
Fournisseur
Inworld
Catégorie
Production audio
Publié
2 sept. 2026
Entrée
Texte
Sortie
Audio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
Identifiants de modèle alternatifs
inworld-tts-2-flash

Tarifs de l'API TTS 2 FlashÉconomisez jusqu'à 30%

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Synthèse
par 1M de caractères
$15.00$10.50
Comparer sur la page complète des tarifs

Comment appeler l'API TTS 2 Flash

TTS 2 Flash génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle tts-2-flash. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2-flash",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2-flash", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Référence complète de l'API TTS 2 Flash

Paramètres de l'API TTS 2 Flash

Paramètres de requête pris en charge par l'API TTS 2 Flash sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
inputstring-max 2000Texte à synthétiser. Maximum 2 000 caractères par requête; copie plus longue aux limites de phrase sur le client. Ce modèle n’applique pas la direction de livraison...
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Préréglage de voix. 20 voix soigneusement sélectionnées couvrant l’anglais, l’espagnol, le portugais, l’hindi et divers accents. Pour le catalogue complet des voix...
voice_idstring--ID vocal libre. Prend le dessus sur la voix une fois réglé. Utilisez ceci pour traiter toute voix au-delà de la liste prédéfinie sélectionnée de 20 prédéfinis, y...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...Code de langue BCP-47. Ce modèle possède une identité vocale à travers 200+ langues et localités, donc vous pouvez passer n’importe quel code supporté ici même s’il...
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWAudio container/codec. WAV = LINEAR16 à l’intérieur du RIFF (omniprésent). MP3 / OGG = compressé. PCM = raw sans en-tête, utile pour la lecture en temps réel en...
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000La fréquence d’échantillonnage de sortie en Hz. 24000 est la valeur par défaut d’Inworld et celle à laquelle leurs modèles vocaux s’entraînent; Augmentez à 48000...
speednumber10.5 à 1.5Multiplicateur de débit de parole. 0,5 = demi-vitesse, 1,5 = 50 % plus rapide.
temperaturenumber10.1 à 2L’expressivité / la variabilité de la voix. Plus bas = plus cohérent / « plat »; plus élevé = plus expressif mais plus varié entre les rendus.
bit_ratenumber12800032000 à 320000Débit binaire en bps pour MP3 / OGG_OPUS. Ignoré pour d’autres encodages.
apply_text_normalizationenumONON, OFFLors de ON, Inworld élargit les chiffres / abréviations / dates en forme orale (« 5 USD » → « cinq dollars US »).
timestamp_typeenumNONENONE, WORD, CHARACTERSi non AUCUNE FOIS, la réponse inclut des horodatages par mot ou par caractère dans timestamp_info. Utile pour les interfaces de légendes / surlignes.

Bon à savoir

Limites - Entrée maximale: 2 000 caractères par requête (texte plus long aux limites de phrase) - WebSocket: 20 connexions concurrentes, 5 contexts/connection - Message par WS: 1 000 caractères Direction vocale - Ce modèle n’applique pas la direction de livraison en anglais clair entre crochets. Utilisez TTS 2 quand vous en avez besoin, ou la livraison de formes ici avec les contrôles speed et temperature. Latence - p90 TTFB: moins de 25 ms (benchmark Inworld) Voix - Une identité vocale conservée dans 200+ langues et lieux, y compris le changement de langue en milieu de génération - Presets sélectionnés dans le menu déroulant; passez toute autre identification vocale via voice_id

API TTS 2 Flash : questions fréquentes

Combien coûte l'API TTS 2 Flash ?

Sur EmpirioLabs, TTS 2 Flash est facturé à l'usage. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quel endpoint TTS 2 Flash utilise-t-il ?

TTS 2 Flash est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer TTS 2 Flash dans le navigateur avant d'intégrer ?

Oui. Le playground EmpirioLabs exécute TTS 2 Flash dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.

Comment obtenir une clé API TTS 2 Flash ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.