Accueil Blog

Comment utiliser l’API Flash de TTS 2

Comment utiliser l’API Flash de TTS 2

Sep 4, 2026

EmpirioLabs AI

TTS 2 Flash est disponible sur EmpirioLabs. Inworld a livré la famille Realtime TTS-2 en disponibilité générale, et Flash en est le membre axé sur la latence. Il détient une identité vocale unique à travers 200+ langues et lieux, diffuse l’audio en continu de sa synthèse, et peut renvoyer des horodatages par mot ou par caractère. Realtime TTS-2, le modèle de la même famille qui priorise la qualité, est disponible sur la plateforme à côté.

Ce que prend en chargement TTS 2 Flash

Flash reçoit du texte et renvoie l’audio. Il couvre 200+ langues et lieux avec une seule identité vocale, donc le même identifiant vocal conserve son caractère lorsque vous changez de langue, y compris en le changeant en cours de génération. La sortie revient en MP3, WAV, OGG, FLAC, PCM, A-LAW ou mu-law à des fréquences d’échantillonnage allant de 8 kHz à 48 kHz.

Le menu déroulant des voix révèle 20 préréglages soigneusement sélectionnés. C’est une liste de commodité, pas le catalogue: passez toute autre identification vocale, y compris régionale ou clonée, via voice_id, et appeler le point de point de terminaison des voix pour énumérer ce qui est disponible.

Comment appeler TTS 2 Flash

Utilisez le point de terminaison vocal compatible OpenAI et définissez modèle à tts-2-flash:

curl https://api.empiriolabs.ai/v1/audio/speech \ -H 'Autorisation: Porteur $EMPIRIOLABS_API_KEY' \ -H 'Type-Contenu: application/json' \ -d '{ « modèle »: « tts-2-flash », « entrée »: « Bonjour, et merci d’avoir appelé. Comment puis-je vous aider aujourd’hui ? », « voix »: « Ashley », « langue »: « en-US », « output_format »: « MP3 » }'

La réponse porte une URL signée pour l’audio généré ainsi qu’un bloc d’utilisation avec le nombre de caractères facturés. La facturation est faite par caractère d’entrée, donc le coût suit le texte que vous envoyez plutôt que la longueur de l’audio qui revient.

Streaming

Pour les agents vocaux et tout ce qui lit de l’audio pendant qu’il est encore en cours de production, postez sur la variante streaming du même point de terminaison. Il renvoie les événements envoyés par le serveur: audio.chunk Événements diffusant l’audio Base64 tel qu’il est synthétisé, optionnel audio.timestamps Des événements où vous demandiez un mot ou un moment de caractère, et une finale audio.done événement avec une URL de relecture et le bloc d’utilisation. Définir timestamp_type à WORD ou CARACTÈRE quand vous conduisez des sous-titres ou une interface de surlignement.

Choisir entre TTS 2 et TTS 2 Flash

Les deux modèles partagent la même forme de requête, les mêmes voix et la même couverture linguistique, donc le changement est un changement d’un mot vers modèle. La différence qui compte lors de la cueillette, c’est le contrôle de livraison.

Le TTS-2 en temps réel accepte une direction vocale en anglais simple: ouvrez le texte avec une instruction entre crochets et le modèle exécute la ligne ainsi au lieu de lire l’instruction à voix haute. Il comprend à la fois les directives courtes et les briefs libres.

{ « mannequin »: « tts-2 », « entrée »: « [Parle chaleureusement, comme si tu saluais un vieil ami] Bonjour, ça fait plaisir de te revoir. », « voix »: « Ashley » }

TTS 2 Flash ne s’applique pas dans cette direction. Envoyez le même texte crocheté à Flash et il est ignoré, donc il faut privilégier TTS 2 quand la performance compte et Flash quand la latence et le volume comptent. Sur Flash, la livraison de formes avec le Vitesse et température des contrôles à la place.

Des notes à connaître avant votre premier appel

  • La direction vocale est uniquement TTS 2. Flash ignore silencieusement une directive entre crochets au lieu de la rejeter, donc une invite écrite pour TTS 2 s’exécute sur Flash et revient simplement sans direction.
  • Le texte de direction est facturé. L’instruction entre crochets compte pour le total de caractères de la demande même si elle n’est jamais prononcée, donc gardez les briefs courts.
  • La limite par requête est de 2 000 caractères. Faites des copies plus longues aux limites des phrases sur le client et concaténez l’audio, plutôt que d’envoyer un seul bloc long.
  • La normalisation du texte est activée par défaut. Les chiffres, dates et abréviations sont étendus en forme orale, ce qui signifie aussi que le nombre de caractères facturés peut dépasser la longueur de la chaîne que vous avez envoyée. Désactivez-le si vous avez déjà normalisé le texte vous-même.

Commencez

Essayez TTS 2 Flash dans le Terrain de jeu, lire Référence API, ou voir les taux actuels sur le page modèle.

Prêt à utiliser de meilleurs points de terminaison ?

Explorez nos modèles, ou contactez-nous pour toute demande d’entreprise, des déploiements personnalisés ou pour tout autre sujet.