TTS 2 Flash está disponible en EmpirioLabs. Inworld lanzó la familia Realtime TTS-2 a disponibilidad general, y Flash es el miembro que prioriza la latencia. Tiene una identidad de voz única en 200+ idiomas y localidades, transmite audio a medida que se sintetiza y puede devolver marcas de tiempo por palabra o por carácter. Realtime TTS-2, el modelo de calidad prioritaria de la misma familia, está disponible en la plataforma junto a él.
Qué soporta TTS 2 Flash
Flash recibe texto y devuelve audio. Cubre 200+ idiomas y localizaciones con una identidad de voz, así que el mismo ID de voz mantiene su carácter cuando cambias de idioma, incluyendo el cambio a mitad de una generación. La salida vuelve como MP3, WAV, OGG, FLAC, PCM, A-LAW o mu-law a frecuencias de muestreo de 8 kHz a 48 kHz.
El desplegable de voz muestra 20 presets seleccionados a mano. Esa es una lista de conveniencia, no el catálogo: pasa cualquier otro ID de voz, incluyendo regionales y clonados, a través de voice_id, y llamar al punto final de voces para enumerar lo que está disponible.
Cómo llamar a TTS 2 Flash
Utiliza el endpoint de voz compatible con OpenAI y establece modelo a tts-2-flash:
curl https://api.empiriolabs.ai/v1/audio/speech \ -H 'Autorización: Portador $EMPIRIOLABS_API_KEY' \ -H 'Tipo-Contenido: application/json' \ -d '{ "modelo": "tts-2-flash", "entrada": "Hola, y gracias por llamar. ¿En qué puedo ayudarle hoy?", "voz": "Ashley", "idioma": "en-US", "output_format": "MP3" }'
La respuesta lleva una URL firmada para el audio generado más un bloque de uso con el recuento de caracteres que se facturó. La facturación es por carácter de entrada, así que el coste rastrea el texto que envías en lugar de la duración del audio que regresa.
Streaming
Para agentes de voz y cualquier cosa que reproduzca audio mientras aún se está produciendo, publica en la variante de streaming del mismo endpoint. Devuelve eventos enviados por el servidor: audio.chunk Eventos que transmiten audio base64 tal como está sintetizado, opcionales audio.timestamps eventos cuando pediste palabra o momento de personaje, y un final audio.done evento con una URL de replay y el bloque de uso. Establecer timestamp_type a PALABRA o PERSONAJE cuando conduces, subtítulos o una interfaz de resaltos.
Elegir entre TTS 2 y TTS 2 Flash
Ambos modelos comparten la misma forma de petición, las mismas voces y la misma cobertura de idioma, por lo que cambiar es un cambio de una sola palabra a modelo. La diferencia que importa al elegir es el control de entregas.
El TTS-2 en tiempo real acepta dirección de voz en inglés sencillo: abre el texto con una instrucción entre corchetes y el modelo ejecuta la línea así en lugar de leer la instrucción en voz alta. Entiende tanto las directivas cortas como los breves breves de forma libre.
{ "modelo": "tts-2", "input": "[Habla con calidez, como si saludaras a un viejo amigo] Buenos días, me alegro de verte de nuevo.", "voz": "Ashley" }
TTS 2 Flash no aplica esa dirección. Envía el mismo texto entre corchetes a Flash y se ignora, así que busca TTS 2 cuando el rendimiento importa y Flash cuando la latencia y el volumen importan. En Flash, entrega de formas con el Velocidad y temperatura controla en su lugar.
Notas que merece la pena conocer antes de tu primera llamada
- La dirección de voz es solo TTS 2. Flash ignora silenciosamente una directiva entre corchetes en lugar de rechazarla, así que un prompt escrito para TTS 2 se ejecuta en Flash y simplemente vuelve sin dirigir.
- Se factura el texto de dirección. La instrucción entre corchetes cuenta para el total de caracteres de la petición aunque nunca se pronuncie, así que mantén los resúmenes breves.
- El límite por solicitud es de 2.000 caracteres. Haz un fragmento más largo en los límites de las frases en el cliente y concatena el audio, en lugar de enviar un bloque largo.
- La normalización de texto está activada por defecto. Los números, fechas y abreviaturas se amplían en forma hablada, lo que también significa que el recuento de caracteres facturados puede superar la longitud de la cadena que enviaste. Desactivarlo si ya has normalizado el texto tú mismo.
Empieza
Prueba TTS 2 Flash en el Playground, leer el Referencia de API, o ver las tasas actuales en la página modelo.



