
Modelo de voz en tiempo real con dirección de voz en inglés sencillo, una identidad de voz en 100+ idiomas y time-to-first-audio de streaming por debajo de 200 ms.
Modelo de voz en tiempo real con dirección de voz en inglés sencillo, una identidad de voz en 100+ idiomas y time-to-first-audio de streaming por debajo de 200 ms.
También conocido como Inworld TTS 2, TTS-2
tts-2/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
TTS 2 genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo tts-2. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parámetros de solicitud compatibles con la API de TTS 2 en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input | string | - | máx. 2000 | Texto para sintetizar. Máximo 2.000 caracteres por solicitud; Haz un texto más largo en los límites de las frases del cliente. |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | Preajuste de voz. 20 voces seleccionadas a mano que cubren inglés, español, portugués, hindi y varios acentos. Para el catálogo completo de voces (incluyendo voces... |
| voice_id | string | - | - | ID de voz libre. Anula la voz cuando está activado. Utiliza esto para dirigirte a cualquier voz más allá de la lista seleccionada de 20 predefinidos, incluyendo... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | Código del idioma BCP-47. Este modelo tiene una identidad de voz en 100+ idiomas; Pasa cualquier código soportado aquí aunque no esté en el desplegable. |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | Audio container/codec. WAV = LINEAR16 dentro del RIFF (ubicuo). MP3 / OGG = comprimido. PCM = raw sin cabecera, útil para reproducción en tiempo real fragmentada.... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | La tasa de muestreo de salida en Hz. 24000 es la predeterminada de Inworld y es la que entrenan sus modelos de voz; sube a 48000 para calidad de radiodifusión. |
| speed | number | 1 | 0.5 a 1.5 | Multiplicador de tasa de conversación. 0,5 = media velocidad, 1,5 = 50% más rápido. |
| temperature | number | 1 | 0.1 a 2 | Expresividad / variabilidad de la voz. Más bajo = más consistente / "plano"; Más alto = más expresivo pero con más variación entre renders. |
| bit_rate | number | 128000 | 32000 a 320000 | Tasa de bits en bps para MP3 / OGG_OPUS. Ignorado por otras codificaciones. |
| apply_text_normalization | enum | ON | ON, OFF | Cuando es ON, Inworld amplía números / abreviaturas / fechas a forma hablada ("USD 5" → "cinco dólares estadounidenses"). |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | Si no es NINGUNA, la respuesta incluye marcas de tiempo por palabra o por carácter en timestamp_info. Útil para interfaces de subtítulos y resaltos. |
Límites - Entrada máxima: 2.000 caracteres por petición (fragmento de texto más largo en los límites de las frases) - WebSocket: 20 conexiones concurrentes, 5 contexts/connection - Mensaje por WS: 1.000 caracteres Latencia - p90 TTFB: menos de 200 ms (benchmark Inworld) Voces - Una identidad de voz mantenida en 100+ idiomas - Presets seleccionados en el desplegable; pasa cualquier otra identificación de voz vía voice_id - Dirección de voz en inglés sencillo para dirigir el tono y la entrega
En EmpirioLabs, TTS 2 se factura por uso. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
TTS 2 se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta TTS 2 en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.