
Síntesis de voz TTFB por debajo de 130 ms con 271+ voces en 15 idiomas, prosodia expresiva y streaming SSE en tiempo real para agentes de voz de baja latencia.
Síntesis de voz TTFB por debajo de 130 ms con 271+ voces en 15 idiomas, prosodia expresiva y streaming SSE en tiempo real para agentes de voz de baja latencia.
También conocido como TTS Mini, Inworld TTS 1.5 Mini, TTS-1.5-Mini, tts-1-5-mini
tts-1-5-mini/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-1.5-minitts-1.5-miniTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
TTS 1.5 Mini genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo tts-1-5-mini. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-1-5-mini",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-1-5-mini", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parámetros de solicitud compatibles con la API de TTS 1.5 Mini en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input | string | - | máx. 2000 | Texto para sintetizar. Máximo 2.000 caracteres por solicitud; Haz un texto más largo en los límites de las frases del cliente. |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | Preajuste de voz. 20 voces seleccionadas a dedo que cubren inglés + español + portugués + hindi + varios acentos. Para el catálogo completo de 271 voces (incluyendo... |
| voice_id | string | - | - | ID de voz libre. Anula la voz cuando está activado. Úsalo para dirigirte a voces fuera de la lista seleccionada de 20 presets. En Inworld TTS 1.5 se distribuyen 271+... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | Código del idioma BCP-47. Inworld TTS 1.5 cubre 15 idiomas. |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | Audio container/codec. WAV = LINEAR16 dentro del RIFF (ubicuo). MP3 / OGG = comprimido. PCM = raw sin cabecera, útil para reproducción en tiempo real fragmentada.... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | La tasa de muestreo de salida en Hz. 24000 es la predeterminada de Inworld y es la que entrenan sus modelos de voz; sube a 48000 para calidad de radiodifusión. |
| speed | number | 1 | 0.5 a 1.5 | Multiplicador de tasa de conversación. 0,5 = media velocidad, 1,5 = 50% más rápido. |
| temperature | number | 1 | 0.1 a 2 | Expresividad / variabilidad de la voz. Más bajo = más consistente / "plano"; Más alto = más expresivo pero con más variación entre renders. |
| bit_rate | number | 128000 | 32000 a 320000 | Tasa de bits en bps para MP3 / OGG_OPUS. Ignorado por otras codificaciones. |
| apply_text_normalization | enum | ON | ON, OFF | Cuando es ON, Inworld amplía números / abreviaturas / fechas a forma hablada ("USD 5" → "cinco dólares estadounidenses"). |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | Si no es NINGUNA, la respuesta incluye marcas de tiempo por palabra o por carácter en timestamp_info. Útil para interfaces de subtítulos y resaltos. |
Límites - Entrada máxima: 2.000 caracteres por petición (fragmentar el texto más largo en los límites de las frases) - WebSocket: 20 conexiones concurrentes, 5 contexts/connection - Mensaje por WS: 1.000 caracteres Latencia - p90 TTFB: menos de 130 ms (benchmark Inworld) Voces - 271+ presets nombrados en 15 idiomas - 20 presets seleccionados a mano expuestos en el desplegable; pasa cualquier otro ID de voz vía voice_id
En EmpirioLabs, TTS 1.5 Mini se factura por uso. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
TTS 1.5 Mini se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta TTS 1.5 Mini en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.