TTS 2 API

Modelo de voz en tiempo real que sigue la dirección de entrega en inglés sencillo, mantiene una identidad vocal en 200+ idiomas y transmite con marcas de tiempo de las palabras.

InworldGeneración de audioLanzado 5 may 2026Endpoint propietario

Acerca de TTS 2

Modelo de voz en tiempo real que sigue la dirección de entrega en inglés sencillo, mantiene una identidad vocal en 200+ idiomas y transmite con marcas de tiempo de las palabras.

También conocido como Inworld TTS 2

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingualexpressive prosodyvoice direction

Especificaciones de TTS 2

ID del modelo
tts-2
Proveedor
Inworld
Categoría
Generación de audio
Lanzado
5 may 2026
Entrada
Texto
Salida
Audio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
IDs de modelo alternativos
inworld-tts-2

Precios de la API de TTS 2Ahorra hasta 12%

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Síntesis
por 1M de caracteres
$25.00$22.00
Comparar en la página completa de precios

Cómo llamar a la API de TTS 2

TTS 2 genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo tts-2. Consigue una clave de API en el panel de EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referencia completa de la API de TTS 2

Parámetros de la API de TTS 2

Parámetros de solicitud compatibles con la API de TTS 2 en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
inputstring-máx. 2000Texto para sintetizar. Máximo 2.000 caracteres por petición; Copia más larga en los límites de las oraciones en el cliente. Opcionalmente, abre el texto con una...
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Preajuste de voz. 20 voces seleccionadas a mano que cubren inglés, español, portugués, hindi y varios acentos. Para el catálogo completo de voces (incluyendo voces...
voice_idstring--ID de voz libre. Anula la voz cuando está activado. Utiliza esto para dirigirte a cualquier voz más allá de la lista seleccionada de 20 predefinidos, incluyendo...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...Código de lenguaje BCP-47. Este modelo tiene una identidad de voz en 200+ idiomas y localidades, así que puedes pasar cualquier código compatible incluso si no está...
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWAudio container/codec. WAV = LINEAR16 dentro del RIFF (ubicuo). MP3 / OGG = comprimido. PCM = raw sin cabecera, útil para reproducción en tiempo real fragmentada....
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000La tasa de muestreo de salida en Hz. 24000 es la predeterminada de Inworld y es la que entrenan sus modelos de voz; sube a 48000 para calidad de radiodifusión.
speednumber10.5 a 1.5Multiplicador de tasa de conversación. 0,5 = media velocidad, 1,5 = 50% más rápido.
temperaturenumber10.1 a 2Expresividad / variabilidad de la voz. Más bajo = más consistente / "plano"; Más alto = más expresivo pero con más variación entre renders.
bit_ratenumber12800032000 a 320000Tasa de bits en bps para MP3 / OGG_OPUS. Ignorado por otras codificaciones.
apply_text_normalizationenumONON, OFFCuando es ON, Inworld amplía números / abreviaturas / fechas a forma hablada ("USD 5" → "cinco dólares estadounidenses").
timestamp_typeenumNONENONE, WORD, CHARACTERSi no es NINGUNA, la respuesta incluye marcas de tiempo por palabra o por carácter en timestamp_info. Útil para interfaces de subtítulos y resaltos.

Información útil

Límites - Entrada máxima: 2.000 caracteres por petición (fragmentar texto más largo en los límites de las frases) - WebSocket: 20 conexiones concurrentes, 5 contexts/connection - Mensaje por WS: 1.000 caracteres Dirección de voz - Abre el texto con una instrucción entre corchetes en inglés sencillo para orientar la entrega, por ejemplo [whispering], [excited] o [Speak warmly, like you are greeting an old friend] - El texto entre corchetes se trata como dirección y no se lee en voz alta - El texto de dirección cuenta para el total de caracteres facturados, así que mantenlo breve Latencia - p90 TTFB: menos de 100 ms (benchmark Inworld) Voces - Una identidad de voz mantenida en 200+ idiomas y localidades, incluyendo cambio de idioma a mitad de generación - Presets seleccionados en el desplegable; pasa cualquier otro ID de voz vía voice_id

API de TTS 2: preguntas frecuentes

¿Cuánto cuesta la API de TTS 2?

En EmpirioLabs, TTS 2 se factura por uso. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Qué endpoint usa TTS 2?

TTS 2 se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar TTS 2 en el navegador antes de integrar?

Sí. El playground de EmpirioLabs ejecuta TTS 2 en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.

¿Cómo consigo una clave de API de TTS 2?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.