
Modelo de voz em tempo real com direção de voz em inglês simples, uma identidade de voz em 100+ idiomas e time-to-first-audio de streaming abaixo de 200ms.
Modelo de voz em tempo real com direção de voz em inglês simples, uma identidade de voz em 100+ idiomas e time-to-first-audio de streaming abaixo de 200ms.
Também conhecido como Inworld TTS 2, TTS-2
tts-2/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesinworld-tts-2Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
TTS 2 gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo tts-2. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parâmetros de requisição suportados pela API TTS 2 na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| input | string | - | máx. 2000 | Texto para sintetizar. No máximo 2.000 caracteres por pedido; Faça um texto mais longo nos limites das frases para o cliente. |
| voice | enum | Sarah | Sarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,... | Predefinição de voz. 20 vozes selecionadas a dedo cobrindo inglês, espanhol, português, hindi e vários sotaques. Para o catálogo completo de vozes (incluindo vozes... |
| voice_id | string | - | - | ID de voz livre. Sobrepõe a voz quando ativado. Use isso para abordar qualquer voz além da lista selecionada de 20 pré-sets, incluindo vozes clonadas e regionais.... |
| language | enum | en-US | en-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT... | Código da língua BCP-47. Este modelo possui uma identidade vocal em 100+ idiomas; Passe qualquer código suportado aqui, mesmo que não esteja no menu suspenso. |
| output_format | enum | WAV | MP3, WAV, OGG, FLAC, PCM, ALAW, MULAW | Áudio container/codec. WAV = LINEAR16 dentro do RIFF (onipresente). MP3 / OGG = comprimido. PCM = raw sem cabeçalho, útil para reprodução em tempo real em blocos.... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 32000, 44100, 48000 | A taxa de amostragem de saída em Hz. 24000 é o padrão da Inworld e o que seus modelos de voz treinam; Aumento para 48000 para qualidade de transmissão. |
| speed | number | 1 | 0.5 a 1.5 | Multiplicador de taxa de fala. 0,5 = metade da velocidade, 1,5 = 50% mais rápido. |
| temperature | number | 1 | 0.1 a 2 | Expressividade / variabilidade da voz. Lower = mais consistente / "plano"; mais alto = mais expressivo, mas com mais variação entre os renders. |
| bit_rate | number | 128000 | 32000 a 320000 | Bitrate em bps para MP3 / OGG_OPUS. Ignorado por outras codificações. |
| apply_text_normalization | enum | ON | ON, OFF | Quando ON, o Inworld expande números / abreviações / datas para a forma falada ("USD 5" → "cinco dólares americanos"). |
| timestamp_type | enum | NONE | NONE, WORD, CHARACTER | Se não for NENHUMA, a resposta inclui carimbos de tempo por palavra ou por caractere em timestamp_info. Útil para interfaces de legendas / destaques. |
Limites - Entrada máxima: 2.000 caracteres por requisição (texto maior nos limites das frases) - WebSocket: 20 conexões simultâneas, 5 contexts/connection - Mensagem por WS: 1.000 caracteres Latência - p90 TTFB: menos de 200 ms (benchmark Inworld) Vozes - Uma identidade de voz mantida em 100+ idiomas - Presets selecionados no menu suspenso; passe qualquer outro ID de voz via voice_id - Direção de voz em inglês simples para direcionar o tom e a entrega
Na EmpirioLabs, TTS 2 é cobrado por uso. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
TTS 2 é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa TTS 2 no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.