TTS 2 API

Modelo de voz em tempo real com direção de voz em inglês simples, uma identidade de voz em 100+ idiomas e time-to-first-audio de streaming abaixo de 200ms.

InworldGeração de ÁudioLançado 5 de mai. de 2026Endpoint proprietárioNovo

Sobre TTS 2

Modelo de voz em tempo real com direção de voz em inglês simples, uma identidade de voz em 100+ idiomas e time-to-first-audio de streaming abaixo de 200ms.

Também conhecido como Inworld TTS 2, TTS-2

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingualexpressive prosody

Especificações de TTS 2

ID do modelo
tts-2
Provedor
Inworld
Categoria
Geração de Áudio
Lançado
5 de mai. de 2026
Entrada
Texto
Saída
Áudio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
IDs de modelo alternativos
inworld-tts-2

Preços da API TTS 2Economize até 12%

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Síntese
por 1M caracteres
$25.00$22.00
Comparar na página completa de preços

Como chamar a API TTS 2

TTS 2 gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo tts-2. Obtenha uma chave de API no painel EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referência completa da API TTS 2

Parâmetros da API TTS 2

Parâmetros de requisição suportados pela API TTS 2 na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
inputstring-máx. 2000Texto para sintetizar. No máximo 2.000 caracteres por pedido; Faça um texto mais longo nos limites das frases para o cliente.
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Predefinição de voz. 20 vozes selecionadas a dedo cobrindo inglês, espanhol, português, hindi e vários sotaques. Para o catálogo completo de vozes (incluindo vozes...
voice_idstring--ID de voz livre. Sobrepõe a voz quando ativado. Use isso para abordar qualquer voz além da lista selecionada de 20 pré-sets, incluindo vozes clonadas e regionais....
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...Código da língua BCP-47. Este modelo possui uma identidade vocal em 100+ idiomas; Passe qualquer código suportado aqui, mesmo que não esteja no menu suspenso.
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWÁudio container/codec. WAV = LINEAR16 dentro do RIFF (onipresente). MP3 / OGG = comprimido. PCM = raw sem cabeçalho, útil para reprodução em tempo real em blocos....
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000A taxa de amostragem de saída em Hz. 24000 é o padrão da Inworld e o que seus modelos de voz treinam; Aumento para 48000 para qualidade de transmissão.
speednumber10.5 a 1.5Multiplicador de taxa de fala. 0,5 = metade da velocidade, 1,5 = 50% mais rápido.
temperaturenumber10.1 a 2Expressividade / variabilidade da voz. Lower = mais consistente / "plano"; mais alto = mais expressivo, mas com mais variação entre os renders.
bit_ratenumber12800032000 a 320000Bitrate em bps para MP3 / OGG_OPUS. Ignorado por outras codificações.
apply_text_normalizationenumONON, OFFQuando ON, o Inworld expande números / abreviações / datas para a forma falada ("USD 5" → "cinco dólares americanos").
timestamp_typeenumNONENONE, WORD, CHARACTERSe não for NENHUMA, a resposta inclui carimbos de tempo por palavra ou por caractere em timestamp_info. Útil para interfaces de legendas / destaques.

Bom saber

Limites - Entrada máxima: 2.000 caracteres por requisição (texto maior nos limites das frases) - WebSocket: 20 conexões simultâneas, 5 contexts/connection - Mensagem por WS: 1.000 caracteres Latência - p90 TTFB: menos de 200 ms (benchmark Inworld) Vozes - Uma identidade de voz mantida em 100+ idiomas - Presets selecionados no menu suspenso; passe qualquer outro ID de voz via voice_id - Direção de voz em inglês simples para direcionar o tom e a entrega

API TTS 2: perguntas frequentes

Quanto custa a API TTS 2?

Na EmpirioLabs, TTS 2 é cobrado por uso. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint TTS 2 usa?

TTS 2 é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar TTS 2 no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa TTS 2 no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API TTS 2?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.