TTS 1.5 Max API

Síntese de voz de qualidade de transmissão com prosódia expressiva rica, 271+ vozes em 15 idiomas e streaming em tempo real de SSE com datas por palavra.

InworldGeração de ÁudioLançado 21 de jan. de 2026Endpoint proprietário

Sobre TTS 1.5 Max

Síntese de voz de qualidade de transmissão com prosódia expressiva rica, 271+ vozes em 15 idiomas e streaming em tempo real de SSE com datas por palavra.

Também conhecido como TTS Max, Inworld TTS 1.5 Max, TTS-1.5-Max, tts-1-5-max

multi speakerreal timestreamingword timestampscharacter timestampsmultilingualexpressive prosodybroadcast quality

Especificações de TTS 1.5 Max

ID do modelo
tts-1-5-max
Provedor
Inworld
Categoria
Geração de Áudio
Lançado
21 de jan. de 2026
Entrada
Texto
Saída
Áudio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
IDs de modelo alternativos
inworld-tts-1.5-maxtts-1.5-max

Preços da API TTS 1.5 MaxEconomize até 15%

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Síntese
por 1M caracteres
$35.00$29.75
Comparar na página completa de preços

Como chamar a API TTS 1.5 Max

TTS 1.5 Max gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo tts-1-5-max. Obtenha uma chave de API no painel EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1-5-max",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-1-5-max", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referência completa da API TTS 1.5 Max

Parâmetros da API TTS 1.5 Max

Parâmetros de requisição suportados pela API TTS 1.5 Max na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
inputstring-máx. 2000Texto para sintetizar. No máximo 2.000 caracteres por pedido; Faça um texto mais longo nos limites das frases para o cliente.
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Predefinição de voz. 20 vozes escolhidas a dedo cobrindo inglês + espanhol + português + hindi + vários sotaques. Para o catálogo completo de 271 vozes (incluindo...
voice_idstring--ID de voz livre. Sobrepõe a voz quando ativado. Use isso para falar de vozes fora da lista selecionada de 20 pré-sets. O Inworld TTS 1.5 traz 271+ vozes nomeadas em...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...Código da língua BCP-47. O Inworld TTS 1.5 cobre 15 idiomas.
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWÁudio container/codec. WAV = LINEAR16 dentro do RIFF (onipresente). MP3 / OGG = comprimido. PCM = raw sem cabeçalho, útil para reprodução em tempo real em blocos....
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000A taxa de amostragem de saída em Hz. 24000 é o padrão da Inworld e o que seus modelos de voz treinam; Aumento para 48000 para qualidade de transmissão.
speednumber10.5 a 1.5Multiplicador de taxa de fala. 0,5 = metade da velocidade, 1,5 = 50% mais rápido.
temperaturenumber10.1 a 2Expressividade / variabilidade da voz. Lower = mais consistente / "plano"; mais alto = mais expressivo, mas com mais variação entre os renders.
bit_ratenumber12800032000 a 320000Bitrate em bps para MP3 / OGG_OPUS. Ignorado por outras codificações.
apply_text_normalizationenumONON, OFFQuando ON, o Inworld expande números / abreviações / datas para a forma falada ("USD 5" → "cinco dólares americanos").
timestamp_typeenumNONENONE, WORD, CHARACTERSe não for NENHUMA, a resposta inclui carimbos de tempo por palavra ou por caractere em timestamp_info. Útil para interfaces de legendas / destaques.

Bom saber

Limites - Entrada máxima: 2.000 caracteres por requisição (encher texto mais longo nos limites das sentenças) - WebSocket: 20 conexões simultâneas, 5 contexts/connection Mensagem Per-WS: 1.000 caracteres Latência - p90 TTFB: sob 250 ms (benchmark inworld) Vozes - 271+ predefinidas em 15 idiomas - 20 predefinições escolhidas à mão expostas no dropdown; passe qualquer outro ID de voz via voice_id

API TTS 1.5 Max: perguntas frequentes

Quanto custa a API TTS 1.5 Max?

Na EmpirioLabs, TTS 1.5 Max é cobrado por uso. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint TTS 1.5 Max usa?

TTS 1.5 Max é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar TTS 1.5 Max no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa TTS 1.5 Max no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API TTS 1.5 Max?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.