TTS 1.5 Mini API

Sub-130ms TTFB síntese de voz com 271+ vozes em 15 idiomas, prosódia expressiva e streaming em tempo real para agentes de voz de baixa latência.

InworldGeração de ÁudioLançado 21 de jan. de 2026Endpoint proprietário

Sobre TTS 1.5 Mini

Sub-130ms TTFB síntese de voz com 271+ vozes em 15 idiomas, prosódia expressiva e streaming em tempo real para agentes de voz de baixa latência.

Também conhecido como TTS Mini, Inworld TTS 1.5 Mini, TTS-1.5-Mini, tts-1-5-mini

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingualexpressive prosody

Especificações de TTS 1.5 Mini

ID do modelo
tts-1-5-mini
Provedor
Inworld
Categoria
Geração de Áudio
Lançado
21 de jan. de 2026
Entrada
Texto
Saída
Áudio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
IDs de modelo alternativos
inworld-tts-1.5-minitts-1.5-mini

Preços da API TTS 1.5 MiniEconomize até 30%

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Síntese
por 1M caracteres
$25.00$17.50
Comparar na página completa de preços

Como chamar a API TTS 1.5 Mini

TTS 1.5 Mini gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo tts-1-5-mini. Obtenha uma chave de API no painel EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-1-5-mini",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-1-5-mini", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referência completa da API TTS 1.5 Mini

Parâmetros da API TTS 1.5 Mini

Parâmetros de requisição suportados pela API TTS 1.5 Mini na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
inputstring-máx. 2000Texto para sintetizar. No máximo 2.000 caracteres por pedido; Faça um texto mais longo nos limites das frases para o cliente.
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Predefinição de voz. 20 vozes escolhidas a dedo cobrindo inglês + espanhol + português + hindi + vários sotaques. Para o catálogo completo de 271 vozes (incluindo...
voice_idstring--ID de voz livre. Sobrepõe a voz quando ativado. Use isso para falar de vozes fora da lista selecionada de 20 pré-sets. O Inworld TTS 1.5 traz 271+ vozes nomeadas em...
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...Código da língua BCP-47. O Inworld TTS 1.5 cobre 15 idiomas.
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWÁudio container/codec. WAV = LINEAR16 dentro do RIFF (onipresente). MP3 / OGG = comprimido. PCM = raw sem cabeçalho, útil para reprodução em tempo real em blocos....
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000A taxa de amostragem de saída em Hz. 24000 é o padrão da Inworld e o que seus modelos de voz treinam; Aumento para 48000 para qualidade de transmissão.
speednumber10.5 a 1.5Multiplicador de taxa de fala. 0,5 = metade da velocidade, 1,5 = 50% mais rápido.
temperaturenumber10.1 a 2Expressividade / variabilidade da voz. Lower = mais consistente / "plano"; mais alto = mais expressivo, mas com mais variação entre os renders.
bit_ratenumber12800032000 a 320000Bitrate em bps para MP3 / OGG_OPUS. Ignorado por outras codificações.
apply_text_normalizationenumONON, OFFQuando ON, o Inworld expande números / abreviações / datas para a forma falada ("USD 5" → "cinco dólares americanos").
timestamp_typeenumNONENONE, WORD, CHARACTERSe não for NENHUMA, a resposta inclui carimbos de tempo por palavra ou por caractere em timestamp_info. Útil para interfaces de legendas / destaques.

Bom saber

Limites - Entrada máxima: 2.000 caracteres por requisição (encher texto mais longo em limites de sentenças) - WebSocket: 20 conexões simultâneas, 5 contexts/connection Mensagem Per-WS: 1.000 caracteres Latência - p90 TTFB: sob 130 ms (benchmark inworld) Vozes - 271+ predefinições nomeadas em 15 idiomas - 20 predefinições escolhidas à mão expostas no dropdown; passe qualquer outro ID de voz via voice_id

API TTS 1.5 Mini: perguntas frequentes

Quanto custa a API TTS 1.5 Mini?

Na EmpirioLabs, TTS 1.5 Mini é cobrado por uso. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint TTS 1.5 Mini usa?

TTS 1.5 Mini é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar TTS 1.5 Mini no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa TTS 1.5 Mini no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API TTS 1.5 Mini?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.