TTS 2 Flash API

Síntese de voz em tempo real com latência em primeiro lugar, mantendo uma identidade de voz em 200+ idiomas, ajustada para cargas de trabalho de streaming de alto volume.

InworldGeração de ÁudioLançado 2 de set. de 2026Endpoint proprietárioNovo

Sobre TTS 2 Flash

Síntese de voz em tempo real com latência em primeiro lugar, mantendo uma identidade de voz em 200+ idiomas, ajustada para cargas de trabalho de streaming de alto volume.

Também conhecido como Inworld TTS 2 Flash

multi speakerreal timelow latencystreamingword timestampscharacter timestampsmultilingual

Especificações de TTS 2 Flash

ID do modelo
tts-2-flash
Provedor
Inworld
Categoria
Geração de Áudio
Lançado
2 de set. de 2026
Entrada
Texto
Saída
Áudio
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
IDs de modelo alternativos
inworld-tts-2-flash

Preços da API TTS 2 FlashEconomize até 30%

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Síntese
por 1M de caracteres
$15.00$10.50
Comparar na página completa de preços

Como chamar a API TTS 2 Flash

TTS 2 Flash gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo tts-2-flash. Obtenha uma chave de API no painel EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "tts-2-flash",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "tts-2-flash", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referência completa da API TTS 2 Flash

Parâmetros da API TTS 2 Flash

Parâmetros de requisição suportados pela API TTS 2 Flash na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
inputstring-máx. 2000Texto para sintetizar. No máximo 2.000 caracteres por requisição; copie em blocos mais longos nos limites das frases no cliente. Este modelo não aplica direção de...
voiceenumSarahSarah, Olivia, Elizabeth, Ashley, Wendy, Julia, Priya, Pixie,...Predefinição de voz. 20 vozes selecionadas a dedo cobrindo inglês, espanhol, português, hindi e vários sotaques. Para o catálogo completo de vozes (incluindo vozes...
voice_idstring--ID de voz livre. Sobrepõe a voz quando ativado. Use isso para abordar qualquer voz além da lista selecionada de 20 pré-sets, incluindo vozes clonadas e regionais....
languageenumen-USen-US, en-GB, es-ES, es-MX, fr-FR, de-DE, it-IT, pt-BR, pt-PT...Código de idioma BCP-47. Este modelo possui uma identidade de voz em 200+ idiomas e locais, então você pode passar qualquer código suportado aqui mesmo que não...
output_formatenumWAVMP3, WAV, OGG, FLAC, PCM, ALAW, MULAWÁudio container/codec. WAV = LINEAR16 dentro do RIFF (onipresente). MP3 / OGG = comprimido. PCM = raw sem cabeçalho, útil para reprodução em tempo real em blocos....
sample_rateenum240008000, 16000, 22050, 24000, 32000, 44100, 48000A taxa de amostragem de saída em Hz. 24000 é o padrão da Inworld e o que seus modelos de voz treinam; Aumento para 48000 para qualidade de transmissão.
speednumber10.5 a 1.5Multiplicador de taxa de fala. 0,5 = metade da velocidade, 1,5 = 50% mais rápido.
temperaturenumber10.1 a 2Expressividade / variabilidade da voz. Lower = mais consistente / "plano"; mais alto = mais expressivo, mas com mais variação entre os renders.
bit_ratenumber12800032000 a 320000Bitrate em bps para MP3 / OGG_OPUS. Ignorado por outras codificações.
apply_text_normalizationenumONON, OFFQuando ON, o Inworld expande números / abreviações / datas para a forma falada ("USD 5" → "cinco dólares americanos").
timestamp_typeenumNONENONE, WORD, CHARACTERSe não for NENHUMA, a resposta inclui carimbos de tempo por palavra ou por caractere em timestamp_info. Útil para interfaces de legendas / destaques.

Bom saber

Limites - Entrada máxima: 2.000 caracteres por requisição (pedaço de texto maior nos limites das frases) - WebSocket: 20 conexões concorrentes, 5 contexts/connection - Mensagem por WS: 1.000 caracteres Direção de voz - Este modelo não aplica direção de entrega em inglês simples com parêntese. Use TTS 2 quando precisar, ou entrega de forma aqui com os controles speed e temperature. Latência - p90 TTFB: abaixo de 25 ms (benchmark Inworld) Vozes - Uma identidade de voz mantida em 200+ idiomas e locais, incluindo troca de idioma no meio da geração - Presets selecionados no menu suspenso; passe qualquer outro ID de voz via voice_id

API TTS 2 Flash: perguntas frequentes

Quanto custa a API TTS 2 Flash?

Na EmpirioLabs, TTS 2 Flash é cobrado por uso. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint TTS 2 Flash usa?

TTS 2 Flash é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar TTS 2 Flash no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa TTS 2 Flash no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API TTS 2 Flash?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.