
Síntese de fala em níveis com mais de 1.000 vozes, 16 idiomas, 20 dialetos chineses, direção de entrega em linguagem natural e tags emocionais inline.
Síntese de fala em níveis com mais de 1.000 vozes, 16 idiomas, 20 dialetos chineses, direção de entrega em linguagem natural e tags emocionais inline.
A seleção de vozes é consciente por níveis: os IDs de voz base funcionam em ambos os níveis e são automaticamente combinados com o model_tier selecionado, enquanto as seis vozes do sistema ficam bloqueadas em um nível. O pitch também altera o ritmo do áudio renderizado, então combine com a velocidade quando quiser preservar a duração original.
Também conhecido como Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS
qwen-audio-3-0-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesqwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flashTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
Qwen Audio 3.0 TTS gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo qwen-audio-3-0-tts. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-0-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parâmetros de requisição suportados pela API Qwen Audio 3.0 TTS na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| input | string | - | máx. 20000 | Texto para sintetizar. Até 20.000 caracteres por pedido. Suporta tags de expressão inline colocadas diretamente no texto, por exemplo [animado], [risos],... |
| model_tier | enum | plus | plus, flash | Além disso: Alta qualidade de áudio e expressividade, melhor para criação de conteúdo, audiolivros, dublagem e dublagem de marcas. Flash: Ajustado para interação em... |
| voice | enum | loongjameszhao | loongjameszhao, loongolivialin, loonglunawang, loongnorahu, l... | Predefinição de voz. As vozes base funcionam em AMBOS os níveis, então mudar model_tier mantém sua seleção. Seis vozes principais estão bloqueadas por tier:... |
| voice_id | string | - | - | Identificação de voz livre, que substitui a voz quando ativada. Aceita qualquer voz base do GET /v1/voices, seja como id básico (recomendado, funciona em ambos os... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | A taxa de amostragem de saída em Hz. 24000 é adequada para a reprodução de fala, e 48000 oferece saída de qualidade de transmissão em um arquivo maior. |
| speed | number | 1 | 0.5 a 2 | Multiplicador de taxa de fala. 0,5 é metade da velocidade e 2,0 é dobra. |
| pitch | number | 1 | 0.5 a 2 | Multiplicador de pitch. Valores abaixo de 1,0 diminuem a voz e valores acima a elevam. O pitch também altera o ritmo do áudio renderizado, então combine com a... |
| volume | integer | 50 | 0 a 100 | Loudness de saída, onde 50 é o nível de referência. |
| instruction | string | - | máx. 128 | Direção em linguagem natural para entrega, até 128 caracteres. Controla emoção, tom, caráter, ritmo e estilo de fala, por exemplo: 'Fale rápido em um tom animado e... |
| language_hints | array | - | zh, en | Códigos de linguagem que enviesam a pronúncia para textos de línguas mistas, por exemplo ["zh", "en"]. Deixe sem definir para permitir que o modelo detecte a linguagem. |
| seed | integer | 0 | 0 a 65535 | Amostrando sementes. Reuse uma seed com entrada e configurações idênticas para uma renderização repetível. |
| bit_rate | integer | 32000 | 16000 a 64000 | Taxa de bits do codificador em bps. Aplica-se apenas ao formato opus e é ignorado para mp3, wav e pcm. |
| pronunciation | object | - | - | A pronúncia prevalece sobre a forma escrita, por exemplo {"重要": "zhong4 yao4"}. Use-o para corrigir nomes, siglas e homógrafos. |
| replace | object | - | - | Substituições literais de texto aplicadas antes da síntese, por exemplo {"EmpirioLabs": "Empirio Labs"}. Útil para nomes de marcas e abreviações. |
Tiers - Plus: maior qualidade de áudio e expressividade, para criação de conteúdo, audiolivros, dublagem e trabalho de voz de marca - Flash: ajustado para interação em tempo real com menor latência no primeiro pacote, para assistentes de voz e agentes ao vivo - Alterne com o parâmetro model_tier, ou envie qwen-audio-3.0-tts-plus ou qwen-audio-3.0-tts-flash como o id do modelo Vozes - Mais de 1.000 vozes base, todas disponíveis em ambos os níveis, então mudar de nível mantém sua voz selecionada - Seis vozes principais do sistema são específicas para níveis: longanlingxin e longanlufeng no Plus, e longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn no Flash - Navegue pelo catálogo completo com GET /v1/voices e passe qualquer voz por qwen-audio-3.0-tts-plus 0__ Limites de entrada - Até 20.000 caracteres por requisição qwen-audio-3.0-tts-plus 1__ aceita até 128 caracteres - Entrada SSML não é suportada. Use qwen-audio-3.0-tts-plus 2__ para a direção de entrega e tags inline como qwen-audio-3.0-tts-plus 3__ ou qwen-audio-3.0-tts-plus 4__ dentro do texto Faturamento - Faturado por caractere do texto de entrada na taxa do nível selecionado
Na EmpirioLabs, Qwen Audio 3.0 TTS é cobrado por uso: Síntese Plus $0.20 por 10.000 caracteres; Síntese em flash $0.15 por 10.000 caracteres. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
Qwen Audio 3.0 TTS é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa Qwen Audio 3.0 TTS no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.