Qwen Audio 3.0 TTS API

Síntese de fala em níveis com mais de 1.000 vozes, 16 idiomas, 20 dialetos chineses, direção de entrega em linguagem natural e tags emocionais inline.

Alibaba CloudGeração de ÁudioLançado 20 de jul. de 2026SingaporeEndpoint proprietárioNovo

Sobre Qwen Audio 3.0 TTS

Síntese de fala em níveis com mais de 1.000 vozes, 16 idiomas, 20 dialetos chineses, direção de entrega em linguagem natural e tags emocionais inline.

A seleção de vozes é consciente por níveis: os IDs de voz base funcionam em ambos os níveis e são automaticamente combinados com o model_tier selecionado, enquanto as seis vozes do sistema ficam bloqueadas em um nível. O pitch também altera o ritmo do áudio renderizado, então combine com a velocidade quando quiser preservar a duração original.

Também conhecido como Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS

text to speechmultilingualexpressive prosodyemotion controlvoice tagsdialectlow latency

Especificações de Qwen Audio 3.0 TTS

ID do modelo
qwen-audio-3-0-tts
Autor
Alibaba Cloud
Categoria
Geração de Áudio
Lançado
20 de jul. de 2026
Entrada
Texto
Saída
Áudio
Região
Singapore
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
IDs de modelo alternativos
qwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash

Preços da API Qwen Audio 3.0 TTS

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Síntese Plus
por 10.000 caracteres
$0.20
Síntese em flash
por 10.000 caracteres
$0.15
Comparar na página completa de preços

Como chamar a API Qwen Audio 3.0 TTS

Qwen Audio 3.0 TTS gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo qwen-audio-3-0-tts. Obtenha uma chave de API no painel EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3-0-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referência completa da API Qwen Audio 3.0 TTS

Parâmetros da API Qwen Audio 3.0 TTS

Parâmetros de requisição suportados pela API Qwen Audio 3.0 TTS na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
inputstring-máx. 20000Texto para sintetizar. Até 20.000 caracteres por pedido. Suporta tags de expressão inline colocadas diretamente no texto, por exemplo [animado], [risos],...
model_tierenumplusplus, flashAlém disso: Alta qualidade de áudio e expressividade, melhor para criação de conteúdo, audiolivros, dublagem e dublagem de marcas. Flash: Ajustado para interação em...
voiceenumloongjameszhaoloongjameszhao, loongolivialin, loonglunawang, loongnorahu, l...Predefinição de voz. As vozes base funcionam em AMBOS os níveis, então mudar model_tier mantém sua seleção. Seis vozes principais estão bloqueadas por tier:...
voice_idstring--Identificação de voz livre, que substitui a voz quando ativada. Aceita qualquer voz base do GET /v1/voices, seja como id básico (recomendado, funciona em ambos os...
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000A taxa de amostragem de saída em Hz. 24000 é adequada para a reprodução de fala, e 48000 oferece saída de qualidade de transmissão em um arquivo maior.
speednumber10.5 a 2Multiplicador de taxa de fala. 0,5 é metade da velocidade e 2,0 é dobra.
pitchnumber10.5 a 2Multiplicador de pitch. Valores abaixo de 1,0 diminuem a voz e valores acima a elevam. O pitch também altera o ritmo do áudio renderizado, então combine com a...
volumeinteger500 a 100Loudness de saída, onde 50 é o nível de referência.
instructionstring-máx. 128Direção em linguagem natural para entrega, até 128 caracteres. Controla emoção, tom, caráter, ritmo e estilo de fala, por exemplo: 'Fale rápido em um tom animado e...
language_hintsarray-zh, enCódigos de linguagem que enviesam a pronúncia para textos de línguas mistas, por exemplo ["zh", "en"]. Deixe sem definir para permitir que o modelo detecte a linguagem.
seedinteger00 a 65535Amostrando sementes. Reuse uma seed com entrada e configurações idênticas para uma renderização repetível.
bit_rateinteger3200016000 a 64000Taxa de bits do codificador em bps. Aplica-se apenas ao formato opus e é ignorado para mp3, wav e pcm.
pronunciationobject--A pronúncia prevalece sobre a forma escrita, por exemplo {"重要": "zhong4 yao4"}. Use-o para corrigir nomes, siglas e homógrafos.
replaceobject--Substituições literais de texto aplicadas antes da síntese, por exemplo {"EmpirioLabs": "Empirio Labs"}. Útil para nomes de marcas e abreviações.
2 parâmetros a mais na documentação

Bom saber

Tiers - Plus: maior qualidade de áudio e expressividade, para criação de conteúdo, audiolivros, dublagem e trabalho de voz de marca - Flash: ajustado para interação em tempo real com menor latência no primeiro pacote, para assistentes de voz e agentes ao vivo - Alterne com o parâmetro model_tier, ou envie qwen-audio-3.0-tts-plus ou qwen-audio-3.0-tts-flash como o id do modelo Vozes - Mais de 1.000 vozes base, todas disponíveis em ambos os níveis, então mudar de nível mantém sua voz selecionada - Seis vozes principais do sistema são específicas para níveis: longanlingxin e longanlufeng no Plus, e longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn no Flash - Navegue pelo catálogo completo com GET /v1/voices e passe qualquer voz por qwen-audio-3.0-tts-plus 0__ Limites de entrada - Até 20.000 caracteres por requisição qwen-audio-3.0-tts-plus 1__ aceita até 128 caracteres - Entrada SSML não é suportada. Use qwen-audio-3.0-tts-plus 2__ para a direção de entrega e tags inline como qwen-audio-3.0-tts-plus 3__ ou qwen-audio-3.0-tts-plus 4__ dentro do texto Faturamento - Faturado por caractere do texto de entrada na taxa do nível selecionado

API Qwen Audio 3.0 TTS: perguntas frequentes

Quanto custa a API Qwen Audio 3.0 TTS?

Na EmpirioLabs, Qwen Audio 3.0 TTS é cobrado por uso: Síntese Plus $0.20 por 10.000 caracteres; Síntese em flash $0.15 por 10.000 caracteres. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint Qwen Audio 3.0 TTS usa?

Qwen Audio 3.0 TTS é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar Qwen Audio 3.0 TTS no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa Qwen Audio 3.0 TTS no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API Qwen Audio 3.0 TTS?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.