Casa Blog

Como Usar a API do Qwen Audio 3.0 TTS

Qwen Audio 3.0 TTS via API no EmpirioLabs

Jul 23, 2026

EmpirioLabs AI

O Qwen Audio 3.0 TTS está disponível na EmpirioLabs. É o modelo de síntese de voz da Alibaba, e o lançamos como um único modelo com um switch de nível: Além disso, para a maior qualidade de áudio e expressividade, Flash para interação em tempo real com menor latência no primeiro pacote. Ambos os níveis compartilham os mesmos parâmetros e a mesma biblioteca de vozes, então você escolhe uma voz uma vez e muda de nível com um campo.

O que o Qwen Audio 3.0 TTS faz bem

Ele abrange 16 idiomas, incluindo árabe, chinês, inglês, francês, alemão, indonésio, italiano, japonês, coreano, malaio, português, russo, espanhol, tagalo, tailandês e vietnamita, além de 20 regiões de dialetos chineses. A entrega é direcionada de duas formas: em inglês simples Instrução isso define emoção, tom, caráter, ritmo e estilo para todo o render, e tags inline como [animado], [sussurra], [risos], ou [suspiro] Direto no texto para mudar a expressão no meio da frase.

A biblioteca de vozes é o motivo de a troca de nível ser indolora. Existem mais de 1.000 vozes base, e todas elas existem em ambos os níveis sob o mesmo ID, então mover entre Plus e Flash não muda quem está falando. Além disso, cada nível tem um pequeno conjunto de vozes do sistema principal próprias.

Fazendo um pedido

É o endpoint padrão de fala com formato OpenAI, então a maioria dos clientes precisa de uma alteração de URL base:

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-de-Conteúdo: application/json" \ -d '{ "modelo": "qwen-audio-3-0-tts", "model_tier": "flash", "entrada": "[animado]Os resultados chegaram, e eles superaram nossa previsão![ rindo]", "voz": "loongjameszhao", "instrução": "Fale rápido em um tom animado e entusiasmado", "response_format": "mp3", "sample_rate": 24000 }'

Você recebe de volta uma URL de áudio assinada. A saída suporta MP3, WAV, PCM sem cabeçalho e Opus, em taxas de amostragem de 8 kHz até 48 kHz. Velocidade, tom, volume e seed são todos expostos, junto com sobreposições de pronúncia para nomes e siglas, substituições literais de texto para nomes de marcas e um filtro Markdown para que caracteres de formatação não sejam lidos em voz alta.

Para navegar pelo catálogo completo de voz, ligue VÁ /v1/voices. Ele suporta filtragem por idioma, gênero, nível e busca em texto livre entre nomes de voz, traços e casos de uso.

Três coisas que valem a pena saber antes de construir

Vozes básicas são portáteis em níveis, vozes de sistema não. Qualquer ID de voz base funciona tanto no Plus quanto no Flash, então você pode A/B os níveis mantendo a voz constante. As seis vozes do sistema principal são bloqueadas em um nível cada, e se você enviar uma para o tier errado, a API informa qual tier atende a essa camada, em vez de falhar vagamente.

SSML não é suportado por esse modelo. Uso Instrução para direção global de entrega e tags inline para mudanças de expressão local. Essa combinação cobre a maior parte do que as pessoas recorrem ao SSML para fazer, e é mais fácil de escrever.

O pitch também muda o ritmo. Abaixar o tom estica o clipe e subir o clipe comprime, então se você quiser um tom diferente na duração original, ajuste Velocidade para compensar.

Precificação e início

A cobrança é por caractere do texto de entrada, no nível que você selecionou, e é pay-as-you-go. Flash é o mais barato dos dois. As taxas atuais para ambos os níveis estão no Página do modelo Qwen Audio 3.0 TTS e em frente A Página de Preços.

Você pode tentar sem escrever nenhum código no Área de reprodução, onde o switch de níveis, o seletor de voz e todos os parâmetros são controles ativos. A referência completa do parâmetro está no Documentação da API.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.