O Qwen Audio 3.0 TTS está disponível na EmpirioLabs. É o modelo de síntese de voz da Alibaba, e o lançamos como um único modelo com um switch de nível: Além disso, para a maior qualidade de áudio e expressividade, Flash para interação em tempo real com menor latência no primeiro pacote. Ambos os níveis compartilham os mesmos parâmetros e a mesma biblioteca de vozes, então você escolhe uma voz uma vez e muda de nível com um campo.
O que o Qwen Audio 3.0 TTS faz bem
Ele abrange 16 idiomas, incluindo árabe, chinês, inglês, francês, alemão, indonésio, italiano, japonês, coreano, malaio, português, russo, espanhol, tagalo, tailandês e vietnamita, além de 20 regiões de dialetos chineses. A entrega é direcionada de duas formas: em inglês simples Instrução isso define emoção, tom, caráter, ritmo e estilo para todo o render, e tags inline como [animado], [sussurra], [risos], ou [suspiro] Direto no texto para mudar a expressão no meio da frase.
A biblioteca de vozes é o motivo de a troca de nível ser indolora. Existem mais de 1.000 vozes base, e todas elas existem em ambos os níveis sob o mesmo ID, então mover entre Plus e Flash não muda quem está falando. Além disso, cada nível tem um pequeno conjunto de vozes do sistema principal próprias.
Fazendo um pedido
É o endpoint padrão de fala com formato OpenAI, então a maioria dos clientes precisa de uma alteração de URL base:
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-de-Conteúdo: application/json" \ -d '{ "modelo": "qwen-audio-3-0-tts", "model_tier": "flash", "entrada": "[animado]Os resultados chegaram, e eles superaram nossa previsão![ rindo]", "voz": "loongjameszhao", "instrução": "Fale rápido em um tom animado e entusiasmado", "response_format": "mp3", "sample_rate": 24000 }'
Você recebe de volta uma URL de áudio assinada. A saída suporta MP3, WAV, PCM sem cabeçalho e Opus, em taxas de amostragem de 8 kHz até 48 kHz. Velocidade, tom, volume e seed são todos expostos, junto com sobreposições de pronúncia para nomes e siglas, substituições literais de texto para nomes de marcas e um filtro Markdown para que caracteres de formatação não sejam lidos em voz alta.
Para navegar pelo catálogo completo de voz, ligue VÁ /v1/voices. Ele suporta filtragem por idioma, gênero, nível e busca em texto livre entre nomes de voz, traços e casos de uso.
Três coisas que valem a pena saber antes de construir
Vozes básicas são portáteis em níveis, vozes de sistema não. Qualquer ID de voz base funciona tanto no Plus quanto no Flash, então você pode A/B os níveis mantendo a voz constante. As seis vozes do sistema principal são bloqueadas em um nível cada, e se você enviar uma para o tier errado, a API informa qual tier atende a essa camada, em vez de falhar vagamente.
SSML não é suportado por esse modelo. Uso Instrução para direção global de entrega e tags inline para mudanças de expressão local. Essa combinação cobre a maior parte do que as pessoas recorrem ao SSML para fazer, e é mais fácil de escrever.
O pitch também muda o ritmo. Abaixar o tom estica o clipe e subir o clipe comprime, então se você quiser um tom diferente na duração original, ajuste Velocidade para compensar.
Precificação e início
A cobrança é por caractere do texto de entrada, no nível que você selecionou, e é pay-as-you-go. Flash é o mais barato dos dois. As taxas atuais para ambos os níveis estão no Página do modelo Qwen Audio 3.0 TTS e em frente A Página de Preços.
Você pode tentar sem escrever nenhum código no Área de reprodução, onde o switch de níveis, o seletor de voz e todos os parâmetros são controles ativos. A referência completa do parâmetro está no Documentação da API.



