Qwen Audio 3.0 TTS está disponible en EmpirioLabs. Es el modelo de síntesis de voz de Alibaba, y lo lanzamos como un único modelo con un cambio de nivel: Plus para la máxima calidad de audio y expresividad, Flash para interacción en tiempo real con menor latencia en el primer paquete. Ambos niveles comparten los mismos parámetros y la misma biblioteca de voces, así que eliges una voz una vez y cambias de nivel con un solo campo.
En qué es bueno Qwen Audio 3.0 TTS
Cubre 16 idiomas, incluyendo árabe, chino, inglés, francés, alemán, indonesio, italiano, japonés, coreano, malayo, portugués, ruso, español, tagalo, tailandés y vietnamita, además de 20 regiones dialectales chinas. La entrega se dirige en dos direcciones: en un inglés sencillo Instrucción que marca emoción, tono, carácter, ritmo y estilo para todo el render, y etiquetas inline como [emocionado], [susurra], [riendo], o [suspira] Me metió directamente en el texto para cambiar de expresión a mitad de frase.
La biblioteca de voces es la razón por la que el cambio de nivel es sencillo. Hay más de 1.000 voces base, y todas ellas existen en ambos niveles bajo el mismo id, así que moverse entre Plus y Flash no cambia quién habla. Además de esas, cada nivel tiene un pequeño conjunto de voces propias del sistema insignia.
Hacer una petición
Es el punto final estándar de voz con forma de OpenAI, por lo que la mayoría de los clientes necesitan un cambio de URL base:
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Contenido: application/json" \ -d '{ "modelo": "qwen-audio-3-0-tts", "model_tier": "flash", "entrada": "[emocionado] ¡Los resultados están llegados, y han superado nuestra previsión![ risas]", "voz": "loongjameszhao", "instrucciones": "Habla rápido con un tono animado y entusiasta", "response_format": "mp3", "sample_rate": 24000 }'
Recibes una URL de audio firmada. La salida soporta MP3, WAV, PCM sin cabezal y Opus, a frecuencias de muestreo desde 8 kHz hasta 48 kHz. Se exponen velocidad, tono, volumen y semilla, junto con anulaciones de pronunciación para nombres y acrónimos, sustituciones literales de texto para nombres de marca y un filtro Markdown para que los caracteres de formato no se lean en voz alta.
Para consultar el catálogo completo de voz, llame ¡QUE /v1/voices. Permite filtrar por idioma, género, nivel y una búsqueda en texto libre entre nombres de voz, rasgos y casos de uso.
Tres cosas que merece la pena saber antes de construir
Las voces base son portátiles en niveles, las voces del sistema no. Cualquier ID de voz base funciona tanto en Plus como en Flash, así que puedes A/B los niveles manteniendo la voz constante. Las seis voces principales del sistema están bloqueadas a un nivel cada una, y si envías una al nivel equivocado, la API te indica qué nivel lo sirve en lugar de fallar vagamente.
SSML no es compatible con este modelo. Uso Instrucción para la dirección global de entrega y etiquetas en línea para cambios de expresión local. Esa combinación cubre la mayoría de lo que la gente recurre a SSML, y es más fácil de escribir.
El tono también cambia de ritmo. Bajar el tono estira el clip y subirlo comprime el clip, así que si quieres un tono diferente en la duración original, ajusta Velocidad para compensar.
Precios y comienzo
La facturación se realiza por carácter de texto de entrada, en el nivel que hayas seleccionado, y es pay-as-you-go. Flash es el más barato de los dos. Las tarifas actuales para ambos niveles están en el Página del modelo Qwen Audio 3.0 TTS y así sucesivamente La página de precios.
Puedes probarlo sin escribir ningún código en el Playground, donde el interruptor de niveles, el selector de voz y todos los parámetros son controles en vivo. La referencia completa del parámetro está en el Documentación de la API.



