
Síntesis de voz por niveles con más de 1.000 voces, 16 idiomas, 20 dialectos chinos, dirección de transmisión en lenguaje natural y etiquetas emocionales en línea.
Síntesis de voz por niveles con más de 1.000 voces, 16 idiomas, 20 dialectos chinos, dirección de transmisión en lenguaje natural y etiquetas emocionales en línea.
La selección de voz depende de los niveles: los ID de voz base funcionan en ambos niveles y se emparejan automáticamente con el model_tier seleccionado, mientras que las seis voces del sistema están bloqueadas en un solo nivel. El tono también cambia el ritmo del audio renderizado, así que combínalo con la velocidad cuando quieras preservar la duración original.
También conocido como Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS
qwen-audio-3-0-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesqwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flashTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
Qwen Audio 3.0 TTS genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo qwen-audio-3-0-tts. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-0-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parámetros de solicitud compatibles con la API de Qwen Audio 3.0 TTS en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input | string | - | máx. 20000 | Texto para sintetizar. Hasta 20.000 caracteres por petición. Soporta etiquetas de expresión en línea colocadas directamente en el texto, por ejemplo [emocionado],... |
| model_tier | enum | plus | plus, flash | Además: la máxima calidad de audio y expresividad, lo mejor para creación de contenido, audiolibros, doblaje y trabajo de voz de marca. Flash: Ajustado para... |
| voice | enum | loongjameszhao | loongjameszhao, loongolivialin, loonglunawang, loongnorahu, l... | Preajuste de voz. Las voces base funcionan en AMBOS niveles, así que cambiar model_tier mantiene tu selección. Seis voces principales están bloqueadas por niveles:... |
| voice_id | string | - | - | Identificación de voz libre, que anula la voz cuando se configura. Acepta cualquier voz base de GET /v1/voices, ya sea como ID básico (recomendado, funciona en ambos... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | La frecuencia de muestreo de salida en Hz. 24000 es adecuada para la reproducción de voz, y 48000 ofrece salida de calidad de difusión con un tamaño de archivo mayor. |
| speed | number | 1 | 0.5 a 2 | Multiplicador de tasa de conversación. 0,5 es la mitad de la velocidad y el 2,0 es la doble velocidad. |
| pitch | number | 1 | 0.5 a 2 | Multiplicador de tono. Los valores por debajo de 1,0 bajan la voz y los valores por encima la elevan. El tono también cambia el ritmo del audio renderizado, así que... |
| volume | integer | 50 | 0 a 100 | Volumen de salida, donde 50 es el nivel de referencia. |
| instruction | string | - | máx. 128 | Dirección en lenguaje natural para la interpretación, hasta 128 caracteres. Controla la emoción, el tono, el carácter, el ritmo y el estilo de habla, por ejemplo... |
| language_hints | array | - | zh, en | Códigos de lenguaje que sesgan la pronunciación para textos mixtos, por ejemplo ["zh", "en"]. Deja sin configurar para que el modelo detecte el lenguaje. |
| seed | integer | 0 | 0 a 65535 | Muestreo de semillas. Reutiliza una semilla con la misma entrada y ajustes para un renderizado repetible. |
| bit_rate | integer | 32000 | 16000 a 64000 | Tasa de bits del codificador en bps. Se aplica solo al formato opus y se ignora para mp3, wav y pcm. |
| pronunciation | object | - | - | La pronunciación prevalece según la forma escrita, por ejemplo {"重要": "zhong4 yao4"}. Úsalo para corregir nombres, acrónimos y homógrafos. |
| replace | object | - | - | Sustituciones literales de texto aplicadas antes de la síntesis, por ejemplo {"EmpirioLabs": "Empirio Labs"}. Útil para nombres de marcas y abreviaturas. |
Tiers - Plus: máxima calidad de audio y expresividad, para creación de contenido, audiolibros, doblaje y trabajo de voz de marca - Flash: ajustado para interacción en tiempo real con menor latencia en el primer paquete, para asistentes de voz y agentes en directo - Cambiar con el parámetro model_tier, o enviar qwen-audio-3.0-tts-plus o qwen-audio-3.0-tts-flash como el id de modelo Voces - Más de 1.000 voces base, todas disponibles en ambos niveles, así que cambiar de nivel mantiene tu voz seleccionada - Seis voces principales del sistema son específicas de nivel: longanlingxin y longanlufeng en Plus, y longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn en Flash - Explora el catálogo completo con GET /v1/voices y pasa cualquier voz por qwen-audio-3.0-tts-plus 0__ Límites de entrada - Hasta 20.000 caracteres por petición qwen-audio-3.0-tts-plus 1__ acepta hasta 128 caracteres - No se soporta entrada SSML. Usa qwen-audio-3.0-tts-plus 2__ para la dirección de entrega y etiquetas en línea como qwen-audio-3.0-tts-plus 3__ o qwen-audio-3.0-tts-plus 4__ dentro del texto Facturación - Facturado por carácter de texto de entrada a la tarifa del nivel seleccionado
En EmpirioLabs, Qwen Audio 3.0 TTS se factura por uso: Síntesis de más $0.20 por cada 10.000 caracteres; Síntesis flash $0.15 por cada 10.000 caracteres. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
Qwen Audio 3.0 TTS se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta Qwen Audio 3.0 TTS en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.