Qwen Audio 3.0 TTS API

Síntesis de voz por niveles con más de 1.000 voces, 16 idiomas, 20 dialectos chinos, dirección de transmisión en lenguaje natural y etiquetas emocionales en línea.

Alibaba CloudGeneración de audioLanzado 20 jul 2026SingaporeEndpoint propietarioNuevo

Acerca de Qwen Audio 3.0 TTS

Síntesis de voz por niveles con más de 1.000 voces, 16 idiomas, 20 dialectos chinos, dirección de transmisión en lenguaje natural y etiquetas emocionales en línea.

La selección de voz depende de los niveles: los ID de voz base funcionan en ambos niveles y se emparejan automáticamente con el model_tier seleccionado, mientras que las seis voces del sistema están bloqueadas en un solo nivel. El tono también cambia el ritmo del audio renderizado, así que combínalo con la velocidad cuando quieras preservar la duración original.

También conocido como Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS

text to speechmultilingualexpressive prosodyemotion controlvoice tagsdialectlow latency

Especificaciones de Qwen Audio 3.0 TTS

ID del modelo
qwen-audio-3-0-tts
Autor
Alibaba Cloud
Categoría
Generación de audio
Lanzado
20 jul 2026
Entrada
Texto
Salida
Audio
Región
Singapore
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
IDs de modelo alternativos
qwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash

Precios de la API de Qwen Audio 3.0 TTS

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Síntesis de más
por cada 10.000 caracteres
$0.20
Síntesis flash
por cada 10.000 caracteres
$0.15
Comparar en la página completa de precios

Cómo llamar a la API de Qwen Audio 3.0 TTS

Qwen Audio 3.0 TTS genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo qwen-audio-3-0-tts. Consigue una clave de API en el panel de EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3-0-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referencia completa de la API de Qwen Audio 3.0 TTS

Parámetros de la API de Qwen Audio 3.0 TTS

Parámetros de solicitud compatibles con la API de Qwen Audio 3.0 TTS en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
inputstring-máx. 20000Texto para sintetizar. Hasta 20.000 caracteres por petición. Soporta etiquetas de expresión en línea colocadas directamente en el texto, por ejemplo [emocionado],...
model_tierenumplusplus, flashAdemás: la máxima calidad de audio y expresividad, lo mejor para creación de contenido, audiolibros, doblaje y trabajo de voz de marca. Flash: Ajustado para...
voiceenumloongjameszhaoloongjameszhao, loongolivialin, loonglunawang, loongnorahu, l...Preajuste de voz. Las voces base funcionan en AMBOS niveles, así que cambiar model_tier mantiene tu selección. Seis voces principales están bloqueadas por niveles:...
voice_idstring--Identificación de voz libre, que anula la voz cuando se configura. Acepta cualquier voz base de GET /v1/voices, ya sea como ID básico (recomendado, funciona en ambos...
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000La frecuencia de muestreo de salida en Hz. 24000 es adecuada para la reproducción de voz, y 48000 ofrece salida de calidad de difusión con un tamaño de archivo mayor.
speednumber10.5 a 2Multiplicador de tasa de conversación. 0,5 es la mitad de la velocidad y el 2,0 es la doble velocidad.
pitchnumber10.5 a 2Multiplicador de tono. Los valores por debajo de 1,0 bajan la voz y los valores por encima la elevan. El tono también cambia el ritmo del audio renderizado, así que...
volumeinteger500 a 100Volumen de salida, donde 50 es el nivel de referencia.
instructionstring-máx. 128Dirección en lenguaje natural para la interpretación, hasta 128 caracteres. Controla la emoción, el tono, el carácter, el ritmo y el estilo de habla, por ejemplo...
language_hintsarray-zh, enCódigos de lenguaje que sesgan la pronunciación para textos mixtos, por ejemplo ["zh", "en"]. Deja sin configurar para que el modelo detecte el lenguaje.
seedinteger00 a 65535Muestreo de semillas. Reutiliza una semilla con la misma entrada y ajustes para un renderizado repetible.
bit_rateinteger3200016000 a 64000Tasa de bits del codificador en bps. Se aplica solo al formato opus y se ignora para mp3, wav y pcm.
pronunciationobject--La pronunciación prevalece según la forma escrita, por ejemplo {"重要": "zhong4 yao4"}. Úsalo para corregir nombres, acrónimos y homógrafos.
replaceobject--Sustituciones literales de texto aplicadas antes de la síntesis, por ejemplo {"EmpirioLabs": "Empirio Labs"}. Útil para nombres de marcas y abreviaturas.
2 parámetros más en la documentación

Información útil

Tiers - Plus: máxima calidad de audio y expresividad, para creación de contenido, audiolibros, doblaje y trabajo de voz de marca - Flash: ajustado para interacción en tiempo real con menor latencia en el primer paquete, para asistentes de voz y agentes en directo - Cambiar con el parámetro model_tier, o enviar qwen-audio-3.0-tts-plus o qwen-audio-3.0-tts-flash como el id de modelo Voces - Más de 1.000 voces base, todas disponibles en ambos niveles, así que cambiar de nivel mantiene tu voz seleccionada - Seis voces principales del sistema son específicas de nivel: longanlingxin y longanlufeng en Plus, y longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn en Flash - Explora el catálogo completo con GET /v1/voices y pasa cualquier voz por qwen-audio-3.0-tts-plus 0__ Límites de entrada - Hasta 20.000 caracteres por petición qwen-audio-3.0-tts-plus 1__ acepta hasta 128 caracteres - No se soporta entrada SSML. Usa qwen-audio-3.0-tts-plus 2__ para la dirección de entrega y etiquetas en línea como qwen-audio-3.0-tts-plus 3__ o qwen-audio-3.0-tts-plus 4__ dentro del texto Facturación - Facturado por carácter de texto de entrada a la tarifa del nivel seleccionado

API de Qwen Audio 3.0 TTS: preguntas frecuentes

¿Cuánto cuesta la API de Qwen Audio 3.0 TTS?

En EmpirioLabs, Qwen Audio 3.0 TTS se factura por uso: Síntesis de más $0.20 por cada 10.000 caracteres; Síntesis flash $0.15 por cada 10.000 caracteres. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Qué endpoint usa Qwen Audio 3.0 TTS?

Qwen Audio 3.0 TTS se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar Qwen Audio 3.0 TTS en el navegador antes de integrar?

Sí. El playground de EmpirioLabs ejecuta Qwen Audio 3.0 TTS en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.

¿Cómo consigo una clave de API de Qwen Audio 3.0 TTS?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.