Qwen Audio 3.0 TTS API

Synthèse vocale en paliers avec plus de 1 000 voix, 16 langues, 20 dialectes chinois, une direction de transmission en langue naturelle et des balises émotionnelles en ligne.

Alibaba CloudProduction audioPublié 20 juil. 2026SingaporeEndpoint propriétaireNouveau

À propos de Qwen Audio 3.0 TTS

Synthèse vocale en paliers avec plus de 1 000 voix, 16 langues, 20 dialectes chinois, une direction de transmission en langue naturelle et des balises émotionnelles en ligne.

La sélection vocale est consciente des niveaux: les identifiants vocaux de base fonctionnent sur les deux niveaux et sont automatiquement associés à la model_tier sélectionnée, tandis que les six voix système sont verrouillées à un seul niveau. La hauteur de hauteur modifie aussi le rythme de l’audio rendu, donc associez-le à la vitesse si vous voulez préserver la durée initiale.

Aussi connu sous le nom Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS

text to speechmultilingualexpressive prosodyemotion controlvoice tagsdialectlow latency

Caractéristiques de Qwen Audio 3.0 TTS

ID du modèle
qwen-audio-3-0-tts
Auteur
Alibaba Cloud
Catégorie
Production audio
Publié
20 juil. 2026
Entrée
Texte
Sortie
Audio
Région
Singapore
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
Identifiants de modèle alternatifs
qwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash

Tarifs de l'API Qwen Audio 3.0 TTS

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Synthèse plus
par 10 000 caractères
$0.20
Synthèse flash
par 10 000 caractères
$0.15
Comparer sur la page complète des tarifs

Comment appeler l'API Qwen Audio 3.0 TTS

Qwen Audio 3.0 TTS génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle qwen-audio-3-0-tts. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3-0-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Référence complète de l'API Qwen Audio 3.0 TTS

Paramètres de l'API Qwen Audio 3.0 TTS

Paramètres de requête pris en charge par l'API Qwen Audio 3.0 TTS sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
inputstring-max 20000Texte à synthèse. Jusqu’à 20 000 caractères par demande. Prend en charge les balises d’expression en ligne placées directement dans le texte, par exemple [excité],...
model_tierenumplusplus, flashEn plus: la meilleure qualité audio et expressivité, idéal pour la création de contenu, les livres audio, le doublage et le doublage de marque. Flash: Réglé pour une...
voiceenumloongjameszhaoloongjameszhao, loongolivialin, loonglunawang, loongnorahu, l...Préréglage de voix. Les voix de base fonctionnent sur LES DEUX niveaux, donc changer model_tier garde votre choix. Six voix phares sont verrouillées par un niveau:...
voice_idstring--Id de voix libre, qui remplace la voix une fois réglé. Accepte toute voix de base de GET /v1/voices, soit comme ID nue (recommandé, fonctionne sur les deux niveaux),...
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000La fréquence d’échantillonnage de sortie en Hz. 24000 convient à la lecture vocale, et 48000 offre une sortie de qualité diffusion à une taille de fichier plus grande.
speednumber10.5 à 2Multiplicateur de débit de parole. 0,5 est la moitié de la vitesse et le 2,0 est la vitesse double.
pitchnumber10.5 à 2Multiplicateur de hauteur. Les valeurs inférieures à 1,0 font baisser la voix et les valeurs au-dessus l’augmentent. La hauteur de hauteur change aussi le rythme de...
volumeinteger500 à 100Loudness de sortie, où 50 est le niveau de référence.
instructionstring-max 128Mise en scène en langage naturel pour la diffusion, jusqu’à 128 caractères. Contrôle l’émotion, le ton, le caractère, le rythme et le style de parler, par exemple «...
language_hintsarray-zh, enDes codes linguistiques qui biaisent la prononciation pour un texte mixte, par exemple [« zh », « en »]. Laissez non réglé pour laisser le modèle détecter le langage.
seedinteger00 à 65535Échantillonnage de graines. Réutilisez une graine avec les mêmes entrées et paramètres pour un rendu reproductible.
bit_rateinteger3200016000 à 64000Débit binaire de l’encodeur en bps. Cela ne concerne que le format Opus, et est ignoré pour mp3, wav et pcm.
pronunciationobject--La prononciation prend le dessus selon la forme écrite, par exemple {"重要 »: « zhong4 yao4"}. Utilisez-le pour fixer des noms, des acronymes et des homographes.
replaceobject--Des substitutions littérales de texte appliquées avant la synthèse, par exemple {"EmpirioLabs »: « Empirio Labs"}. Utile pour les noms de marques et les abréviations.
2 paramètres de plus dans la doc

Bon à savoir

Paliers - Plus: qualité audio et expressivité maximales, pour la création de contenu, les livres audio, le doublage et le doublage de la marque - Flash: réglé pour une interaction en temps réel avec une latence de premier paquet plus faible, pour les assistants vocaux et les agents en direct - Commuter avec le paramètre model_tier, ou envoyer qwen-audio-3.0-tts-plus ou qwen-audio-3.0-tts-flash comme identifiant modèle Voix - Plus de 1 000 voix de base, tous disponibles sur les deux paliers, donc changer de niveau conserve votre voix sélectionnée - Six voix du système phare sont spécifiques à des niveaux: longanlingxin et longanlufeng sur Plus, et longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn sur Flash - Parcourez le catalogue complet avec GET /v1/voices, et passez toute voix qwen-audio-3.0-tts-plus 0__ Limites d’entrée - Jusqu’à 20 000 caractères par requête qwen-audio-3.0-tts-plus 1__ accepte jusqu’à 128 caractères - L’entrée SSML n’est pas prise en charge. Utilisez qwen-audio-3.0-tts-plus 2__ pour l’orientation de livraison, et des balises en ligne telles que qwen-audio-3.0-tts-plus 3__ ou qwen-audio-3.0-tts-plus 4__ à l’intérieur du texte Billing - Facturées par caractère de texte d’entrée au taux du palier sélectionné

API Qwen Audio 3.0 TTS : questions fréquentes

Combien coûte l'API Qwen Audio 3.0 TTS ?

Sur EmpirioLabs, Qwen Audio 3.0 TTS est facturé à l'usage : Synthèse plus $0.20 par 10 000 caractères; Synthèse flash $0.15 par 10 000 caractères. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quel endpoint Qwen Audio 3.0 TTS utilise-t-il ?

Qwen Audio 3.0 TTS est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer Qwen Audio 3.0 TTS dans le navigateur avant d'intégrer ?

Oui. Le playground EmpirioLabs exécute Qwen Audio 3.0 TTS dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.

Comment obtenir une clé API Qwen Audio 3.0 TTS ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.