
Synthèse vocale en paliers avec plus de 1 000 voix, 16 langues, 20 dialectes chinois, une direction de transmission en langue naturelle et des balises émotionnelles en ligne.
Synthèse vocale en paliers avec plus de 1 000 voix, 16 langues, 20 dialectes chinois, une direction de transmission en langue naturelle et des balises émotionnelles en ligne.
La sélection vocale est consciente des niveaux: les identifiants vocaux de base fonctionnent sur les deux niveaux et sont automatiquement associés à la model_tier sélectionnée, tandis que les six voix système sont verrouillées à un seul niveau. La hauteur de hauteur modifie aussi le rythme de l’audio rendu, donc associez-le à la vitesse si vous voulez préserver la durée initiale.
Aussi connu sous le nom Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS
qwen-audio-3-0-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesqwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flashTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
Qwen Audio 3.0 TTS génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle qwen-audio-3-0-tts. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-0-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Paramètres de requête pris en charge par l'API Qwen Audio 3.0 TTS sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| input | string | - | max 20000 | Texte à synthèse. Jusqu’à 20 000 caractères par demande. Prend en charge les balises d’expression en ligne placées directement dans le texte, par exemple [excité],... |
| model_tier | enum | plus | plus, flash | En plus: la meilleure qualité audio et expressivité, idéal pour la création de contenu, les livres audio, le doublage et le doublage de marque. Flash: Réglé pour une... |
| voice | enum | loongjameszhao | loongjameszhao, loongolivialin, loonglunawang, loongnorahu, l... | Préréglage de voix. Les voix de base fonctionnent sur LES DEUX niveaux, donc changer model_tier garde votre choix. Six voix phares sont verrouillées par un niveau:... |
| voice_id | string | - | - | Id de voix libre, qui remplace la voix une fois réglé. Accepte toute voix de base de GET /v1/voices, soit comme ID nue (recommandé, fonctionne sur les deux niveaux),... |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | La fréquence d’échantillonnage de sortie en Hz. 24000 convient à la lecture vocale, et 48000 offre une sortie de qualité diffusion à une taille de fichier plus grande. |
| speed | number | 1 | 0.5 à 2 | Multiplicateur de débit de parole. 0,5 est la moitié de la vitesse et le 2,0 est la vitesse double. |
| pitch | number | 1 | 0.5 à 2 | Multiplicateur de hauteur. Les valeurs inférieures à 1,0 font baisser la voix et les valeurs au-dessus l’augmentent. La hauteur de hauteur change aussi le rythme de... |
| volume | integer | 50 | 0 à 100 | Loudness de sortie, où 50 est le niveau de référence. |
| instruction | string | - | max 128 | Mise en scène en langage naturel pour la diffusion, jusqu’à 128 caractères. Contrôle l’émotion, le ton, le caractère, le rythme et le style de parler, par exemple «... |
| language_hints | array | - | zh, en | Des codes linguistiques qui biaisent la prononciation pour un texte mixte, par exemple [« zh », « en »]. Laissez non réglé pour laisser le modèle détecter le langage. |
| seed | integer | 0 | 0 à 65535 | Échantillonnage de graines. Réutilisez une graine avec les mêmes entrées et paramètres pour un rendu reproductible. |
| bit_rate | integer | 32000 | 16000 à 64000 | Débit binaire de l’encodeur en bps. Cela ne concerne que le format Opus, et est ignoré pour mp3, wav et pcm. |
| pronunciation | object | - | - | La prononciation prend le dessus selon la forme écrite, par exemple {"重要 »: « zhong4 yao4"}. Utilisez-le pour fixer des noms, des acronymes et des homographes. |
| replace | object | - | - | Des substitutions littérales de texte appliquées avant la synthèse, par exemple {"EmpirioLabs »: « Empirio Labs"}. Utile pour les noms de marques et les abréviations. |
Paliers - Plus: qualité audio et expressivité maximales, pour la création de contenu, les livres audio, le doublage et le doublage de la marque - Flash: réglé pour une interaction en temps réel avec une latence de premier paquet plus faible, pour les assistants vocaux et les agents en direct - Commuter avec le paramètre model_tier, ou envoyer qwen-audio-3.0-tts-plus ou qwen-audio-3.0-tts-flash comme identifiant modèle Voix - Plus de 1 000 voix de base, tous disponibles sur les deux paliers, donc changer de niveau conserve votre voix sélectionnée - Six voix du système phare sont spécifiques à des niveaux: longanlingxin et longanlufeng sur Plus, et longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn sur Flash - Parcourez le catalogue complet avec GET /v1/voices, et passez toute voix qwen-audio-3.0-tts-plus 0__ Limites d’entrée - Jusqu’à 20 000 caractères par requête qwen-audio-3.0-tts-plus 1__ accepte jusqu’à 128 caractères - L’entrée SSML n’est pas prise en charge. Utilisez qwen-audio-3.0-tts-plus 2__ pour l’orientation de livraison, et des balises en ligne telles que qwen-audio-3.0-tts-plus 3__ ou qwen-audio-3.0-tts-plus 4__ à l’intérieur du texte Billing - Facturées par caractère de texte d’entrée au taux du palier sélectionné
Sur EmpirioLabs, Qwen Audio 3.0 TTS est facturé à l'usage : Synthèse plus $0.20 par 10 000 caractères; Synthèse flash $0.15 par 10 000 caractères. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
Qwen Audio 3.0 TTS est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Oui. Le playground EmpirioLabs exécute Qwen Audio 3.0 TTS dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.