Qwen Audio 3.0 TTS est disponible sur EmpirioLabs. C’est le modèle de synthèse vocale d’Alibaba, et nous le proposons en un seul modèle avec un changement de niveau: Plus, pour la meilleure qualité audio et expressivité, Flash pour une interaction en temps réel avec une latence de premier paquet plus faible. Les deux niveaux partagent les mêmes paramètres et la même bibliothèque vocale, donc vous choisissez une voix une fois et changez de niveau avec un seul champ.
Ce que Qwen Audio 3.0 TTS fait bien
Elle couvre 16 langues, dont l’arabe, le chinois, l’anglais, le français, l’allemand, l’indonésien, l’italien, le japonais, le coréen, le malais, le portugais, le russe, l’espagnol, le tagalog, le thaï et le vietnamien, ainsi que 20 régions dialectales chinoises. La présentation se fait dans deux sens: en anglais simple Enseignement qui définit l’émotion, le ton, le caractère, le rythme et le style pour l’ensemble du rendu, ainsi que des balises en ligne telles que [excité], [chuchote], [rire], ou [soupir] Il se lança directement dans le texte pour changer d’expression en plein milieu d’une phrase.
La bibliothèque vocale est la raison pour laquelle le changement de niveau est sans problème. Il y a plus de 1 000 voix de base, et chacune d’elles existe sur les deux niveaux sous le même id, donc passer de Plus à Flash ne change pas qui parle. En plus de cela, chaque niveau possède un petit ensemble de voix de système phare.
Faire une demande
C’est le point d’accès vocal standard en forme d’OpenAI, donc la plupart des clients ont besoin d’un seul changement d’URL de base:
curl https://api.empiriolabs.ai/v1/audio/speech \ -H « Autorisation: Porteur $EMPIRIOLABS_API_KEY » \ -H « Type-Contenu: application/json » \ -d '{ « modèle »: « qwen-audio-3-0-tts », « model_tier »: « flash », « entrée »: « [excité]Les résultats sont arrivés, et ils ont battu nos prévisions ![ rires] », « voix »: « loongjameszhao », « instruction »: « Parle vite sur un ton entraînant et enthousiaste », « response_format »: « mp3 », « sample_rate »: 24000 }'
Vous recevez en retour une URL audio signée. La sortie supporte MP3, WAV, PCM sans en-tête et Opus, à des fréquences d’échantillonnage allant de 8 kHz jusqu’à 48 kHz. La vitesse, la hauteur, le volume et la graine sont tous exposés, ainsi que des sursélections de prononciation pour les noms et acronymes, des remplacements littéraux de texte pour les noms de marques, et un filtre Markdown pour que les caractères de mise en forme ne soient pas lus à voix haute.
Pour parcourir l’ensemble du catalogue vocal, appelez ALLEZ-/v1/voices. Il permet de filtrer par langue, genre, niveau, ainsi qu’une recherche en texte libre à travers les noms vocaux, les traits et les cas d’usage.
Trois choses qui valent la peine de savoir avant de construire
Les voix de base sont portables en niveaux, les voix système non. N’importe quel identifiant vocal de base fonctionne à la fois sur Plus et Flash, donc vous pouvez A/B les paliers avec la voix maintenue constante. Les six voix du système phare sont bloquées à un seul niveau chacune, et si vous en envoyez une au mauvais niveau, l’API vous indique quel niveau le sert plutôt que d’échouer vaguement.
Le SSML n’est pas pris en charge par ce modèle. Utilisation Enseignement pour la direction de diffusion globale et les balises en ligne pour les changements d’expression locale. Cette combinaison couvre la plupart des tâches que les gens demandent au SSML, et c’est plus facile à rédiger.
Le terrain change aussi de rythme. Baisser la hauteur étire le clip et le relever comprime le clip, donc si vous voulez une hauteur différente à la durée d’origine, ajustez Vitesse pour compenser.
Tarification et début
La facturation se fait par caractère de texte d’entrée, au niveau que vous avez sélectionné, et c’est pay-as-you-go. Flash est le moins cher des deux. Les taux actuels pour les deux niveaux sont sur le Page modèle Qwen Audio 3.0 TTS et ainsi de suite La page des prix.
Vous pouvez essayer sans écrire de code dans le Terrain de jeu, où le commutateur de niveaux, le sélecteur de voix, et chaque paramètre sont des contrôles en direct. La référence complète des paramètres se trouve dans le Documentation API.



