Qwen Audio 3.0 TTS ist für EmpirioLabs verfügbar. Es ist Alibabas Sprachsynthesemodell, und wir liefern es als einziges Modell mit einem Tier-Switch aus: Plus für höchste Audioqualität und Ausdruckskraft Flash für Echtzeitinteraktion mit geringerer Latenz beim ersten Paket. Beide Stufen teilen sich die gleichen Parameter und dieselbe Sprachbibliothek, sodass man einmal eine Stimme auswählt und die Stufen mit einem Feld wechselt.
Wofür Qwen Audio 3.0 TTS gut ist
Es umfasst 16 Sprachen, darunter Arabisch, Chinesisch, Englisch, Französisch, Deutsch, Indonesisch, Italienisch, Japanisch, Koreanisch, Malaiisch, Portugiesisch, Russisch, Spanisch, Tagalog, Thai und Vietnamesisch sowie 20 chinesische Dialektregionen. Die Übertragung erfolgt in zwei Richtungen: in klarem Englisch Unterricht das Emotion, Ton, Charakter, Tempo und Stil für das gesamte Rendering festlegt und Inline-Tags wie [aufgeregt], [flüstert], [lacht], oder [seufzt] direkt in den Text geworfen, um mitten im Satz den Ausdruck zu ändern.
Die Sprachbibliothek ist der Grund, warum der Tierwechsel schmerzlos ist. Es gibt über 1.000 Basisstimmen, und jede einzelne existiert auf beiden Stufen unter derselben ID, daher ändert das Wechseln zwischen Plus und Flash nicht, wer spricht. Darüber hinaus hat jede Stufe eine kleine Auswahl an eigenen Flaggschiff-Systemstimmen.
Eine Anfrage stellen
Es handelt sich um den Standard-OpenAI-ähnlichen Sprachendpunkt, sodass die meisten Clients eine Basis-URL-Änderung benötigen:
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY" \ -H "Inhaltstyp: application/json" \ -d '{ "model": "qwen-audio-3-0-tts", "model_tier": "flash", "input": "[aufgeregt] Die Ergebnisse sind da, und sie schlagen unsere Prognose![ lachen]", "Stimme": "Loongjameszhao", "Anweisung": "Sprich schnell in einem beschwingten, enthusiastischen Ton", "response_format": "mp3", "sample_rate": 24000 }'
Du bekommst eine signierte Audio-URL zurück. Der Ausgang unterstützt MP3, WAV, headerlose PCM und Opus mit Abtastraten von 8 kHz bis 48 kHz. Geschwindigkeit, Tonhöhe, Lautstärke und Seed werden alle angezeigt, ebenso wie Aussprache-Überschreibungen für Namen und Akronyme, wörtliche Textersetzungen für Markennamen und ein Markdown-Filter, sodass Formatierung von Zeichen nicht laut vorgelesen wird.
Um den vollständigen Sprachkatalog zu durchsuchen, rufen Sie an KOMM /v1/voices. Es unterstützt das Filtern nach Sprache, Geschlecht, Stufe und eine Freitextsuche über Sprachnamen, Eigenschaften und Anwendungsfälle.
Drei Dinge, die man wissen sollte, bevor man baut
Basisstimmen sind tier-portabel, Systemstimmen nicht. Jede Basis-Sprach-ID funktioniert sowohl auf Plus als auch auf Flash, sodass du die Tiers mit konstanter Stimme A/B kannst. Die sechs Flaggschiff-System-Stimmen sind jeweils auf eine Stufe gesperrt, und wenn du eine in die falsche Stufe schickst, sagt dir die API, welche Stufe sie bedient, anstatt vage auszufallen.
SSML wird von diesem Modell nicht unterstützt. Verwendung Unterricht für globale Lieferrichtung und Inline-Tags für lokale Ausdrucksänderungen. Diese Kombination deckt das meiste ab, was von SSML empfohlen wird, und es ist einfacher zu schreiben.
Auch die Tonhöhe ändert das Tempo. Das Senken der Tonhöhe dehnt den Clip, und das Anheben komprimiert den Clip, also wenn du eine andere Tonhöhe bei der ursprünglichen Dauer möchtest, passe es an Geschwindigkeit um das auszugleichen.
Preisgestaltung und Einstieg
Die Abrechnung erfolgt pro Zeichen des Eingabetextes, auf der gewählten Stufe, und sie ist pay-as-you-go. Flash ist die günstigere von beiden. Die aktuellen Sätze für beide Stufen sind auf dem Qwen Audio 3.0 TTS Modellseite und weiter Die Preisseite.
Du kannst es ausprobieren, ohne irgendeinen Code in der Spielplatz, wobei der Tier-Switch, der Sprachwähler und jeder Parameter Live-Steuerungen sind. Die vollständige Parameterreferenz befindet sich in der API-Dokumentation.



