Qwen Audio 3.0 TTS API

Gestufte Sprachsynthese mit über 1.000 Stimmen, 16 Sprachen, 20 chinesischen Dialekten, natürlichsprachlicher Sprechrichtung und Inline-Emotions-Tags.

Alibaba CloudAudiogenerationVeröffentlicht 20. Juli 2026SingaporeProprietärer EndpointNeu

Über Qwen Audio 3.0 TTS

Gestufte Sprachsynthese mit über 1.000 Stimmen, 16 Sprachen, 20 chinesischen Dialekten, natürlichsprachlicher Sprechrichtung und Inline-Emotions-Tags.

Die Sprachauswahl ist tierbewusst: Basis-Sprach-IDs funktionieren auf beiden Stufen und werden automatisch mit dem ausgewählten model_tier zugeordnet, während die sechs Systemstimmen auf eine Stufe beschränkt sind. Auch die Tonhöhe verändert das Tempo des gerenderten Audios, also kombiniert man es mit Geschwindigkeit, wenn man die ursprüngliche Dauer erhalten möchte.

Auch bekannt als Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS

text to speechmultilingualexpressive prosodyemotion controlvoice tagsdialectlow latency

Qwen Audio 3.0 TTS Spezifikationen

Modell-ID
qwen-audio-3-0-tts
Autor
Alibaba Cloud
Kategorie
Audiogeneration
Veröffentlicht
20. Juli 2026
Eingabe
Text
Ausgabe
Audio
Region
Singapore
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
Alternative Modell-IDs
qwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash

Qwen Audio 3.0 TTS API-Preise

Live Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.

Typ
Spezifikation
Preis
Plus-Synthese
pro 10.000 Zeichen
$0.20
Flash-Synthese
pro 10.000 Zeichen
$0.15
Auf der vollständigen Preisseite vergleichen

So rufst du die Qwen Audio 3.0 TTS API auf

Qwen Audio 3.0 TTS erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID qwen-audio-3-0-tts. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3-0-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Vollständige Qwen Audio 3.0 TTS API-Referenz

Qwen Audio 3.0 TTS API-Parameter

Request-Parameter, die die Qwen Audio 3.0 TTS API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.

ParameterTypStandardBereich / WerteBeschreibung
inputstring-max. 20000Text zur Synthese. Bis zu 20.000 Zeichen pro Anfrage. Unterstützt Inline-Expression-Tags, die direkt im Text platziert werden, zum Beispiel [aufgeregt], [lacht],...
model_tierenumplusplus, flashPlus: höchste Audioqualität und Ausdruckskraft, am besten für Inhaltserstellung, Hörbücher, Synchronisation und Markensprache. Flash: Abgestimmt auf...
voiceenumloongjameszhaoloongjameszhao, loongolivialin, loonglunawang, loongnorahu, l...Sprachvoreinstellung. Die Basisstimmen funktionieren auf BEIDEN Stufen, daher behält das Ändern model_tier deine Auswahl bei. Sechs Flaggschiff-Stimmen sind...
voice_idstring--Freiformige Sprach-ID, die die Stimme überschreibt, wenn sie gesetzt ist. Akzeptiert jede Basisstimme von GET /v1/voices, entweder als Bare-ID (empfohlen,...
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000Die Ausgabe-Abtastrate in Hz. 24000 eignet sich für Sprachwiedergabe, und 48000 liefert Broadcast-Qualität bei größerer Dateigröße.
speednumber10.5 bis 2Sprechratemultiplikator. 0,5 ist halbe Geschwindigkeit und 2,0 ist doppelte Geschwindigkeit.
pitchnumber10.5 bis 2Tonhöhenmultiplikator. Werte unter 1,0 senken die Stimme, und Werte darüber erhöhen sie. Pitch verändert auch das Tempo des gerenderten Audios, also kombiniere es...
volumeinteger500 bis 100Ausgangslautstärke, wobei 50 der Referenzpegel ist.
instructionstring-max. 128Natürliche Sprachanweisung für die Darbietung, bis zu 128 Zeichen. Kontrolliert Emotion, Tonfall, Charakter, Tempo und Sprechstil, zum Beispiel 'Sprich schnell in...
language_hintsarray-zh, enDie Sprache codiert, die die Aussprache für gemischtsprachige Texte verzerrt, zum Beispiel ["zh", "en"]. Lassen Sie unset, damit das Modell die Sprache erkennt.
seedinteger00 bis 65535Samen probieren. Verwenden Sie einen Seed mit identischen Eingaben und Einstellungen für ein wiederholbares Rendern wieder.
bit_rateinteger3200016000 bis 64000Encoder-Bitrate in BPS. Gilt nur für das Opus-Format und wird für mp3, wav und pcm ignoriert.
pronunciationobject--Die Aussprache überschreibt zum Beispiel {"重要": "zhong4 yao4"}. Nutze es, um Namen, Akronyme und Homographen zu fixieren.
replaceobject--Wörtliche Textsubstitutionen wurden vor der Synthese angewendet, zum Beispiel {"EmpirioLabs": "Empirio Labs"}. Nützlich für Markennamen und Abkürzungen.
2 weitere Parameter in den Docs

Gut zu wissen

Tiers – Plus: höchste Audioqualität und Ausdruckskraft, für Content-Erstellung, Hörbücher, Synchronisation und Markenspracharbeit – Flash: abgestimmt auf Echtzeitinteraktion mit geringerer Latenz beim ersten Paket, für Sprachassistenten und Live-Agenten – Wechsel mit dem model_tier-Parameter oder sende qwen-audio-3.0-tts-plus oder qwen-audio-3.0-tts-flash als Modell-ID Voices – Über 1.000 Basisstimmen, alle auf beiden Stufen verfügbar, sodass beim Stufenwechsel deine gewählte Stimme erhalten bleibt – Sechs Flaggschiff-Systemstimmen sind stufenspezifisch: longanlingxin und longanlufeng auf Plus sowie longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn auf Flash – Durchstöbere den vollständigen Katalog mit GET /v1/voices und übergebe jede Stimme durch qwen-audio-3.0-tts-plus 0__ Eingabebeschränkungen – Bis zu 20.000 Zeichen pro Anfrage – qwen-audio-3.0-tts-plus 1__ akzeptiert bis zu 128 Zeichen – SSML-Eingabe wird nicht unterstützt. Verwenden Sie qwen-audio-3.0-tts-plus 2__ für die Lieferrichtung und Inline-Tags wie qwen-audio-3.0-tts-plus 3__ oder qwen-audio-3.0-tts-plus 4__ im Text Billing – Berechnet pro Zeichen des Eingabetexts zum Satz der ausgewählten Stufe

Qwen Audio 3.0 TTS API: häufige Fragen

Wie viel kostet die Qwen Audio 3.0 TTS API?

Auf EmpirioLabs wird Qwen Audio 3.0 TTS nach Verbrauch abgerechnet: Plus-Synthese $0.20 pro 10.000 Zeichen; Flash-Synthese $0.15 pro 10.000 Zeichen. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.

Welchen Endpoint verwendet Qwen Audio 3.0 TTS?

Qwen Audio 3.0 TTS wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.

Kann ich Qwen Audio 3.0 TTS im Browser testen, bevor ich integriere?

Ja. Der EmpirioLabs Playground führt Qwen Audio 3.0 TTS im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.

Wie bekomme ich einen Qwen Audio 3.0 TTS API-Schlüssel?

Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.

Bereit, bessere Endpunkte zu nutzen?

Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.