Zuhause Blog

Wie man die StepAudio 3 TTS API verwendet

StepAudio 3 TTS über API-Abdeckung

Sep 15, 2026

EmpirioLabs AI

Kurze Antwort: StepAudio 3 TTS ist StepFuns Flaggschiff-text-to-speech-Modell, verfügbar auf EmpirioLabs über den Standard-OpenAI-ähnlichen Sprachendpunkt. Senden Sie bis zu 1.000 Zeichen an POST /v1/audio/speech mit Modell: "stepaudio-3-tts", wähle eine von zwölf Systemstimmen aus und beschreibe die gewünschte Darbietung in gewöhnlichem Englisch mit Unterricht.

Deine erste Bitte

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY" \ -H "Inhaltstyp: application/json" \ -d '{ "model": "stepaudio-3-tts", "eingabe": "Ihr Anruf wird verbunden. Danke fürs Warten.", "Stimme": "Lively-Girl" }'

Die Antwort enthält eine signierte URL zum generierten Audio. Das Standardformat ist mp3 bei 24.000 Hz.

Die Wahl einer Stimme

Zwölf Systemstimmen werden mit dem Modell ausgeliefert. Sieben werden von StepAudio 2.5 übernommen, und fünf sind neu: Alfie, Ethan, Matthew, Qingshunvsheng, und Tianrunnvsheng.

StimmeCharakterGut für
lebhaftes MädchenHelles, energiegeladenes WeibchenAssistenten, Produkt-Walkthroughs
Lebendige JugendWarmes junges MännchenHörbücher, Video-Synchronisation
soft-spoken-gentlemanRuhiger, sanfter MannLangformige Erzählung
magnetic-voiced-maleTiefer, schwerer MännchenTrailer, dramatische Lektüren
elegantgentle-weiblichAufrichtige, beruhigende FrauUnterstützungsleitungen, Aufklärung
livlybreezy-weiblichLeicht und überzeugendMarketing, Kurzvideo
ZixinnanshengSelbstbewusster MannHörbücher, Ausbildung

Die vollständige Liste findet sich auf der Modellreferenz. Eine benutzerdefinierte geklonte Sprach-ID wird im selben Bereich akzeptiert.

Leitung der Zustellung

Statt voreingestellter Emotions-Tags schreibst du, was du willst, und das Modell führt es aus. Unterricht setzt den Ton für den gesamten Text und akzeptiert bis zu 500 Zeichen.

{ "model": "stepaudio-3-tts", "input": "Wir haben etwas in den Logs gefunden.", "voice": "magnetic-voiced-male", "instruction": "Langsam und bedacht, wie eine Trailer-Stimme. Lass die Pause landen." }

Für ein einzelnes Wort oder eine Phrase setzen Sie die Richtung in Klammern Eingabe stattdessen.

Sprachen

Setz Sprache zu En, ZH, ja, ko, fr, oder es. Japanisch, Koreanisch, Französisch und Spanisch sind in der Vorschau. Lässt man es weg, liest das Modell Englisch.

Ausgabeformate

Wähle mp3, WAV, FLAC, Opus, oder PCM mit response_format, und setze sample_rate auf 8000, 16000, 22050 oder 24000.

Drei Dinge, die Menschen erwischen,

  1. Klammern sind Richtung, keine Worte. Irgendetwas drinnen () in Eingabe wird als Lieferhinweis gelesen und nie ausgesprochen. Wenn du eine in Klammern stehende Seite vorlesen möchtest, schreibe sie ohne Klammern um.
  2. 48.000 Hz sind bei diesem Modell nicht verfügbar. Es erscheint in einigen allgemeinen text-to-speech Dokumentationen, aber StepAudio 3 TTS lehnt es ab. Bleiben Sie auf 24.000 Hz für die höchste Qualität.
  3. Unterricht und voice_label sind nicht austauschbar. StepAudio 3 TTS nimmt Unterricht und Ablehner voice_label. Schritt TTS 2 ist das Gegenteil. Eine Anfrage zwischen ihnen zu portieren bedeutet, dieses Feld zu tauschen.

Preisgestaltung und Limits

Die Abrechnung erfolgt pro Zeichen der Eingabe, Pay as you go, ohne Abonnement und ohne Mindestmaß. Ein chinesisches Zeichen zählt als ein Zeichen, zwei englische Buchstaben als eins. Der Live-Tarif ist auf dem modellblatt und die preisseite. Anfragen sind bei 1.000 Zeichen begrenzt, also teilen Sie längere Skripte in Satzanrufe auf und fügen Sie das Audio selbst ein.

Probier es aus, ohne Code zu schreiben

Offen StepAudio 3 TTS im playground Um Stimmen und Anweisungen vorzuspielen, kopieren Sie dann die Einstellungen in Ihre Anfrage. Vollständige Parameterreferenz: docs.empiriolabs.ai/models/stepaudio-3-tts.

Bereit, bessere Endpunkte zu nutzen?

Entdecken Sie unsere Modelle oder kontaktieren Sie uns bei Geschäftsanfragen, individuellen Deployments oder sonst etwas.