Kurze Antwort: StepAudio 3 TTS ist StepFuns Flaggschiff-text-to-speech-Modell, verfügbar auf EmpirioLabs über den Standard-OpenAI-ähnlichen Sprachendpunkt. Senden Sie bis zu 1.000 Zeichen an POST /v1/audio/speech mit Modell: "stepaudio-3-tts", wähle eine von zwölf Systemstimmen aus und beschreibe die gewünschte Darbietung in gewöhnlichem Englisch mit Unterricht.
Deine erste Bitte
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorisierung: Träger $EMPIRIOLABS_API_KEY" \ -H "Inhaltstyp: application/json" \ -d '{ "model": "stepaudio-3-tts", "eingabe": "Ihr Anruf wird verbunden. Danke fürs Warten.", "Stimme": "Lively-Girl" }'
Die Antwort enthält eine signierte URL zum generierten Audio. Das Standardformat ist mp3 bei 24.000 Hz.
Die Wahl einer Stimme
Zwölf Systemstimmen werden mit dem Modell ausgeliefert. Sieben werden von StepAudio 2.5 übernommen, und fünf sind neu: Alfie, Ethan, Matthew, Qingshunvsheng, und Tianrunnvsheng.
| Stimme | Charakter | Gut für |
|---|---|---|
lebhaftes Mädchen | Helles, energiegeladenes Weibchen | Assistenten, Produkt-Walkthroughs |
Lebendige Jugend | Warmes junges Männchen | Hörbücher, Video-Synchronisation |
soft-spoken-gentleman | Ruhiger, sanfter Mann | Langformige Erzählung |
magnetic-voiced-male | Tiefer, schwerer Männchen | Trailer, dramatische Lektüren |
elegantgentle-weiblich | Aufrichtige, beruhigende Frau | Unterstützungsleitungen, Aufklärung |
livlybreezy-weiblich | Leicht und überzeugend | Marketing, Kurzvideo |
Zixinnansheng | Selbstbewusster Mann | Hörbücher, Ausbildung |
Die vollständige Liste findet sich auf der Modellreferenz. Eine benutzerdefinierte geklonte Sprach-ID wird im selben Bereich akzeptiert.
Leitung der Zustellung
Statt voreingestellter Emotions-Tags schreibst du, was du willst, und das Modell führt es aus. Unterricht setzt den Ton für den gesamten Text und akzeptiert bis zu 500 Zeichen.
{ "model": "stepaudio-3-tts", "input": "Wir haben etwas in den Logs gefunden.", "voice": "magnetic-voiced-male", "instruction": "Langsam und bedacht, wie eine Trailer-Stimme. Lass die Pause landen." }
Für ein einzelnes Wort oder eine Phrase setzen Sie die Richtung in Klammern Eingabe stattdessen.
Sprachen
Setz Sprache zu En, ZH, ja, ko, fr, oder es. Japanisch, Koreanisch, Französisch und Spanisch sind in der Vorschau. Lässt man es weg, liest das Modell Englisch.
Ausgabeformate
Wähle mp3, WAV, FLAC, Opus, oder PCM mit response_format, und setze sample_rate auf 8000, 16000, 22050 oder 24000.
Drei Dinge, die Menschen erwischen,
- Klammern sind Richtung, keine Worte. Irgendetwas drinnen
()inEingabewird als Lieferhinweis gelesen und nie ausgesprochen. Wenn du eine in Klammern stehende Seite vorlesen möchtest, schreibe sie ohne Klammern um. - 48.000 Hz sind bei diesem Modell nicht verfügbar. Es erscheint in einigen allgemeinen text-to-speech Dokumentationen, aber StepAudio 3 TTS lehnt es ab. Bleiben Sie auf 24.000 Hz für die höchste Qualität.
Unterrichtundvoice_labelsind nicht austauschbar. StepAudio 3 TTS nimmtUnterrichtund Ablehnervoice_label. Schritt TTS 2 ist das Gegenteil. Eine Anfrage zwischen ihnen zu portieren bedeutet, dieses Feld zu tauschen.
Preisgestaltung und Limits
Die Abrechnung erfolgt pro Zeichen der Eingabe, Pay as you go, ohne Abonnement und ohne Mindestmaß. Ein chinesisches Zeichen zählt als ein Zeichen, zwei englische Buchstaben als eins. Der Live-Tarif ist auf dem modellblatt und die preisseite. Anfragen sind bei 1.000 Zeichen begrenzt, also teilen Sie längere Skripte in Satzanrufe auf und fügen Sie das Audio selbst ein.
Probier es aus, ohne Code zu schreiben
Offen StepAudio 3 TTS im playground Um Stimmen und Anweisungen vorzuspielen, kopieren Sie dann die Einstellungen in Ihre Anfrage. Vollständige Parameterreferenz: docs.empiriolabs.ai/models/stepaudio-3-tts.



