StepAudio 3 Gen API

Génère des dialogues, des effets sonores, de l’ambiance et de la musique de fond réunis dans un seul extrait d’une scène écrite.

StepFunProduction audioPublié 9 sept. 2026InternationalEndpoint propriétaireNouveau

À propos de StepAudio 3 Gen

Génère des dialogues, des effets sonores, de l’ambiance et de la musique de fond réunis dans un seul extrait d’une scène écrite.

Le comptage des caractères suit la tarification StepFun: un caractère chinois compte pour un caractère, deux lettres anglaises pour un caractère, et deux signes de ponctuation pour un seul caractère.

Aussi connu sous le nom StepFun StepAudio 3 Gen

audio generationtext to speechsound effectsvoice control

Caractéristiques de StepAudio 3 Gen

ID du modèle
stepaudio-3-gen
Auteur
StepFun
Catégorie
Production audio
Publié
9 sept. 2026
Entrée
Texte
Sortie
Audio
Région
International
Endpoints
POST/v1/audio/generations
Identifiants de modèle alternatifs
stepaudio-3-gen-previewstepfun/stepaudio-3-gen

Tarifs de l'API StepAudio 3 Gen

Tarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.

Type
Spéc.
Tarif
Génération
par 10 000 caractères
$0.36
Comparer sur la page complète des tarifs

Comment appeler l'API StepAudio 3 Gen

StepAudio 3 Gen fonctionne via POST /v1/audio/generations. La requête renvoie immédiatement un job_id ; interrogez GET /v1/jobs/{job_id} jusqu'à la fin du job et lisez les URLs de sortie dans le résultat. Obtenez une clé API depuis le tableau de bord EmpirioLabs.

cURL : envoyer le job
curl https://api.empiriolabs.ai/v1/audio/generations \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-gen",
    "prompt": "Describe what you want StepAudio 3 Gen to generate."
  }'
cURL : interroger le résultat
curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY"
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/generations",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={
        "model": "stepaudio-3-gen",
        "prompt": "Describe what you want StepAudio 3 Gen to generate.",
    },
)
job = response.json()

# Generation runs as an async job. Poll until it completes.
import time
while True:
    status = requests.get(
        f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
        headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    ).json()
    if status.get("status") in ("completed", "failed"):
        print(status)
        break
    time.sleep(5)
Référence complète de l'API StepAudio 3 Gen

Paramètres de l'API StepAudio 3 Gen

Paramètres de requête pris en charge par l'API StepAudio 3 Gen sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.

ParamètreTypePar défautPlage / valeursDescription
promptstring--La scène à générer. Enroulez un effet sonore ou un indice musical entre crochets et une direction de livraison entre parenthèses.
instructionstring-max 500Directives globales pour le décor, la musique de fond et le ton émotionnel. Maximum 500 caractères.
rolesstring--Enceintes optionnelles, comme objets avec un nom et une description vocale. Tous les noms et descriptions ensemble sont limités à 500 caractères.
scriptsstring--Lignes ordonnées optionnelles, comme objets avec un haut-parleur et du texte. Limité à 1 000 caractères au total. Utilisez ceci à la place d’une invite pour les...
response_formatenummp3mp3, wav, flac, opus, pcmFormat audio de sortie.
sample_rateenum240008000, 16000, 22050, 24000, 48000Taux d’échantillonnage de sortie en Hz.
speednumber10.5 à 2Vitesse de parole.
volumenumber10.1 à 2Volume de sortie.
text_normalizationenumstandardstandard, enhancedComment les chiffres, les dates et les symboles sont lus à voix haute.

Bon à savoir

Décrivez une scène et le modèle l’exécute comme un clip terminé: lignes parlées, effets sonores, ambiance et musique de fond ensemble. Envoyez une invite, ou utilisez des rôles et scripts pour le contrôle multi-haut-parleurs. Enroulez un effet sonore ou un indice musical entre crochets et une direction de livraison entre parenthèses. Les rôles et instructions sont limités à 500 caractères chacun et les scripts à 1 000. Les formats de sortie sont mp3, wav, flac, opus et pcm. Les voix de référence et le clonage vocal ne sont pas disponibles sur ce modèle. Ce modèle est en prévisualisation et ses capacités peuvent changer.

API StepAudio 3 Gen : questions fréquentes

Combien coûte l'API StepAudio 3 Gen ?

Sur EmpirioLabs, StepAudio 3 Gen est facturé à l'usage : Génération $0.36 par 10 000 caractères. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.

Quel endpoint StepAudio 3 Gen utilise-t-il ?

StepAudio 3 Gen est servi via POST /v1/audio/generations sur api.empiriolabs.ai avec une authentification standard par token Bearer.

Puis-je essayer StepAudio 3 Gen dans le navigateur avant d'intégrer ?

Oui. Le playground EmpirioLabs exécute StepAudio 3 Gen dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.

Comment obtenir une clé API StepAudio 3 Gen ?

Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.

Prêt à utiliser de meilleurs points de terminaison ?

Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.