StepAudio 3 Gen API

Genera diálogos, efectos de sonido, ambiente y música de fondo juntos en un solo clip a partir de una escena escrita.

StepFunGeneración de audioLanzado 9 sept 2026InternationalEndpoint propietarioNuevo

Acerca de StepAudio 3 Gen

Genera diálogos, efectos de sonido, ambiente y música de fondo juntos en un solo clip a partir de una escena escrita.

El conteo de caracteres sigue la tarifación de StepFun: un carácter chino cuenta como un carácter, dos letras inglesas cuentan como un carácter y dos signos de puntuación cuentan como un carácter.

También conocido como StepFun StepAudio 3 Gen

audio generationtext to speechsound effectsvoice control

Especificaciones de StepAudio 3 Gen

ID del modelo
stepaudio-3-gen
Autor
StepFun
Categoría
Generación de audio
Lanzado
9 sept 2026
Entrada
Texto
Salida
Audio
Región
International
Endpoints
POST/v1/audio/generations
IDs de modelo alternativos
stepaudio-3-gen-previewstepfun/stepaudio-3-gen

Precios de la API de StepAudio 3 Gen

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Generación
por cada 10.000 caracteres
$0.36
Comparar en la página completa de precios

Cómo llamar a la API de StepAudio 3 Gen

StepAudio 3 Gen funciona a través de POST /v1/audio/generations. La solicitud devuelve un job_id de inmediato; consulta GET /v1/jobs/{job_id} hasta que el trabajo termine y lee las URLs de salida del resultado. Consigue una clave de API en el panel de EmpirioLabs.

cURL: enviar el trabajo
curl https://api.empiriolabs.ai/v1/audio/generations \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-gen",
    "prompt": "Describe what you want StepAudio 3 Gen to generate."
  }'
cURL: consultar el resultado
curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY"
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/generations",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={
        "model": "stepaudio-3-gen",
        "prompt": "Describe what you want StepAudio 3 Gen to generate.",
    },
)
job = response.json()

# Generation runs as an async job. Poll until it completes.
import time
while True:
    status = requests.get(
        f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
        headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    ).json()
    if status.get("status") in ("completed", "failed"):
        print(status)
        break
    time.sleep(5)
Referencia completa de la API de StepAudio 3 Gen

Parámetros de la API de StepAudio 3 Gen

Parámetros de solicitud compatibles con la API de StepAudio 3 Gen en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
promptstring--La escena a generar. Envuelve un efecto de sonido o una señal musical entre corchetes y una dirección de entrega entre paréntesis.
instructionstring-máx. 500Guía global para el escenario, la música de fondo y el tono emocional. Máximo 500 caracteres.
rolesstring--Altavoces opcionales, como objetos con nombre y descripción de voz. Todos los nombres y descripciones juntos tienen un límite de 500 caracteres.
scriptsstring--Líneas ordenadas opcionales, como objetos con altavoz y texto. Limitada a 1.000 caracteres en total. Usa esto en lugar de un prompt para escenas con varios altavoces.
response_formatenummp3mp3, wav, flac, opus, pcmFormato de audio de salida.
sample_rateenum240008000, 16000, 22050, 24000, 48000Tasa de muestreo de salida en Hz.
speednumber10.5 a 2Velocidad del habla.
volumenumber10.1 a 2Volumen de salida.
text_normalizationenumstandardstandard, enhancedCómo se leen en voz alta los números, fechas y símbolos.

Información útil

Describe una escena y el modelo la ejecuta como un solo clip terminado: líneas habladas, efectos de sonido, ambiente y música de fondo juntos. Envía un prompt, o usa roles y scripts para el control de varios altavoces. Envuelve un efecto de sonido o una señal musical entre corchetes y una dirección de entrega entre paréntesis. Los roles e instrucciones están limitados a 500 caracteres cada uno y los scripts a 1.000. Los formatos de salida son mp3, wav, flac, opus y pcm. Las voces de referencia ni la clonación de voces no están disponibles en este modelo. Este modelo está en vista previa y sus capacidades pueden cambiar.

API de StepAudio 3 Gen: preguntas frecuentes

¿Cuánto cuesta la API de StepAudio 3 Gen?

En EmpirioLabs, StepAudio 3 Gen se factura por uso: Generación $0.36 por cada 10.000 caracteres. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Qué endpoint usa StepAudio 3 Gen?

StepAudio 3 Gen se sirve a través de POST /v1/audio/generations en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar StepAudio 3 Gen en el navegador antes de integrar?

Sí. El playground de EmpirioLabs ejecuta StepAudio 3 Gen en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.

¿Cómo consigo una clave de API de StepAudio 3 Gen?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.