
Genera diálogos, efectos de sonido, ambiente y música de fondo juntos en un solo clip a partir de una escena escrita.
Genera diálogos, efectos de sonido, ambiente y música de fondo juntos en un solo clip a partir de una escena escrita.
El conteo de caracteres sigue la tarifación de StepFun: un carácter chino cuenta como un carácter, dos letras inglesas cuentan como un carácter y dos signos de puntuación cuentan como un carácter.
También conocido como StepFun StepAudio 3 Gen
stepaudio-3-gen/v1/audio/generationsstepaudio-3-gen-previewstepfun/stepaudio-3-genTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
StepAudio 3 Gen funciona a través de POST /v1/audio/generations. La solicitud devuelve un job_id de inmediato; consulta GET /v1/jobs/{job_id} hasta que el trabajo termine y lee las URLs de salida del resultado. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/generations \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-gen",
"prompt": "Describe what you want StepAudio 3 Gen to generate."
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/generations",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-3-gen",
"prompt": "Describe what you want StepAudio 3 Gen to generate.",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)Parámetros de solicitud compatibles con la API de StepAudio 3 Gen en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| prompt | string | - | - | La escena a generar. Envuelve un efecto de sonido o una señal musical entre corchetes y una dirección de entrega entre paréntesis. |
| instruction | string | - | máx. 500 | Guía global para el escenario, la música de fondo y el tono emocional. Máximo 500 caracteres. |
| roles | string | - | - | Altavoces opcionales, como objetos con nombre y descripción de voz. Todos los nombres y descripciones juntos tienen un límite de 500 caracteres. |
| scripts | string | - | - | Líneas ordenadas opcionales, como objetos con altavoz y texto. Limitada a 1.000 caracteres en total. Usa esto en lugar de un prompt para escenas con varios altavoces. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | Formato de audio de salida. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 48000 | Tasa de muestreo de salida en Hz. |
| speed | number | 1 | 0.5 a 2 | Velocidad del habla. |
| volume | number | 1 | 0.1 a 2 | Volumen de salida. |
| text_normalization | enum | standard | standard, enhanced | Cómo se leen en voz alta los números, fechas y símbolos. |
Describe una escena y el modelo la ejecuta como un solo clip terminado: líneas habladas, efectos de sonido, ambiente y música de fondo juntos. Envía un prompt, o usa roles y scripts para el control de varios altavoces. Envuelve un efecto de sonido o una señal musical entre corchetes y una dirección de entrega entre paréntesis. Los roles e instrucciones están limitados a 500 caracteres cada uno y los scripts a 1.000. Los formatos de salida son mp3, wav, flac, opus y pcm. Las voces de referencia ni la clonación de voces no están disponibles en este modelo. Este modelo está en vista previa y sus capacidades pueden cambiar.
En EmpirioLabs, StepAudio 3 Gen se factura por uso: Generación $0.36 por cada 10.000 caracteres. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
StepAudio 3 Gen se sirve a través de POST /v1/audio/generations en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta StepAudio 3 Gen en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.