StepAudio 3 Gen API

Gera diálogos, efeitos sonoros, ambientação e música de fundo juntos em um único clipe de uma cena escrita.

StepFunGeração de ÁudioLançado 9 de set. de 2026InternationalEndpoint proprietárioNovo

Sobre StepAudio 3 Gen

Gera diálogos, efeitos sonoros, ambientação e música de fundo juntos em um único clipe de uma cena escrita.

A contagem de caracteres segue o preço do StepFun: um caractere chinês conta como um caractere, duas letras inglesas contam como um caractere, e dois sinais de pontuação contam como um caractere.

Também conhecido como StepFun StepAudio 3 Gen

audio generationtext to speechsound effectsvoice control

Especificações de StepAudio 3 Gen

ID do modelo
stepaudio-3-gen
Autor
StepFun
Categoria
Geração de Áudio
Lançado
9 de set. de 2026
Entrada
Texto
Saída
Áudio
Região
International
Endpoints
POST/v1/audio/generations
IDs de modelo alternativos
stepaudio-3-gen-previewstepfun/stepaudio-3-gen

Preços da API StepAudio 3 Gen

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Geração
por 10.000 caracteres
$0.36
Comparar na página completa de preços

Como chamar a API StepAudio 3 Gen

StepAudio 3 Gen roda por POST /v1/audio/generations. A requisição retorna um job_id na hora; consulte GET /v1/jobs/{job_id} até o job terminar e leia as URLs de saída do resultado. Obtenha uma chave de API no painel EmpirioLabs.

cURL: enviar o job
curl https://api.empiriolabs.ai/v1/audio/generations \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-gen",
    "prompt": "Describe what you want StepAudio 3 Gen to generate."
  }'
cURL: consultar o resultado
curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY"
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/generations",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={
        "model": "stepaudio-3-gen",
        "prompt": "Describe what you want StepAudio 3 Gen to generate.",
    },
)
job = response.json()

# Generation runs as an async job. Poll until it completes.
import time
while True:
    status = requests.get(
        f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
        headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    ).json()
    if status.get("status") in ("completed", "failed"):
        print(status)
        break
    time.sleep(5)
Referência completa da API StepAudio 3 Gen

Parâmetros da API StepAudio 3 Gen

Parâmetros de requisição suportados pela API StepAudio 3 Gen na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
promptstring--A cena a gerar. Embrulhe um efeito sonoro ou faixa musical entre colchetes quadrados e uma direção de entrega entre parênteses.
instructionstring-máx. 500Orientação global para o cenário, música de fundo e tom emocional. Máximo 500 caracteres.
rolesstring--Alto-falantes opcionais, como objetos com nome e descrição de voz. Todos os nomes e descrições juntos são limitados a 500 caracteres.
scriptsstring--Linhas ordenadas opcionais, como objetos com alto-falante e texto. Limitado a 1.000 caracteres no total. Use isso em vez de um prompt para cenas com múltiplos...
response_formatenummp3mp3, wav, flac, opus, pcmFormato de áudio de saída.
sample_rateenum240008000, 16000, 22050, 24000, 48000Taxa de amostragem de saída em Hz.
speednumber10.5 a 2Velocidade da fala.
volumenumber10.1 a 2Volume de saída.
text_normalizationenumstandardstandard, enhancedComo números, datas e símbolos são lidos em voz alta.

Bom saber

Descreva uma cena e o modelo a executa como um único clipe finalizado: falas, efeitos sonoros, ambiente e música de fundo juntos. Envie um prompt ou use papéis e scripts para controle de múltiplos alto-falantes. Coloque um efeito sonoro ou sinal musical entre colchetes quadrados e uma direção de entrega entre parênteses. Papéis e instruções são limitados a 500 caracteres cada e scripts a 1.000. Os formatos de saída são mp3, wav, flac, opus e pcm. Vozes de referência e clonagem de vozes não estão disponíveis neste modelo. Este modelo está em prévia e suas capacidades podem mudar.

API StepAudio 3 Gen: perguntas frequentes

Quanto custa a API StepAudio 3 Gen?

Na EmpirioLabs, StepAudio 3 Gen é cobrado por uso: Geração $0.36 por 10.000 caracteres. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint StepAudio 3 Gen usa?

StepAudio 3 Gen é servido por POST /v1/audio/generations em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar StepAudio 3 Gen no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa StepAudio 3 Gen no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API StepAudio 3 Gen?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.