Casa Blog

Como usar a API TTS do StepAudio 3

StepAudio 3 TTS via API cover

Sep 15, 2026

EmpirioLabs AI

Resposta curta: StepAudio 3 TTS é o modelo text-to-speech principal da StepFun, disponível em EmpirioLabs via o endpoint padrão de voz no estilo OpenAI. Envie até 1.000 caracteres para PÓS-/v1/audio/speech com modelo: "stepaudio-3-tts", escolha uma das doze vozes do sistema e descreva a entrega que você deseja em inglês comum com Instrução.

Seu primeiro pedido

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Conteúdo: application/json" \ -d '{ "modelo": "stepaudio-3-tts", "entrada": "Sua ligação está sendo conectada. Obrigado por esperar.", "voz": "garota viva" }'

A resposta carrega uma URL assinada para o áudio gerado. O formato padrão é mp3 a 24.000 Hz.

Escolhendo uma voz

Doze vozes de sistema vêm com o modelo. Sete são mantidas do StepAudio 2.5, e cinco são novas: Alfie, Ethan, Matthew, Qingshunvsheng, e Tianrunnvsheng.

VozCaráterBom para
garota animadaMulher brilhante e energéticaAssistentes, guias de produto
juventude vibranteJovem macho quenteAudiolivros, dublagem de vídeo
soft-spoken-gentlemanHomem calmo e gentilNarração em formato longo
magnetic-voiced-maleMacho profundo e pesadoTrailers, leituras dramáticas
feminina elegante-gentilMulher sincera e tranquilizadoraLinhas de apoio, educação
Viva e Viva-FemininaLeve e persuasivoMarketing, vídeo curto
zixinnanshengHomem confianteAudiolivros, treinamento

A lista completa está no Referência do modelo. Um ID de voz clonado personalizado é aceito no mesmo campo.

Dirigindo a entrega

Em vez de tags de emoção pré-definidas, você escreve o que quer e o modelo executa. Instrução define o tom de toda a passagem e aceita até 500 caracteres.

{ "modelo": "stepaudio-3-tts", "entrada": "Encontramos algo nos registros.", "voz": "magnetic-voiced-male", "instrução": "Devagar e deliberado, como a voz de um trailer. Deixe a pausa cair." }

Para uma única palavra ou frase, coloque a direção entre parênteses dentro Entrada em vez disso.

Idiomas

Definir Idioma para en, zh, Ja, Ko, fr, ou es. Japonês, Coreano, Francês e Espanhol estão em prévia. Deixe de fora e o modelo lê em inglês.

Formatos de saída

Escolha mp3, WAV, FLAC, Opus, ou PCM com response_format, e conjunto sample_rate até 8000, 16000, 22050 ou 24000.

Três coisas que pegam as pessoas de surpresa

  1. Parênteses são direção, não palavras. Qualquer coisa dentro () em Entrada é lida como um sinal de entrega e nunca é falada. Se precisar de um comentário de lado com parênteses, leia em voz alta, reescreva sem parênteses.
  2. 48.000 Hz não está disponível neste modelo. Aparece em alguma documentação geral text-to-speech, mas o StepAudio 3 TTS rejeita. Fique em 24.000 Hz para a maior qualidade.
  3. Instrução e voice_label não são intercambiáveis. StepAudio 3 TTS takes Instrução e rejeita voice_label. O Step TTS 2 é o oposto. Portar uma requisição entre eles significa trocar esse campo.

Preços e limites

A cobrança é por caractere de entrada, pague conforme você vai, sem assinatura e sem mínimo. Um caractere chinês conta como um caractere, e duas letras inglesas contam como um. A tarifa ao vivo está no página do modelo e o página de preços. Pedidos têm limite de 1.000 caracteres, então divida roteiros mais longos em chamadas do tamanho de uma frase e junte o áudio você mesmo.

Tente sem escrever código

Abrir StepAudio 3 TTS no playground para testar vozes e instruções, então copiar as configurações para o seu pedido. Referência completa do parâmetro: docs.empiriolabs.ai/models/stepaudio-3-tts.

Pronto para usar endpoints melhores?

Explore nossos modelos ou entre em contato conosco para consultas de negócios, implantações personalizadas ou qualquer outra coisa.