Resposta curta: StepAudio 3 TTS é o modelo text-to-speech principal da StepFun, disponível em EmpirioLabs via o endpoint padrão de voz no estilo OpenAI. Envie até 1.000 caracteres para PÓS-/v1/audio/speech com modelo: "stepaudio-3-tts", escolha uma das doze vozes do sistema e descreva a entrega que você deseja em inglês comum com Instrução.
Seu primeiro pedido
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorização: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Conteúdo: application/json" \ -d '{ "modelo": "stepaudio-3-tts", "entrada": "Sua ligação está sendo conectada. Obrigado por esperar.", "voz": "garota viva" }'
A resposta carrega uma URL assinada para o áudio gerado. O formato padrão é mp3 a 24.000 Hz.
Escolhendo uma voz
Doze vozes de sistema vêm com o modelo. Sete são mantidas do StepAudio 2.5, e cinco são novas: Alfie, Ethan, Matthew, Qingshunvsheng, e Tianrunnvsheng.
| Voz | Caráter | Bom para |
|---|---|---|
garota animada | Mulher brilhante e energética | Assistentes, guias de produto |
juventude vibrante | Jovem macho quente | Audiolivros, dublagem de vídeo |
soft-spoken-gentleman | Homem calmo e gentil | Narração em formato longo |
magnetic-voiced-male | Macho profundo e pesado | Trailers, leituras dramáticas |
feminina elegante-gentil | Mulher sincera e tranquilizadora | Linhas de apoio, educação |
Viva e Viva-Feminina | Leve e persuasivo | Marketing, vídeo curto |
zixinnansheng | Homem confiante | Audiolivros, treinamento |
A lista completa está no Referência do modelo. Um ID de voz clonado personalizado é aceito no mesmo campo.
Dirigindo a entrega
Em vez de tags de emoção pré-definidas, você escreve o que quer e o modelo executa. Instrução define o tom de toda a passagem e aceita até 500 caracteres.
{ "modelo": "stepaudio-3-tts", "entrada": "Encontramos algo nos registros.", "voz": "magnetic-voiced-male", "instrução": "Devagar e deliberado, como a voz de um trailer. Deixe a pausa cair." }
Para uma única palavra ou frase, coloque a direção entre parênteses dentro Entrada em vez disso.
Idiomas
Definir Idioma para en, zh, Ja, Ko, fr, ou es. Japonês, Coreano, Francês e Espanhol estão em prévia. Deixe de fora e o modelo lê em inglês.
Formatos de saída
Escolha mp3, WAV, FLAC, Opus, ou PCM com response_format, e conjunto sample_rate até 8000, 16000, 22050 ou 24000.
Três coisas que pegam as pessoas de surpresa
- Parênteses são direção, não palavras. Qualquer coisa dentro
()emEntradaé lida como um sinal de entrega e nunca é falada. Se precisar de um comentário de lado com parênteses, leia em voz alta, reescreva sem parênteses. - 48.000 Hz não está disponível neste modelo. Aparece em alguma documentação geral text-to-speech, mas o StepAudio 3 TTS rejeita. Fique em 24.000 Hz para a maior qualidade.
Instruçãoevoice_labelnão são intercambiáveis. StepAudio 3 TTS takesInstruçãoe rejeitavoice_label. O Step TTS 2 é o oposto. Portar uma requisição entre eles significa trocar esse campo.
Preços e limites
A cobrança é por caractere de entrada, pague conforme você vai, sem assinatura e sem mínimo. Um caractere chinês conta como um caractere, e duas letras inglesas contam como um. A tarifa ao vivo está no página do modelo e o página de preços. Pedidos têm limite de 1.000 caracteres, então divida roteiros mais longos em chamadas do tamanho de uma frase e junte o áudio você mesmo.
Tente sem escrever código
Abrir StepAudio 3 TTS no playground para testar vozes e instruções, então copiar as configurações para o seu pedido. Referência completa do parâmetro: docs.empiriolabs.ai/models/stepaudio-3-tts.



