
Síntese de fala em nível humano em seis idiomas, com 12 vozes de sistema, direção de entrega em linguagem natural e reprodução em streaming.
Síntese de fala em nível humano em seis idiomas, com 12 vozes de sistema, direção de entrega em linguagem natural e reprodução em streaming.
A contagem de caracteres segue o preço do StepFun: um caractere chinês conta como um caractere, duas letras inglesas contam como um caractere, e dois sinais de pontuação contam como um caractere.
Também conhecido como StepFun StepAudio 3 TTS
stepaudio-3-tts/v1/audio/speechPOST/v1/audio/speech:streamstepfun/stepaudio-3-ttsTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
StepAudio 3 TTS gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo stepaudio-3-tts. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parâmetros de requisição suportados pela API StepAudio 3 TTS na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| input | string | - | máx. 1000 | Texto para sintetizar. Máximo 1.000 caracteres. O conteúdo entre parênteses é tratado como direção de entrega e não é falado. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Voz oficial do StepFun. IDs de voz clonados personalizados também são aceitos via API. |
| instruction | string | - | máx. 500 | Emoção global ou orientação de estilo para todo o texto, em linguagem natural. Máximo 500 caracteres. |
| speed | number | 1 | 0.5 a 2 | Velocidade da fala. |
| volume | number | 1 | 0.1 a 2 | Volume de saída. |
| language | enum | en | en, zh, ja, ko, fr, es | Idioma alvo. Japonês, coreano, francês e espanhol estão em prévia. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | Formato de áudio de saída. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | Taxa de amostragem de saída em Hz. |
| markdown_filter | boolean | false | - | Remova a sintaxe Markdown da entrada antes que ela seja falada. |
| pronunciation_map | string | - | - | A pronúncia opcional substitui, como um objeto com um array tonal de regras "written/spoken". |
A entrada máxima é de 1.000 caracteres. O conteúdo entre parênteses é tratado como direção de entrega e não é falado. Use instrução para emoção global ou orientação de estilo, até 500 caracteres. Doze vozes do sistema estão disponíveis, e um ID de voz clonado personalizado também é aceito. Os idiomas reconhecidos são chinês, inglês, japonês, coreano, francês e espanhol, com idiomas além do chinês e inglês na prévia. Os formatos de saída são mp3, wav, flac, opus e pcm em 8000, 16000, 22050 ou 24000 Hz. Wav é retornado como um arquivo completo em vez de transmitido em streaming. Este modelo não suporta voice_label.
Na EmpirioLabs, StepAudio 3 TTS é cobrado por uso: Síntese $0.36 por 10.000 caracteres. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
StepAudio 3 TTS é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa StepAudio 3 TTS no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.