StepAudio 3 TTS API

Síntese de fala em nível humano em seis idiomas, com 12 vozes de sistema, direção de entrega em linguagem natural e reprodução em streaming.

StepFunGeração de ÁudioLançado 9 de set. de 2026InternationalEndpoint proprietárioNovo

Sobre StepAudio 3 TTS

Síntese de fala em nível humano em seis idiomas, com 12 vozes de sistema, direção de entrega em linguagem natural e reprodução em streaming.

A contagem de caracteres segue o preço do StepFun: um caractere chinês conta como um caractere, duas letras inglesas contam como um caractere, e dois sinais de pontuação contam como um caractere.

Também conhecido como StepFun StepAudio 3 TTS

text to speechcontextual ttsvoice controlmultilingual

Especificações de StepAudio 3 TTS

ID do modelo
stepaudio-3-tts
Autor
StepFun
Categoria
Geração de Áudio
Lançado
9 de set. de 2026
Entrada
Texto
Saída
Áudio
Região
International
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:stream
IDs de modelo alternativos
stepfun/stepaudio-3-tts

Preços da API StepAudio 3 TTS

Tarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.

Tipo
Especificação
Tarifa
Síntese
por 10.000 caracteres
$0.36
Comparar na página completa de preços

Como chamar a API StepAudio 3 TTS

StepAudio 3 TTS gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo stepaudio-3-tts. Obtenha uma chave de API no painel EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referência completa da API StepAudio 3 TTS

Parâmetros da API StepAudio 3 TTS

Parâmetros de requisição suportados pela API StepAudio 3 TTS na EmpirioLabs. Os padrões valem quando um campo é omitido.

ParâmetroTipoPadrãoIntervalo / valoresDescrição
inputstring-máx. 1000Texto para sintetizar. Máximo 1.000 caracteres. O conteúdo entre parênteses é tratado como direção de entrega e não é falado.
voiceenumlively-girllively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v...Voz oficial do StepFun. IDs de voz clonados personalizados também são aceitos via API.
instructionstring-máx. 500Emoção global ou orientação de estilo para todo o texto, em linguagem natural. Máximo 500 caracteres.
speednumber10.5 a 2Velocidade da fala.
volumenumber10.1 a 2Volume de saída.
languageenumenen, zh, ja, ko, fr, esIdioma alvo. Japonês, coreano, francês e espanhol estão em prévia.
response_formatenummp3mp3, wav, flac, opus, pcmFormato de áudio de saída.
sample_rateenum240008000, 16000, 22050, 24000Taxa de amostragem de saída em Hz.
markdown_filterbooleanfalse-Remova a sintaxe Markdown da entrada antes que ela seja falada.
pronunciation_mapstring--A pronúncia opcional substitui, como um objeto com um array tonal de regras "written/spoken".

Bom saber

A entrada máxima é de 1.000 caracteres. O conteúdo entre parênteses é tratado como direção de entrega e não é falado. Use instrução para emoção global ou orientação de estilo, até 500 caracteres. Doze vozes do sistema estão disponíveis, e um ID de voz clonado personalizado também é aceito. Os idiomas reconhecidos são chinês, inglês, japonês, coreano, francês e espanhol, com idiomas além do chinês e inglês na prévia. Os formatos de saída são mp3, wav, flac, opus e pcm em 8000, 16000, 22050 ou 24000 Hz. Wav é retornado como um arquivo completo em vez de transmitido em streaming. Este modelo não suporta voice_label.

API StepAudio 3 TTS: perguntas frequentes

Quanto custa a API StepAudio 3 TTS?

Na EmpirioLabs, StepAudio 3 TTS é cobrado por uso: Síntese $0.36 por 10.000 caracteres. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.

Qual endpoint StepAudio 3 TTS usa?

StepAudio 3 TTS é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.

Posso testar StepAudio 3 TTS no navegador antes de integrar?

Sim. O playground da EmpirioLabs executa StepAudio 3 TTS no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.

Como consigo uma chave de API StepAudio 3 TTS?

Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.

Pronto para usar endpoints melhores?

Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.