
StepFun text-to-speech modelo con voces oficiales, voces clonadas personalizadas y controles de etiqueta de voz.
StepFun text-to-speech modelo con voces oficiales, voces clonadas personalizadas y controles de etiqueta de voz.
El conteo de caracteres sigue la tarifación de StepFun: un carácter chino cuenta como un carácter, dos letras inglesas cuentan como un carácter y dos signos de puntuación cuentan como un carácter.
También conocido como StepFun Step TTS 2, Step-TTS-2
step-tts-2/v1/audio/speechstepfun/step-tts-2Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
Step TTS 2 genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo step-tts-2. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "step-tts-2",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "step-tts-2", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parámetros de solicitud compatibles con la API de Step TTS 2 en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input | string | - | máx. 1000 | Texto para sintetizar. Máximo 1.000 caracteres. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Official StepFun voice. Custom cloned voice IDs are also accepted via the API. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | Formato de audio de salida. |
| speed | number | 1 | 0.5 a 2 | Velocidad del habla. |
| volume | number | 1 | 0.1 a 2 | Volumen de salida. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | Tasa de muestreo de salida en Hz. |
| voice_label | object | - | - | Etiquetas de emoción y estilo habla para step-tts-2. |
| pronunciation_map | object | - | - | Mapeo de pronunciación opcional. |
| markdown_filter | boolean | false | - | Filtra la sintaxis de marcado antes de la síntesis. |
La entrada máxima es de 1.000 caracteres. Soporta identificadores de voz oficiales, voces clonadas personalizadas, etiquetas de emociones voice_label y etiquetas de estilo voice_label. El parámetro de instrucción es solo para stepaudio-2.5-tts.
En EmpirioLabs, Step TTS 2 se factura por uso: Síntesis $0.40 por cada 10.000 caracteres. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
Step TTS 2 se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta Step TTS 2 en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.