
Síntesis de voz a nivel humano en seis idiomas, con 12 voces de sistema, dirección de entrega en lenguaje natural y reproducción en streaming.
Síntesis de voz a nivel humano en seis idiomas, con 12 voces de sistema, dirección de entrega en lenguaje natural y reproducción en streaming.
El conteo de caracteres sigue la tarifación de StepFun: un carácter chino cuenta como un carácter, dos letras inglesas cuentan como un carácter y dos signos de puntuación cuentan como un carácter.
También conocido como StepFun StepAudio 3 TTS
stepaudio-3-tts/v1/audio/speechPOST/v1/audio/speech:streamstepfun/stepaudio-3-ttsTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
StepAudio 3 TTS genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo stepaudio-3-tts. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parámetros de solicitud compatibles con la API de StepAudio 3 TTS en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input | string | - | máx. 1000 | Texto para sintetizar. Máximo 1.000 caracteres. El contenido entre paréntesis se trata como dirección de entrega y no se habla. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Voz oficial de StepFun. También se aceptan identificadores de voz clonados personalizados a través de la API. |
| instruction | string | - | máx. 500 | Emoción global o guía de estilo para todo el pasaje, en lenguaje natural. Máximo 500 caracteres. |
| speed | number | 1 | 0.5 a 2 | Velocidad del habla. |
| volume | number | 1 | 0.1 a 2 | Volumen de salida. |
| language | enum | en | en, zh, ja, ko, fr, es | Idioma objetivo. Japonés, coreano, francés y español están en vista previa. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | Formato de audio de salida. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | Tasa de muestreo de salida en Hz. |
| markdown_filter | boolean | false | - | Elimina la sintaxis Markdown de la entrada antes de que se pronuncie. |
| pronunciation_map | string | - | - | La pronunciación opcional anula, como un objeto con una matriz tonal de reglas "written/spoken". |
La entrada máxima es de 1.000 caracteres. El contenido entre paréntesis se trata como dirección de entrega y no se habla. Utiliza instrucciones para la emoción global o guía de estilo, hasta 500 caracteres. Hay doce voces del sistema disponibles, y también se acepta un ID de voz clonado personalizado. Los idiomas reconocidos son chino, inglés, japonés, coreano, francés y español, con idiomas distintos al chino e inglés en la vista previa. Los formatos de salida son mp3, wav, flac, opus y pcm a 8000, 16000, 22050 o 24000 Hz. Wav se devuelve como un archivo completo en lugar de transmitido en streaming. Este modelo no soporta voice_label.
En EmpirioLabs, StepAudio 3 TTS se factura por uso: Síntesis $0.36 por cada 10.000 caracteres. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
StepAudio 3 TTS se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta StepAudio 3 TTS en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.