
Modelo contextual de StepFun text-to-speech con dirección de voz en lenguaje natural y entrega expresiva.
Modelo contextual de StepFun text-to-speech con dirección de voz en lenguaje natural y entrega expresiva.
El conteo de caracteres sigue la tarifación de StepFun: un carácter chino cuenta como un carácter, dos letras inglesas cuentan como un carácter y dos signos de puntuación cuentan como un carácter.
También conocido como StepAudio TTS, StepFun StepAudio 2.5 TTS, StepAudio-2.5-TTS, stepaudio-2-5-tts
stepaudio-2-5-tts/v1/audio/speechstepaudio-2.5-ttsstepfun/stepaudio-2-5-ttsstepfun/stepaudio-2.5-ttsTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
StepAudio 2.5 TTS genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo stepaudio-2-5-tts. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-2-5-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-2-5-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parámetros de solicitud compatibles con la API de StepAudio 2.5 TTS en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input | string | - | máx. 1000 | Texto para sintetizar. Máximo 1.000 caracteres. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | Official StepFun voice. Custom cloned voice IDs are also accepted via the API. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | Formato de audio de salida. |
| speed | number | 1 | 0.5 a 2 | Velocidad del habla. |
| volume | number | 1 | 0.1 a 2 | Volumen de salida. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | Tasa de muestreo de salida en Hz. |
| instruction | string | - | máx. 200 | Emoción global o orientación de estilo. Solo soportado por StepAudio 2.5 TTS. |
| pronunciation_map | object | - | - | Mapeo de pronunciación opcional. |
| markdown_filter | boolean | false | - | Filtra la sintaxis de marcado antes de la síntesis. |
La entrada máxima es de 1.000 caracteres. El contenido entre paréntesis se trata como dirección y no se habla. Usa la instrucción para la emoción global o la guía de estilo. StepAudio 2.5 TTS no soporta voice_label.
En EmpirioLabs, StepAudio 2.5 TTS se factura por uso: Síntesis $0.85 por cada 10.000 caracteres. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
StepAudio 2.5 TTS se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta StepAudio 2.5 TTS en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.