StepAudio 3 TTS API

Síntesis de voz a nivel humano en seis idiomas, con 12 voces de sistema, dirección de entrega en lenguaje natural y reproducción en streaming.

StepFunGeneración de audioLanzado 9 sept 2026InternationalEndpoint propietarioNuevo

Acerca de StepAudio 3 TTS

Síntesis de voz a nivel humano en seis idiomas, con 12 voces de sistema, dirección de entrega en lenguaje natural y reproducción en streaming.

El conteo de caracteres sigue la tarifación de StepFun: un carácter chino cuenta como un carácter, dos letras inglesas cuentan como un carácter y dos signos de puntuación cuentan como un carácter.

También conocido como StepFun StepAudio 3 TTS

text to speechcontextual ttsvoice controlmultilingual

Especificaciones de StepAudio 3 TTS

ID del modelo
stepaudio-3-tts
Autor
StepFun
Categoría
Generación de audio
Lanzado
9 sept 2026
Entrada
Texto
Salida
Audio
Región
International
Endpoints
POST/v1/audio/speechPOST/v1/audio/speech:stream
IDs de modelo alternativos
stepfun/stepaudio-3-tts

Precios de la API de StepAudio 3 TTS

Tarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.

Tipo
Especificación
Tarifa
Síntesis
por cada 10.000 caracteres
$0.36
Comparar en la página completa de precios

Cómo llamar a la API de StepAudio 3 TTS

StepAudio 3 TTS genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo stepaudio-3-tts. Consigue una clave de API en el panel de EmpirioLabs.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Referencia completa de la API de StepAudio 3 TTS

Parámetros de la API de StepAudio 3 TTS

Parámetros de solicitud compatibles con la API de StepAudio 3 TTS en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.

ParámetroTipoPredeterminadoRango / valoresDescripción
inputstring-máx. 1000Texto para sintetizar. Máximo 1.000 caracteres. El contenido entre paréntesis se trata como dirección de entrega y no se habla.
voiceenumlively-girllively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v...Voz oficial de StepFun. También se aceptan identificadores de voz clonados personalizados a través de la API.
instructionstring-máx. 500Emoción global o guía de estilo para todo el pasaje, en lenguaje natural. Máximo 500 caracteres.
speednumber10.5 a 2Velocidad del habla.
volumenumber10.1 a 2Volumen de salida.
languageenumenen, zh, ja, ko, fr, esIdioma objetivo. Japonés, coreano, francés y español están en vista previa.
response_formatenummp3mp3, wav, flac, opus, pcmFormato de audio de salida.
sample_rateenum240008000, 16000, 22050, 24000Tasa de muestreo de salida en Hz.
markdown_filterbooleanfalse-Elimina la sintaxis Markdown de la entrada antes de que se pronuncie.
pronunciation_mapstring--La pronunciación opcional anula, como un objeto con una matriz tonal de reglas "written/spoken".

Información útil

La entrada máxima es de 1.000 caracteres. El contenido entre paréntesis se trata como dirección de entrega y no se habla. Utiliza instrucciones para la emoción global o guía de estilo, hasta 500 caracteres. Hay doce voces del sistema disponibles, y también se acepta un ID de voz clonado personalizado. Los idiomas reconocidos son chino, inglés, japonés, coreano, francés y español, con idiomas distintos al chino e inglés en la vista previa. Los formatos de salida son mp3, wav, flac, opus y pcm a 8000, 16000, 22050 o 24000 Hz. Wav se devuelve como un archivo completo en lugar de transmitido en streaming. Este modelo no soporta voice_label.

API de StepAudio 3 TTS: preguntas frecuentes

¿Cuánto cuesta la API de StepAudio 3 TTS?

En EmpirioLabs, StepAudio 3 TTS se factura por uso: Síntesis $0.36 por cada 10.000 caracteres. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.

¿Qué endpoint usa StepAudio 3 TTS?

StepAudio 3 TTS se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.

¿Puedo probar StepAudio 3 TTS en el navegador antes de integrar?

Sí. El playground de EmpirioLabs ejecuta StepAudio 3 TTS en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.

¿Cómo consigo una clave de API de StepAudio 3 TTS?

Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.

¿Listo para usar mejores endpoints?

Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.