Inicio Blog

Cómo usar la API TTS de StepAudio 3

StepAudio 3 TTS mediante cubierta de API

Sep 15, 2026

EmpirioLabs AI

Respuesta corta: StepAudio 3 TTS es el modelo de text-to-speech insignia de StepFun, disponible en EmpirioLabs a través del endpoint estándar de voz estilo OpenAI. Enviar hasta 1.000 caracteres a DESPUÉS /v1/audio/speech con modelo: "stepaudio-3-tts", elige una de doce voces del sistema y describe la forma de interpretar en inglés ordinario con Instrucción.

Tu primera petición

curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Contenido: application/json" \ -d '{ "modelo": "stepaudio-3-tts", "entrada": "Tu llamada está siendo conectada. Gracias por esperar.", "voz": "chica viva" }'

La respuesta lleva una URL firmada al audio generado. El formato predeterminado es mp3 a 24.000 Hz.

Elegir una voz

Doce voces del sistema vienen con el modelo. Siete se mantienen de StepAudio 2.5, y cinco son nuevas: Alfie, Ethan, Matthew, Qingshunvsheng, y Tianrunnvsheng.

VozCarácterBien para
chica vivazMujer brillante y enérgicaAsistentes, guías de producto
juventud vibranteJoven macho cálidoAudiolibros, doblaje de vídeo
soft-spoken-gentlemanHombre tranquilo y gentilNarración de formato largo
magnetic-voiced-maleMacho profundo y corpulentoTráilers, lecturas dramáticas
Elegante-Gentil FemeninaMujer sincera y tranquilizadoraLíneas de apoyo, educación
hembra animadaLigero y persuasivoMarketing, vídeo corto
zixinnanshengHombre seguro de sí mismoAudiolibros, formación

La lista completa está en el Referencia del modelo. En el mismo campo se acepta un ID de voz clonado personalizado.

Dirigir la entrega

En lugar de etiquetas emocionales predefinidas, escribes lo que quieres y el modelo lo ejecuta. Instrucción marca el tono de todo el pasaje y acepta hasta 500 caracteres.

{ "modelo": "stepaudio-3-tts", "entrada": "Hemos encontrado algo en los registros.", "voz": "magnetic-voiced-male", "instrucciones": "Lento y deliberado, como la voz de un remolque. Deja que la pausa aterrice." }

Para una palabra o frase, pon la dirección entre paréntesis Entrada en su lugar.

Idiomas

Set Idioma a en, zh, Ja, Ko, fr, o es. Japonés, Coreano, francés y español están en vista previa. Si lo dejas fuera, el modelo dice inglés.

Formatos de salida

Elige mp3, WAW, FLAC, Obra, o PCM con response_format, y conjunto sample_rate hasta 8000, 16000, 22050 o 240000.

Tres cosas que pillan a la gente desprevenida

  1. Los paréntesis son dirección, no palabras. Cualquier cosa dentro () en Entrada se interpreta como una señal de entrega y nunca se pronuncia. Si necesitas que se lea en voz alta un aparte entre corchetes, reescríbelo sin paréntesis.
  2. 48.000 Hz no está disponible en este modelo. Aparece en alguna documentación general de text-to-speech, pero StepAudio 3 TTS lo rechaza. Mantente en 24.000 Hz para la máxima calidad.
  3. Instrucción y voice_label no son intercambiables. StepAudio 3 TTS tomas Instrucción y rechaza voice_label. El Step TTS 2 es lo contrario. Portar una solicitud entre ellos significa intercambiar ese campo.

Precios y límites

La facturación es por carácter de entrada, paga según la marcha, sin suscripción ni mínimo. Un carácter chino cuenta como un carácter y dos letras inglesas cuentan como uno. La tarifa en directo está en el página modelo y el página de precios. Las solicitudes tienen un límite de 1.000 caracteres, así que divide los guiones largos en llamadas de tamaño frase y únete tú mismo al audio.

Pruébalo sin escribir código

Abierto StepAudio 3 TTS en el playground para audicionar voces e instrucciones, luego copiar los ajustes en tu solicitud. Referencia completa del parámetro: docs.empiriolabs.ai/models/stepaudio-3-tts.

¿Listo para usar mejores endpoints?

Explora nuestros modelos o contáctanos para consultas empresariales, despliegues personalizados o cualquier otra cosa.