Respuesta corta: StepAudio 3 TTS es el modelo de text-to-speech insignia de StepFun, disponible en EmpirioLabs a través del endpoint estándar de voz estilo OpenAI. Enviar hasta 1.000 caracteres a DESPUÉS /v1/audio/speech con modelo: "stepaudio-3-tts", elige una de doce voces del sistema y describe la forma de interpretar en inglés ordinario con Instrucción.
Tu primera petición
curl https://api.empiriolabs.ai/v1/audio/speech \ -H "Autorización: Portador $EMPIRIOLABS_API_KEY" \ -H "Tipo-Contenido: application/json" \ -d '{ "modelo": "stepaudio-3-tts", "entrada": "Tu llamada está siendo conectada. Gracias por esperar.", "voz": "chica viva" }'
La respuesta lleva una URL firmada al audio generado. El formato predeterminado es mp3 a 24.000 Hz.
Elegir una voz
Doce voces del sistema vienen con el modelo. Siete se mantienen de StepAudio 2.5, y cinco son nuevas: Alfie, Ethan, Matthew, Qingshunvsheng, y Tianrunnvsheng.
| Voz | Carácter | Bien para |
|---|---|---|
chica vivaz | Mujer brillante y enérgica | Asistentes, guías de producto |
juventud vibrante | Joven macho cálido | Audiolibros, doblaje de vídeo |
soft-spoken-gentleman | Hombre tranquilo y gentil | Narración de formato largo |
magnetic-voiced-male | Macho profundo y corpulento | Tráilers, lecturas dramáticas |
Elegante-Gentil Femenina | Mujer sincera y tranquilizadora | Líneas de apoyo, educación |
hembra animada | Ligero y persuasivo | Marketing, vídeo corto |
zixinnansheng | Hombre seguro de sí mismo | Audiolibros, formación |
La lista completa está en el Referencia del modelo. En el mismo campo se acepta un ID de voz clonado personalizado.
Dirigir la entrega
En lugar de etiquetas emocionales predefinidas, escribes lo que quieres y el modelo lo ejecuta. Instrucción marca el tono de todo el pasaje y acepta hasta 500 caracteres.
{ "modelo": "stepaudio-3-tts", "entrada": "Hemos encontrado algo en los registros.", "voz": "magnetic-voiced-male", "instrucciones": "Lento y deliberado, como la voz de un remolque. Deja que la pausa aterrice." }
Para una palabra o frase, pon la dirección entre paréntesis Entrada en su lugar.
Idiomas
Set Idioma a en, zh, Ja, Ko, fr, o es. Japonés, Coreano, francés y español están en vista previa. Si lo dejas fuera, el modelo dice inglés.
Formatos de salida
Elige mp3, WAW, FLAC, Obra, o PCM con response_format, y conjunto sample_rate hasta 8000, 16000, 22050 o 240000.
Tres cosas que pillan a la gente desprevenida
- Los paréntesis son dirección, no palabras. Cualquier cosa dentro
()enEntradase interpreta como una señal de entrega y nunca se pronuncia. Si necesitas que se lea en voz alta un aparte entre corchetes, reescríbelo sin paréntesis. - 48.000 Hz no está disponible en este modelo. Aparece en alguna documentación general de text-to-speech, pero StepAudio 3 TTS lo rechaza. Mantente en 24.000 Hz para la máxima calidad.
Instrucciónyvoice_labelno son intercambiables. StepAudio 3 TTS tomasInstruccióny rechazavoice_label. El Step TTS 2 es lo contrario. Portar una solicitud entre ellos significa intercambiar ese campo.
Precios y límites
La facturación es por carácter de entrada, paga según la marcha, sin suscripción ni mínimo. Un carácter chino cuenta como un carácter y dos letras inglesas cuentan como uno. La tarifa en directo está en el página modelo y el página de precios. Las solicitudes tienen un límite de 1.000 caracteres, así que divide los guiones largos en llamadas de tamaño frase y únete tú mismo al audio.
Pruébalo sin escribir código
Abierto StepAudio 3 TTS en el playground para audicionar voces e instrucciones, luego copiar los ajustes en tu solicitud. Referencia completa del parámetro: docs.empiriolabs.ai/models/stepaudio-3-tts.



