
Modelo de voz de código abierto para diálogos de podcast de formato largo y múltiples altavoces con control paralingüístico (risas, suspiros) y clonación de voz sin tomas.
Modelo de voz de código abierto para diálogos de podcast de formato largo y múltiples altavoces con control paralingüístico (risas, suspiros) y clonación de voz sin tomas.
También conocido como Soul AI Lab SoulX Podcast
soulx-podcast/v1/audio/speechsoul-ai-lab/soulx-podcastTarifas de pago por uso en vivo del catálogo de EmpirioLabs. Solo pagas por lo que usas, sin mínimo mensual.
SoulX Podcast genera voz a través de POST /v1/audio/speech y devuelve audio reproducible. Envía el texto a pronunciar como input con el id de modelo soulx-podcast. Consigue una clave de API en el panel de EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "soulx-podcast",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "soulx-podcast", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parámetros de solicitud compatibles con la API de SoulX Podcast en EmpirioLabs. Los valores por defecto se aplican cuando se omite un campo.
| Parámetro | Tipo | Predeterminado | Rango / valores | Descripción |
|---|---|---|---|---|
| input | string | - | - | Guion de pódcast. Usa etiquetas [S1] / [S2] / [S3] / [S4] o líneas 'Speaker N:' para multi-altavoz. Etiquetas paralingüísticas soportadas: <|risas|>, <|suspiro|>,... |
| voice_model | enum | base | base, dialect | base: inglés + mandarín. dialecto: añade Sichuan, Henan y cantonés. |
| voice_s1 | enum | arthur | arthur, james, lj, xiaomei, zhigang, custom_s1 | Voz para [S1]. lj = Emma. custom_s1 requiere voice_s1_audio_url. |
| voice_s2 | enum | lj | arthur, james, lj, xiaomei, zhigang, custom_s2 | Voz para [S2]. lj = Emma. |
| voice_s3 | enum | james | arthur, james, lj, xiaomei, zhigang, custom_s3 | Voz para [S3]. |
| voice_s4 | enum | xiaomei | arthur, james, lj, xiaomei, zhigang, custom_s4 | Voz para [S4]. |
| voice_s1_audio_url | string | - | - | URL de audio de referencia para la clonación de voz personalizada [S1]. El hablante debe decir la frase de consentimiento en voz alta. |
| voice_s2_audio_url | string | - | - | URL de audio de referencia para la clonación de voz personalizada [S2]. |
| voice_s3_audio_url | string | - | - | URL de audio de referencia para la clonación de voz personalizada [S3]. |
| voice_s4_audio_url | string | - | - | URL de audio de referencia para la clonación de voz personalizada [S4]. |
| temperature | number | 0.6 | 0.1 a 2 | Temperatura de muestreo. |
| top_k | number | 100 | 1 a 500 | Top-k de muestreo. |
| top_p | number | 0.9 | 0.1 a 1 | Muestreo de núcleos. |
| repetition_penalty | number | 1.25 | 1 a 2 | Valores más altos desaniman la repetición de frases. |
Modelo de voz de código abierto para diálogos de podcast de larga duración y múltiples altavoces con control paralingüístico y clonación de voz sin disparos.
En EmpirioLabs, SoulX Podcast se factura por uso: Base $0.015 por cada 1.000 caracteres; Dialecto $0.015 por cada 1.000 caracteres. La tabla de tarifas en vivo de esta página siempre coincide con lo que cobra la API.
SoulX Podcast se sirve a través de POST /v1/audio/speech en api.empiriolabs.ai con autenticación estándar de token Bearer.
Sí. El playground de EmpirioLabs ejecuta SoulX Podcast en el navegador con los mismos parámetros que expone la API, para que pruebes prompts antes de escribir código.
Crea una cuenta de EmpirioLabs y genera una clave en API Keys en el panel. La facturación es con créditos de pago por uso, así que solo pagas por las solicitudes que haces.
Consulta nuestros precios o contacta con nosotros si quieres que tu propio modelo se implemente en nuestra pila.