
Modelo de voz open-source para diálogos de podcast de longa duração e múltiplos alto-falantes com controle paralinguístico (risos, suspiros) e clonagem de voz zero-shot.
Modelo de voz open-source para diálogos de podcast de longa duração e múltiplos alto-falantes com controle paralinguístico (risos, suspiros) e clonagem de voz zero-shot.
Também conhecido como Soul AI Lab SoulX Podcast
soulx-podcast/v1/audio/speechsoul-ai-lab/soulx-podcastTarifas pay-as-you-go ao vivo do catálogo EmpirioLabs. Você paga só pelo que usa, sem mínimo mensal.
SoulX Podcast gera fala por POST /v1/audio/speech e retorna áudio reproduzível. Envie o texto a ser falado em input com o id de modelo soulx-podcast. Obtenha uma chave de API no painel EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "soulx-podcast",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "soulx-podcast", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Parâmetros de requisição suportados pela API SoulX Podcast na EmpirioLabs. Os padrões valem quando um campo é omitido.
| Parâmetro | Tipo | Padrão | Intervalo / valores | Descrição |
|---|---|---|---|---|
| input | string | - | - | Roteiro de podcast. Use tags [S1] / [S2] / [S3] / [S4] ou linhas 'Speaker N:' para multi-alto-falantes. Tags paralinguísticas suportadas: <|risos|>, <|suspiro|>,... |
| voice_model | enum | base | base, dialect | base: Inglês + Mandarim. dialeto: adiciona Sichuan, Henan e cantonês. |
| voice_s1 | enum | arthur | arthur, james, lj, xiaomei, zhigang, custom_s1 | Voz para [S1]. lj = Emma. custom_s1 exige voice_s1_audio_url. |
| voice_s2 | enum | lj | arthur, james, lj, xiaomei, zhigang, custom_s2 | Voz para [S2]. lj = Emma. |
| voice_s3 | enum | james | arthur, james, lj, xiaomei, zhigang, custom_s3 | Voz para [S3]. |
| voice_s4 | enum | xiaomei | arthur, james, lj, xiaomei, zhigang, custom_s4 | Voz para [S4]. |
| voice_s1_audio_url | string | - | - | URL de áudio de referência para clonagem de voz personalizada [S1]. O falante deve dizer a frase de consentimento em voz alta. |
| voice_s2_audio_url | string | - | - | URL de áudio de referência para clonagem de voz personalizada [S2]. |
| voice_s3_audio_url | string | - | - | URL de áudio de referência para clonagem de voz personalizada [S3]. |
| voice_s4_audio_url | string | - | - | URL de áudio de referência para clonagem de voz personalizada [S4]. |
| temperature | number | 0.6 | 0.1 a 2 | Temperatura de amostragem. |
| top_k | number | 100 | 1 a 500 | Top-k de amostragem de capotagem. |
| top_p | number | 0.9 | 0.1 a 1 | Amostragem do núcleo. |
| repetition_penalty | number | 1.25 | 1 a 2 | Valores mais altos desencorajam frases repetidas. |
Modelo de voz open-source para diálogos de podcast de longa duração e múltiplos alto-falantes, com controle paralinguístico e clonagem de voz zero-shot.
Na EmpirioLabs, SoulX Podcast é cobrado por uso: Base $0.015 por 1k caracteres; Dialeto $0.015 por 1k caracteres. A tabela de tarifas ao vivo desta página sempre corresponde ao que a API cobra.
SoulX Podcast é servido por POST /v1/audio/speech em api.empiriolabs.ai com autenticação padrão por token Bearer.
Sim. O playground da EmpirioLabs executa SoulX Podcast no navegador com os mesmos parâmetros que a API expõe, para você testar prompts antes de escrever código.
Crie uma conta EmpirioLabs e gere uma chave em API Keys no painel. A cobrança usa créditos pay-as-you-go, então você paga apenas pelas requisições que faz.
Confira nossos preços ou entre em contato se quiser que seu próprio modelo seja implementado em nossa pilha.