
Modèle vocal open source pour des dialogues de podcast longs et multi-haut-parleurs, avec contrôle paralinguistique (rires, soupirs) et clonage vocal zéro-shot.
Modèle vocal open source pour des dialogues de podcast longs et multi-haut-parleurs, avec contrôle paralinguistique (rires, soupirs) et clonage vocal zéro-shot.
Aussi connu sous le nom Soul AI Lab SoulX Podcast
soulx-podcast/v1/audio/speechsoul-ai-lab/soulx-podcastTarifs à l'usage en direct du catalogue EmpirioLabs. Vous ne payez que ce que vous utilisez, sans minimum mensuel.
SoulX Podcast génère la voix via POST /v1/audio/speech et renvoie de l'audio lisible. Envoyez le texte à prononcer dans input avec l'id de modèle soulx-podcast. Obtenez une clé API depuis le tableau de bord EmpirioLabs.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "soulx-podcast",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "soulx-podcast", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Paramètres de requête pris en charge par l'API SoulX Podcast sur EmpirioLabs. Les valeurs par défaut s'appliquent quand un champ est omis.
| Paramètre | Type | Par défaut | Plage / valeurs | Description |
|---|---|---|---|---|
| input | string | - | - | Script de podcast. Utilisez les tags [S1] / [S2] / [S3] / [S4] ou les lignes 'Speaker N:' pour le multi-haut-parleurs. Balises paralinguistiques supportées:... |
| voice_model | enum | base | base, dialect | base: anglais + mandarin. dialecte: ajoute le Sichuan, le Henan et le cantonais. |
| voice_s1 | enum | arthur | arthur, james, lj, xiaomei, zhigang, custom_s1 | Voix pour [S1]. lj = Emma. custom_s1 nécessite voice_s1_audio_url. |
| voice_s2 | enum | lj | arthur, james, lj, xiaomei, zhigang, custom_s2 | Voix pour [S2]. lj = Emma. |
| voice_s3 | enum | james | arthur, james, lj, xiaomei, zhigang, custom_s3 | Voix pour [S3]. |
| voice_s4 | enum | xiaomei | arthur, james, lj, xiaomei, zhigang, custom_s4 | Voix pour [S4]. |
| voice_s1_audio_url | string | - | - | Référence à l’URL audio pour le clonage vocal personnalisé [S1]. Le locuteur doit prononcer la phrase de consentement à voix haute. |
| voice_s2_audio_url | string | - | - | Référence à l’URL audio pour le clonage vocal personnalisé [S2]. |
| voice_s3_audio_url | string | - | - | URL audio de référence pour le clonage vocal personnalisé [S3]. |
| voice_s4_audio_url | string | - | - | URL audio de référence pour le clonage vocal personnalisé [S4]. |
| temperature | number | 0.6 | 0.1 à 2 | Température d’échantillonnage. |
| top_k | number | 100 | 1 à 500 | Limite d’échantillonnage top-k. |
| top_p | number | 0.9 | 0.1 à 1 | Échantillonnage du noyau. |
| repetition_penalty | number | 1.25 | 1 à 2 | Des valeurs plus élevées découragent la répétition des formulations. |
Modèle vocal open source pour un dialogue long et multi-haut-parleur avec contrôle paralinguistique et clonage vocal zéro-shot.
Sur EmpirioLabs, SoulX Podcast est facturé à l'usage : Base $0.015 par 1k caractères; Dialecte $0.015 par 1k caractères. La grille tarifaire en direct de cette page correspond toujours à ce que l'API facture.
SoulX Podcast est servi via POST /v1/audio/speech sur api.empiriolabs.ai avec une authentification standard par token Bearer.
Oui. Le playground EmpirioLabs exécute SoulX Podcast dans le navigateur avec les mêmes paramètres que l'API expose, pour tester vos prompts avant d'écrire du code.
Créez un compte EmpirioLabs, puis générez une clé sous API Keys dans le tableau de bord. La facturation utilise des crédits à l'usage : vous ne payez que vos requêtes.
Consultez nos tarifs ou contactez-nous si vous souhaitez que votre propre modèle soit déployé sur notre stack.