
Open-Source-Sprachmodell für langformatige, mehrsprachige Podcast-Dialoge mit paralinguistischer Kontrolle (Lachen, Seufzen) und Zero-Shot-Sprachklonen.
Open-Source-Sprachmodell für langformatige, mehrsprachige Podcast-Dialoge mit paralinguistischer Kontrolle (Lachen, Seufzen) und Zero-Shot-Sprachklonen.
Auch bekannt als Soul AI Lab SoulX Podcast
soulx-podcast/v1/audio/speechsoul-ai-lab/soulx-podcastLive Pay-as-you-go-Preise aus dem EmpirioLabs-Katalog. Du zahlst nur für das, was du nutzt, ohne monatliches Minimum.
SoulX Podcast erzeugt Sprache über POST /v1/audio/speech und liefert abspielbares Audio. Sende den zu sprechenden Text als input mit der Modell-ID soulx-podcast. Hol dir einen API-Schlüssel im EmpirioLabs Dashboard.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "soulx-podcast",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "soulx-podcast", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)Request-Parameter, die die SoulX Podcast API auf EmpirioLabs unterstützt. Standardwerte gelten, wenn ein Feld weggelassen wird.
| Parameter | Typ | Standard | Bereich / Werte | Beschreibung |
|---|---|---|---|---|
| input | string | - | - | Podcast-Skript. Verwenden Sie [S1] / [S2] / [S3] / [S4]-Tags oder 'Speaker N:'-Zeilen für Multi-Speaker-Leitungen. Paralinguistische Tags werden unterstützt:... |
| voice_model | enum | base | base, dialect | Basis: Englisch + Mandarin. Dialekt: fügt Sichuan, Henan und Kantonesisch hinzu. |
| voice_s1 | enum | arthur | arthur, james, lj, xiaomei, zhigang, custom_s1 | Stimme für [S1]. lj = Emma. custom_s1 erfordert voice_s1_audio_url. |
| voice_s2 | enum | lj | arthur, james, lj, xiaomei, zhigang, custom_s2 | Stimme für [S2]. lj = Emma. |
| voice_s3 | enum | james | arthur, james, lj, xiaomei, zhigang, custom_s3 | Stimme für [S3]. |
| voice_s4 | enum | xiaomei | arthur, james, lj, xiaomei, zhigang, custom_s4 | Stimme für [S4]. |
| voice_s1_audio_url | string | - | - | Referenz auf Audio-URL für [S1] benutzerdefiniertes Sprachklonen. Der Sprecher muss die Einverständnisphrase laut aussprechen. |
| voice_s2_audio_url | string | - | - | Referenz auf Audio-URL für [S2] benutzerdefiniertes Sprachklonen. |
| voice_s3_audio_url | string | - | - | Referenz auf Audio-URL für [S3] benutzerdefiniertes Sprachklonen. |
| voice_s4_audio_url | string | - | - | Referenz auf Audio-URL für [S4] benutzerdefiniertes Sprachklonen. |
| temperature | number | 0.6 | 0.1 bis 2 | Temperatur wird geprochen. |
| top_k | number | 100 | 1 bis 500 | Top-K-Stichprobenobergrenze. |
| top_p | number | 0.9 | 0.1 bis 1 | Kernprobenahme. |
| repetition_penalty | number | 1.25 | 1 bis 2 | Höhere Werte entmutigen wiederholte Formulierungen. |
Open-Source-Sprachmodell für langformatige, mehrsprachige Podcast-Dialoge mit paralinguistischer Kontrolle und Zero-Shot-Sprachklonen.
Auf EmpirioLabs wird SoulX Podcast nach Verbrauch abgerechnet: Basis $0.015 pro 1.000 Zeichen; Dialekt $0.015 pro 1.000 Zeichen. Die Live-Preistabelle auf dieser Seite entspricht immer dem, was die API berechnet.
SoulX Podcast wird über POST /v1/audio/speech auf api.empiriolabs.ai mit normaler Bearer-Token-Authentifizierung bereitgestellt.
Ja. Der EmpirioLabs Playground führt SoulX Podcast im Browser mit denselben Parametern aus, die die API bietet. So kannst du Prompts testen, bevor du Code schreibst.
Erstelle ein EmpirioLabs-Konto und generiere dann einen Schlüssel unter API Keys im Dashboard. Die Abrechnung erfolgt über Pay-as-you-go-Guthaben, du zahlst also nur für deine Requests.
Schauen Sie sich unsere Preise an oder kontaktieren Sie uns, wenn Sie Ihr eigenes Modell auf unserem Stack implementieren möchten.