
긴 형식을 위한 오픈 소스 음성 모델, 다 스피커 팟 캐스트 대화 with paralinguistic control (웃음, sighs) 및 Zero-shot 음성 복제.
긴 형식을 위한 오픈 소스 음성 모델, 다 스피커 팟 캐스트 대화 with paralinguistic control (웃음, sighs) 및 Zero-shot 음성 복제.
다른 이름 Soul AI Lab SoulX Podcast
soulx-podcast/v1/audio/speechsoul-ai-lab/soulx-podcastEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
SoulX Podcast은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID soulx-podcast와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "soulx-podcast",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "soulx-podcast", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs에서 SoulX Podcast API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| input | string | - | - | 팟캐스트 대본. 다중 스피커를 위한 경우 [S1] / [S2] / [S3] / [S4] 태그 또는 'Speaker N:' 라인을 사용하세요. 지원된 부언어 태그: <|웃음|>, <|한숨|>, <|호흡|>, <|기침|>. |
| voice_model | enum | base | base, dialect | 기본 기준: 영어 + 만다린. 방언: 쓰촨어, 허난어, 광둥어가 추가됩니다. |
| voice_s1 | enum | arthur | arthur, james, lj, xiaomei, zhigang, custom_s1 | [시즌 1]의 목소리. lj = 엠마. custom_s1 voice_s1_audio_url 필요해. |
| voice_s2 | enum | lj | arthur, james, lj, xiaomei, zhigang, custom_s2 | [시즌 2]의 목소리. lj = 엠마. |
| voice_s3 | enum | james | arthur, james, lj, xiaomei, zhigang, custom_s3 | [시즌 3]의 목소리. |
| voice_s4 | enum | xiaomei | arthur, james, lj, xiaomei, zhigang, custom_s4 | [시즌 4]의 목소리. |
| voice_s1_audio_url | string | - | - | [S1] 맞춤 음성 복제를 위한 참고 오디오 URL. 발언자는 동의 문구를 소리 내어 말해야 합니다. |
| voice_s2_audio_url | string | - | - | [S2] 맞춤 음성 복제를 위한 참고 오디오 URL. |
| voice_s3_audio_url | string | - | - | [S3] 맞춤 음성 복제를 위한 참고 오디오 URL. |
| voice_s4_audio_url | string | - | - | [S4] 맞춤 음성 복제를 위한 참고 오디오 URL. |
| temperature | number | 0.6 | 0.1 ~ 2 | 샘플링 온도. |
| top_k | number | 100 | 1 ~ 500 | 탑-k 샘플링 캡. |
| top_p | number | 0.9 | 0.1 ~ 1 | 핵 샘플링. |
| repetition_penalty | number | 1.25 | 1 ~ 2 | 높은 값은 반복적인 표현을 억제합니다. |
긴 형식, 다 스피커 팟 캐스트 대화를 위한 오픈 소스 음성 모델
EmpirioLabs에서 SoulX Podcast은(는) 종량제로 청구됩니다: 기본 정보 $0.015 1k 문자; 채용 정보 $0.015 1k 문자. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
SoulX Podcast은(는) api.empiriolabs.ai의 POST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 SoulX Podcast을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.