
6개 언어에 걸친 인간 수준의 음성 합성, 12개의 시스템 음성, 자연어 전달 방향, 스트리밍 재생 기능.
6개 언어에 걸친 인간 수준의 음성 합성, 12개의 시스템 음성, 자연어 전달 방향, 스트리밍 재생 기능.
글자 수는 StepFun 요금제를 따릅니다: 한자 하나가 한 자, 영어 글자 두 개가 한 글자, 구두점 두 개가 한 글자로 계산됩니다.
다른 이름 StepFun StepAudio 3 TTS
stepaudio-3-tts/v1/audio/speechPOST/v1/audio/speech:streamstepfun/stepaudio-3-ttsEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
StepAudio 3 TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID stepaudio-3-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs에서 StepAudio 3 TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| input | string | - | 최대 1000 | 합성할 텍스트. 최대 1,000자. 괄호 안의 내용은 전달 지시로 간주되며 말로 표현되지 않습니다. |
| voice | enum | lively-girl | lively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v... | 공식 StepFun 목소리입니다. API를 통해 맞춤 복제된 음성 ID도 허용됩니다. |
| instruction | string | - | 최대 500 | 전체 지문에 대한 전역 감정 또는 스타일 가이드, 자연어로. 최대 500자 제한. |
| speed | number | 1 | 0.5 ~ 2 | 말하기 속도. |
| volume | number | 1 | 0.1 ~ 2 | 출력 볼륨. |
| language | enum | en | en, zh, ja, ko, fr, es | 대상 언어. 일본어, 한국어, 프랑스어, 스페인어가 미리보기 중입니다. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | 출력 오디오 형식. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000 | 출력 샘플링 속도는 Hz 단위입니다. |
| markdown_filter | boolean | false | - | 입력이 말해지기 전에 마크다운 문법을 제거하세요. |
| pronunciation_map | string | - | - | 선택적 발음은 'written/spoken' 규칙의 음조 배열을 가진 객체로 덮어쓰입니다. |
최대 입력 문자는 1,000자입니다. 괄호 안의 내용은 전달 방향으로 간주되며 말로 전달되지 않습니다. 전체 감정 또는 스타일 가이드를 위한 지침은 최대 500자까지 사용할 수 있습니다. 12개의 시스템 음성이 제공되며, 맞춤형 복제 음성 ID도 허용됩니다. 인식되는 언어는 중국어, 영어, 일본어, 한국어, 프랑스어, 스페인어이며, 미리보기에서는 중국어와 영어 외의 언어도 포함되어 있습니다. 출력 형식은 mp3, wav, flac, opus, pcm(8000, 16000, 22050, 24000Hz)입니다. Wav는 스트리밍이 아닌 완전한 파일로 반환됩니다. 이 모델은 voice_label를 지원하지 않습니다.
EmpirioLabs에서 StepAudio 3 TTS은(는) 종량제로 청구됩니다: 합성 $0.36 10,000자 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
StepAudio 3 TTS은(는) api.empiriolabs.ai의 POST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 StepAudio 3 TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.