대사, 효과음, 분위기, 배경 음악을 한 장면의 클립에 함께 생성합니다.
글자 수는 StepFun 요금제를 따릅니다: 한자 하나가 한 자, 영어 글자 두 개가 한 글자, 구두점 두 개가 한 글자로 계산됩니다.
다른 이름 StepFun StepAudio 3 Gen
stepaudio-3-gen/v1/audio/generationsstepaudio-3-gen-previewstepfun/stepaudio-3-genEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
StepAudio 3 Gen은(는) POST /v1/audio/generations로 실행됩니다. 요청은 즉시 job_id를 반환하며, 작업이 완료될 때까지 GET /v1/jobs/{job_id}을 폴링한 뒤 결과에서 출력 URL을 읽으세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/audio/generations \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "stepaudio-3-gen",
"prompt": "Describe what you want StepAudio 3 Gen to generate."
}'curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY"import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/generations",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={
"model": "stepaudio-3-gen",
"prompt": "Describe what you want StepAudio 3 Gen to generate.",
},
)
job = response.json()
# Generation runs as an async job. Poll until it completes.
import time
while True:
status = requests.get(
f"https://api.empiriolabs.ai/v1/jobs/{job['job_id']}",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
).json()
if status.get("status") in ("completed", "failed"):
print(status)
break
time.sleep(5)EmpirioLabs에서 StepAudio 3 Gen API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| prompt | string | - | - | 생성할 장면. 효과음이나 음악 큐를 대괄호 안에 감싸고, 전달 방향을 괄호 안에 넣으세요. |
| instruction | string | - | 최대 500 | 배경, 배경 음악, 감정적 톤에 대한 글로벌 가이드. 최대 500자 수. |
| roles | string | - | - | 이름과 음성 설명이 있는 객체로 선택적 스피커를 사용할 수 있습니다. 모든 이름과 설명을 합치면 최대 500자로 제한됩니다. |
| scripts | string | - | - | 선택적으로 순서가 정해진 줄 사용, 스피커와 텍스트가 있는 객체로 설정. 총 1,000자 제한. 다중 화자 장면에서는 프롬프트 대신 이 기능을 사용하세요. |
| response_format | enum | mp3 | mp3, wav, flac, opus, pcm | 출력 오디오 형식. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 48000 | 출력 샘플링 속도는 Hz 단위입니다. |
| speed | number | 1 | 0.5 ~ 2 | 말하기 속도. |
| volume | number | 1 | 0.1 ~ 2 | 출력 볼륨. |
| text_normalization | enum | standard | standard, enhanced | 숫자, 날짜, 기호가 소리 내어 읽히는 방식. |
장면을 설명하면 모델이 하나의 완성된 클립으로 연기합니다: 음성 대사, 효과음, 환경, 배경 음악이 함께 이루어집니다. 프롬프트를 보내거나 다중 스피커 제어를 위한 역할과 스크립트를 사용하세요. 효과음이나 음악 큐를 대괄호 안에 감고 전달 방향을 괄호 안에 표시하세요. 역할과 명령어는 각각 500자, 스크립트는 1,000자로 제한됩니다. 출력 형식은 mp3, wav, flac, opus, pcm입니다. 이 모델에서는 참조 음성과 음성 복제가 지원되지 않습니다. 이 모델은 미리보기 단계이며 기능이 변경될 수 있습니다.
EmpirioLabs에서 StepAudio 3 Gen은(는) 종량제로 청구됩니다: 생성 $0.36 10,000자 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
StepAudio 3 Gen은(는) api.empiriolabs.ai의 POST /v1/audio/generations를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 StepAudio 3 Gen을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.