StepAudio 3 TTS API

6개 언어에 걸친 인간 수준의 음성 합성, 12개의 시스템 음성, 자연어 전달 방향, 스트리밍 재생 기능.

StepFun오디오 생성출시 2026년 9월 9일International독점 엔드포인트신규

StepAudio 3 TTS 소개

6개 언어에 걸친 인간 수준의 음성 합성, 12개의 시스템 음성, 자연어 전달 방향, 스트리밍 재생 기능.

글자 수는 StepFun 요금제를 따릅니다: 한자 하나가 한 자, 영어 글자 두 개가 한 글자, 구두점 두 개가 한 글자로 계산됩니다.

다른 이름 StepFun StepAudio 3 TTS

text to speechcontextual ttsvoice controlmultilingual

StepAudio 3 TTS 사양

모델 ID
stepaudio-3-tts
개발사
StepFun
카테고리
오디오 생성
출시
2026년 9월 9일
입력
텍스트
출력
오디오
리전
International
엔드포인트
POST/v1/audio/speechPOST/v1/audio/speech:stream
대체 모델 ID
stepfun/stepaudio-3-tts

StepAudio 3 TTS API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
합성
10,000자 단위
$0.36
전체 가격 페이지에서 비교

StepAudio 3 TTS API 호출 방법

StepAudio 3 TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID stepaudio-3-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "stepaudio-3-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "stepaudio-3-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
StepAudio 3 TTS API 전체 레퍼런스

StepAudio 3 TTS API 파라미터

EmpirioLabs에서 StepAudio 3 TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
inputstring-최대 1000합성할 텍스트. 최대 1,000자. 괄호 안의 내용은 전달 지시로 간주되며 말로 표현되지 않습니다.
voiceenumlively-girllively-girl, vibrant-youth, soft-spoken-gentleman, magnetic-v...공식 StepFun 목소리입니다. API를 통해 맞춤 복제된 음성 ID도 허용됩니다.
instructionstring-최대 500전체 지문에 대한 전역 감정 또는 스타일 가이드, 자연어로. 최대 500자 제한.
speednumber10.5 ~ 2말하기 속도.
volumenumber10.1 ~ 2출력 볼륨.
languageenumenen, zh, ja, ko, fr, es대상 언어. 일본어, 한국어, 프랑스어, 스페인어가 미리보기 중입니다.
response_formatenummp3mp3, wav, flac, opus, pcm출력 오디오 형식.
sample_rateenum240008000, 16000, 22050, 24000출력 샘플링 속도는 Hz 단위입니다.
markdown_filterbooleanfalse-입력이 말해지기 전에 마크다운 문법을 제거하세요.
pronunciation_mapstring--선택적 발음은 'written/spoken' 규칙의 음조 배열을 가진 객체로 덮어쓰입니다.

알아두면 좋은 점

최대 입력 문자는 1,000자입니다. 괄호 안의 내용은 전달 방향으로 간주되며 말로 전달되지 않습니다. 전체 감정 또는 스타일 가이드를 위한 지침은 최대 500자까지 사용할 수 있습니다. 12개의 시스템 음성이 제공되며, 맞춤형 복제 음성 ID도 허용됩니다. 인식되는 언어는 중국어, 영어, 일본어, 한국어, 프랑스어, 스페인어이며, 미리보기에서는 중국어와 영어 외의 언어도 포함되어 있습니다. 출력 형식은 mp3, wav, flac, opus, pcm(8000, 16000, 22050, 24000Hz)입니다. Wav는 스트리밍이 아닌 완전한 파일로 반환됩니다. 이 모델은 voice_label를 지원하지 않습니다.

StepAudio 3 TTS API: 자주 묻는 질문

StepAudio 3 TTS API 비용은 얼마인가요?

EmpirioLabs에서 StepAudio 3 TTS은(는) 종량제로 청구됩니다: 합성 $0.36 10,000자 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

StepAudio 3 TTS은(는) 어떤 엔드포인트를 사용하나요?

StepAudio 3 TTS은(는) api.empiriolabs.aiPOST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 StepAudio 3 TTS을(를) 사용해 볼 수 있나요?

네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 StepAudio 3 TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.

StepAudio 3 TTS API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.