Qwen Audio 3.0 TTS API

1,000개 이상의 음성, 16개 언어, 20개의 중국 방언, 자연어 전달 방향, 인라인 감정 태그를 갖춘 계층별 음성 합성.

Alibaba Cloud오디오 생성출시 2026년 7월 20일Singapore독점 엔드포인트신규

Qwen Audio 3.0 TTS 소개

1,000개 이상의 음성, 16개 언어, 20개의 중국 방언, 자연어 전달 방향, 인라인 감정 태그를 갖춘 계층별 음성 합성.

음성 선택은 티어에 따라 작동합니다: 기본 음성 ID는 두 티어 모두에서 작동하며 선택한 model_tier에 자동으로 매칭되고, 6개의 시스템 보이스는 한 티어에 고정됩니다. 음정은 렌더링된 오디오의 속도를 변화시키므로, 원래 재생 시간을 유지하려면 속도와 함께 설정하세요.

다른 이름 Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS

text to speechmultilingualexpressive prosodyemotion controlvoice tagsdialectlow latency

Qwen Audio 3.0 TTS 사양

모델 ID
qwen-audio-3-0-tts
개발사
Alibaba Cloud
카테고리
오디오 생성
출시
2026년 7월 20일
입력
텍스트
출력
오디오
리전
Singapore
엔드포인트
POST/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voices
대체 모델 ID
qwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flash

Qwen Audio 3.0 TTS API 요금

EmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.

유형
사양
요금
플러스 합성
10,000자 단위
$0.20
플래시 합성
10,000자 단위
$0.15
전체 가격 페이지에서 비교

Qwen Audio 3.0 TTS API 호출 방법

Qwen Audio 3.0 TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID qwen-audio-3-0-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.

cURL
curl https://api.empiriolabs.ai/v1/audio/speech \
  -H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen-audio-3-0-tts",
    "input": "Welcome to EmpirioLabs. Your build just finished."
  }' \
  --output speech.mp3
Python
import requests

response = requests.post(
    "https://api.empiriolabs.ai/v1/audio/speech",
    headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
    json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
    f.write(response.content)
Qwen Audio 3.0 TTS API 전체 레퍼런스

Qwen Audio 3.0 TTS API 파라미터

EmpirioLabs에서 Qwen Audio 3.0 TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.

파라미터유형기본값범위 / 값설명
inputstring-최대 20000합성할 텍스트. 요청당 최대 20,000자까지 가능합니다. [흥분], [웃음], [속삭임], [한숨], [숨참음], [비꼬는]과 같은 인라인 표현 태그를 지원합니다.
model_tierenumplusplus, flash추가로: 최고 수준의 오디오 품질과 표현력, 콘텐츠 제작, 오디오북, 더빙, 브랜드 보이스 작업에 최고. 플래시: 실시간 상호작용에 최적화되어 첫 패킷 지연이 낮아 음성 비서와 라이브 에이전트에 최고. 각 등급은 자체 요금으로 청구됩니다.
voiceenumloongjameszhaoloongjameszhao, loongolivialin, loonglunawang, loongnorahu, l...음성 프리셋. 기본 음성은 두 티어 모두에서 작동하므로 model_tier 변경해도 선택 음성이 유지됩니다. 6개의 플래그십 음성은 티어가 제한되어 있습니다: Plus의 longanlingxin과 longanlufeng, 플래시의 longanhuan_v3.6, longjielidou_v3.6,...
voice_idstring--자유 형식 음성 ID로, 설정하면 음성 인식을 덮어씁니다. GET /v1/voices의 기본 음성(권장, 양 계층 모두 작동)이나 완전 자격화된 음성으로 인정합니다. 완전 자격화된 ID는 선택한 model_tier에 자동으로 매칭됩니다.
sample_rateenum240008000, 16000, 22050, 24000, 44100, 48000출력 샘플링 속도는 Hz 24000에 적합하며, 48000은 더 큰 파일 크기에서 방송 품질의 출력을 제공합니다.
speednumber10.5 ~ 2말하는 속도 배율. 0.5는 반 속도, 2.0은 두 배 속도입니다.
pitchnumber10.5 ~ 2피치 배수. 1.0 이하일수록 음성은 낮아지고, 그 이상은 올라갑니다. 음정은 렌더링된 오디오의 속도도 변하므로, 원래 재생 시간을 유지하고 싶다면 속도와 함께 조절하세요.
volumeinteger500 ~ 100출력 음량, 여기서 50이 기준 레벨입니다.
instructionstring-최대 128최대 128자 전달 시 자연어 지시. 감정, 어조, 캐릭터, 속도, 말하기 스타일을 제어하며, 예를 들어 '신나고 경쾌한 톤으로 빠르게 말하기' 또는 '늦은 밤 라디오 진행자처럼 천천히 읽기' 등이 있습니다.
language_hintsarray-zh, en혼합 언어 텍스트에 대해 발음을 편향하는 언어 코드, 예를 들어 ["zh", "en"]. 모델이 언어를 감지하도록 비설정(unset)을 유지하세요.
seedinteger00 ~ 65535샘플링 시드. 동일한 입력과 설정으로 시드를 재사용해 반복 가능한 렌더를 만듭니다.
bit_rateinteger3200016000 ~ 64000인코더 비트레이트는 BPS로 표기됩니다. opus 포맷에만 적용되며, mp3, wav, pcm 포맷에서는 무시됩니다.
pronunciationobject--발음은 문자 형태에 의해 우선 제어됩니다. 예를 들어 {"重要": "zhong4 yao4"} 등이 있습니다. 이름, 약어, 동형이의어 수정에 사용하세요.
replaceobject--합성 전에 적용된 문자 대환, 예를 들어 {"EmpirioLabs": "Empirio Labs"}. 브랜드명과 약어에 유용합니다.
문서에 파라미터 2개 더 있음

알아두면 좋은 점

티어스 - 플러스: 콘텐츠 제작, 오디오북, 더빙, 브랜드 보이스 작업에 최적화된 최고 음질 및 표현력 - 플래시: 실시간 상호작용과 낮은 첫 패킷 지연, 음성 비서 및 라이브 상담원용으로 튜닝됨 - model_tier 파라미터로 전환하거나 모델 ID로 qwen-audio-3.0-tts-plus 또는 qwen-audio-3.0-tts-flash 전송 보이스 - 1,000개 이상의 기본 음성, 모두 두 티어 모두에서 이용 가능하므로 티어를 변경해도 선택한 음성이 유지됩니다 - 식스 플래그십 시스템 음성은 계층별로 구분됩니다: Plus의 longanlingxin와 longanlufeng, 플래시의 longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn - GET /v1/voices으로 전체 카탈로그를 탐색하고 어떤 음성이든 qwen-audio-3.0-tts-plus 0__ 전달 입력 제한 - 요청당 최대 20,000자 qwen-audio-3.0-tts-plus 1__ 최대 128자 허용 - SSML 입력은 지원되지 않음. 전달 방향에는 qwen-audio-3.0-tts-plus 2__를 사용하고, 텍스트 내에 qwen-audio-3.0-tts-plus 3__ 또는 qwen-audio-3.0-tts-plus 4__와 같은 인라인 태그를 사용하세요 청구 - 입력 텍스트의 문자 단위로 선택한 계층의 요금으로 청구됩니다

Qwen Audio 3.0 TTS API: 자주 묻는 질문

Qwen Audio 3.0 TTS API 비용은 얼마인가요?

EmpirioLabs에서 Qwen Audio 3.0 TTS은(는) 종량제로 청구됩니다: 플러스 합성 $0.20 10,000자 단위; 플래시 합성 $0.15 10,000자 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.

Qwen Audio 3.0 TTS은(는) 어떤 엔드포인트를 사용하나요?

Qwen Audio 3.0 TTS은(는) api.empiriolabs.aiPOST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.

통합하기 전에 브라우저에서 Qwen Audio 3.0 TTS을(를) 사용해 볼 수 있나요?

네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Qwen Audio 3.0 TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.

Qwen Audio 3.0 TTS API 키는 어떻게 발급받나요?

EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 가격을 확인하시거나 저희 스택에 자체 모델을 배포하고 싶으시면 연락해 주세요.