
1,000개 이상의 음성, 16개 언어, 20개의 중국 방언, 자연어 전달 방향, 인라인 감정 태그를 갖춘 계층별 음성 합성.
1,000개 이상의 음성, 16개 언어, 20개의 중국 방언, 자연어 전달 방향, 인라인 감정 태그를 갖춘 계층별 음성 합성.
음성 선택은 티어에 따라 작동합니다: 기본 음성 ID는 두 티어 모두에서 작동하며 선택한 model_tier에 자동으로 매칭되고, 6개의 시스템 보이스는 한 티어에 고정됩니다. 음정은 렌더링된 오디오의 속도를 변화시키므로, 원래 재생 시간을 유지하려면 속도와 함께 설정하세요.
다른 이름 Qwen Audio TTS, Alibaba Cloud Qwen Audio 3.0 TTS
qwen-audio-3-0-tts/v1/audio/speechPOST/v1/audio/speech:streamGET/v1/voicesqwen-audio-3.0-ttsalibaba/qwen-audio-3-0-ttsqwen-audio-3.0-tts-plusqwen-audio-3.0-tts-flashEmpirioLabs 카탈로그의 실시간 종량제 요금입니다. 사용한 만큼만 결제하며 월 최소 요금이 없습니다.
Qwen Audio 3.0 TTS은(는) POST /v1/audio/speech로 음성을 생성하고 재생 가능한 오디오를 반환합니다. 말할 텍스트를 input으로, 모델 ID qwen-audio-3-0-tts와 함께 보내세요. EmpirioLabs 대시보드에서 API 키를 발급받으세요.
curl https://api.empiriolabs.ai/v1/audio/speech \
-H "Authorization: Bearer $EMPIRIOLABS_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen-audio-3-0-tts",
"input": "Welcome to EmpirioLabs. Your build just finished."
}' \
--output speech.mp3import requests
response = requests.post(
"https://api.empiriolabs.ai/v1/audio/speech",
headers={"Authorization": "Bearer YOUR_EMPIRIOLABS_API_KEY"},
json={"model": "qwen-audio-3-0-tts", "input": "Welcome to EmpirioLabs."},
)
with open("speech.mp3", "wb") as f:
f.write(response.content)EmpirioLabs에서 Qwen Audio 3.0 TTS API가 지원하는 요청 파라미터입니다. 필드를 생략하면 기본값이 적용됩니다.
| 파라미터 | 유형 | 기본값 | 범위 / 값 | 설명 |
|---|---|---|---|---|
| input | string | - | 최대 20000 | 합성할 텍스트. 요청당 최대 20,000자까지 가능합니다. [흥분], [웃음], [속삭임], [한숨], [숨참음], [비꼬는]과 같은 인라인 표현 태그를 지원합니다. |
| model_tier | enum | plus | plus, flash | 추가로: 최고 수준의 오디오 품질과 표현력, 콘텐츠 제작, 오디오북, 더빙, 브랜드 보이스 작업에 최고. 플래시: 실시간 상호작용에 최적화되어 첫 패킷 지연이 낮아 음성 비서와 라이브 에이전트에 최고. 각 등급은 자체 요금으로 청구됩니다. |
| voice | enum | loongjameszhao | loongjameszhao, loongolivialin, loonglunawang, loongnorahu, l... | 음성 프리셋. 기본 음성은 두 티어 모두에서 작동하므로 model_tier 변경해도 선택 음성이 유지됩니다. 6개의 플래그십 음성은 티어가 제한되어 있습니다: Plus의 longanlingxin과 longanlufeng, 플래시의 longanhuan_v3.6, longjielidou_v3.6,... |
| voice_id | string | - | - | 자유 형식 음성 ID로, 설정하면 음성 인식을 덮어씁니다. GET /v1/voices의 기본 음성(권장, 양 계층 모두 작동)이나 완전 자격화된 음성으로 인정합니다. 완전 자격화된 ID는 선택한 model_tier에 자동으로 매칭됩니다. |
| sample_rate | enum | 24000 | 8000, 16000, 22050, 24000, 44100, 48000 | 출력 샘플링 속도는 Hz 24000에 적합하며, 48000은 더 큰 파일 크기에서 방송 품질의 출력을 제공합니다. |
| speed | number | 1 | 0.5 ~ 2 | 말하는 속도 배율. 0.5는 반 속도, 2.0은 두 배 속도입니다. |
| pitch | number | 1 | 0.5 ~ 2 | 피치 배수. 1.0 이하일수록 음성은 낮아지고, 그 이상은 올라갑니다. 음정은 렌더링된 오디오의 속도도 변하므로, 원래 재생 시간을 유지하고 싶다면 속도와 함께 조절하세요. |
| volume | integer | 50 | 0 ~ 100 | 출력 음량, 여기서 50이 기준 레벨입니다. |
| instruction | string | - | 최대 128 | 최대 128자 전달 시 자연어 지시. 감정, 어조, 캐릭터, 속도, 말하기 스타일을 제어하며, 예를 들어 '신나고 경쾌한 톤으로 빠르게 말하기' 또는 '늦은 밤 라디오 진행자처럼 천천히 읽기' 등이 있습니다. |
| language_hints | array | - | zh, en | 혼합 언어 텍스트에 대해 발음을 편향하는 언어 코드, 예를 들어 ["zh", "en"]. 모델이 언어를 감지하도록 비설정(unset)을 유지하세요. |
| seed | integer | 0 | 0 ~ 65535 | 샘플링 시드. 동일한 입력과 설정으로 시드를 재사용해 반복 가능한 렌더를 만듭니다. |
| bit_rate | integer | 32000 | 16000 ~ 64000 | 인코더 비트레이트는 BPS로 표기됩니다. opus 포맷에만 적용되며, mp3, wav, pcm 포맷에서는 무시됩니다. |
| pronunciation | object | - | - | 발음은 문자 형태에 의해 우선 제어됩니다. 예를 들어 {"重要": "zhong4 yao4"} 등이 있습니다. 이름, 약어, 동형이의어 수정에 사용하세요. |
| replace | object | - | - | 합성 전에 적용된 문자 대환, 예를 들어 {"EmpirioLabs": "Empirio Labs"}. 브랜드명과 약어에 유용합니다. |
티어스 - 플러스: 콘텐츠 제작, 오디오북, 더빙, 브랜드 보이스 작업에 최적화된 최고 음질 및 표현력 - 플래시: 실시간 상호작용과 낮은 첫 패킷 지연, 음성 비서 및 라이브 상담원용으로 튜닝됨 - model_tier 파라미터로 전환하거나 모델 ID로 qwen-audio-3.0-tts-plus 또는 qwen-audio-3.0-tts-flash 전송 보이스 - 1,000개 이상의 기본 음성, 모두 두 티어 모두에서 이용 가능하므로 티어를 변경해도 선택한 음성이 유지됩니다 - 식스 플래그십 시스템 음성은 계층별로 구분됩니다: Plus의 longanlingxin와 longanlufeng, 플래시의 longanhuan_v3.6, longjielidou_v3.6, loongeva_v3.6, loongjohn - GET /v1/voices으로 전체 카탈로그를 탐색하고 어떤 음성이든 qwen-audio-3.0-tts-plus 0__ 전달 입력 제한 - 요청당 최대 20,000자 qwen-audio-3.0-tts-plus 1__ 최대 128자 허용 - SSML 입력은 지원되지 않음. 전달 방향에는 qwen-audio-3.0-tts-plus 2__를 사용하고, 텍스트 내에 qwen-audio-3.0-tts-plus 3__ 또는 qwen-audio-3.0-tts-plus 4__와 같은 인라인 태그를 사용하세요 청구 - 입력 텍스트의 문자 단위로 선택한 계층의 요금으로 청구됩니다
EmpirioLabs에서 Qwen Audio 3.0 TTS은(는) 종량제로 청구됩니다: 플러스 합성 $0.20 10,000자 단위; 플래시 합성 $0.15 10,000자 단위. 이 페이지의 실시간 요금표는 항상 API 청구 금액과 일치합니다.
Qwen Audio 3.0 TTS은(는) api.empiriolabs.ai의 POST /v1/audio/speech를 통해 제공되며 표준 Bearer 토큰 인증을 사용합니다.
네. EmpirioLabs 플레이그라운드에서 API와 동일한 파라미터로 Qwen Audio 3.0 TTS을(를) 브라우저에서 실행하므로 코드를 작성하기 전에 프롬프트를 테스트할 수 있습니다.
EmpirioLabs 계정을 만든 다음 대시보드의 API Keys에서 키를 생성하세요. 요금은 종량제 크레딧이라 실행한 요청에 대해서만 결제합니다.