홈 블로그

Qwen Audio 3.0 TTS API 사용 방법

Qwen Audio 3.0 API TTS on EmpirioLabs

Jul 23, 2026

EmpirioLabs AI

Qwen Audio 3.0 TTS는 EmpirioLabs에서 이용 가능합니다. 이것은 알리바바의 음성 합성 모델로, 우리는 티어 스위치를 가진 단일 모델로 출시합니다: 최고 음질과 표현력을 위해 플러스, 첫 패킷 지연 시간이 더 짧은 실시간 상호작용을 위한 플래시. 두 티어는 동일한 파라미터와 같은 음성 라이브러리를 공유하므로, 한 번 선택한 음성 중 하나의 필드로 티어를 변경하면 됩니다.

Qwen Audio 3.0 TTS가 잘하는 점

아랍어, 중국어, 영어, 프랑스어, 독일어, 인도네시아어, 이탈리아어, 일본어, 한국어, 말레이어, 포르투갈어, 러시아어, 스페인어, 타갈로그어, 태국어, 베트남어 등 16개 언어와 20개의 중국어 방언 지역을 포함합니다. 전달은 두 방향으로 진행됩니다: 평범한 영어 교육 전체 렌더링의 감정, 톤, 캐릭터, 속도, 스타일을 설정하고, 다음과 같은 인라인 태그를 사용합니다 [신나]·, [속삭임]·, [웃음], 또는 [한숨] 문장 중간에 표정을 바꾸기 위해 바로 텍스트로 들어갔다.

음성 라이브러리 덕분에 티어 전환이 쉬워졌어요. 기본 음성은 1,000개가 넘으며, 모두 같은 ID 아래 두 티어에 존재하기 때문에 Plus와 Flash 사이를 이동해도 말하는 사람이 변하지 않습니다. 그 위에 각 계층은 자체 대표적인 시스템 음성들을 소규모로 갖추고 있습니다.

요청하기

표준 OpenAI 형태의 음성 엔드포인트이기 때문에 대부분의 클라이언트는 기본 URL 변경 하나만 필요합니다:

curl https://api.empiriolabs.ai/v1/audio/speech \ -h "인증: 베어러 $EMPIRIOLABS_API_KEY" \ -h "콘텐츠-유형: application/json" \ -d '{ "model": "qwen-audio-3-0-tts", "model_tier": "flash", "input": "[흥분], 결과가 나왔고, 우리의 예측을 뛰어넘었어요![ 웃음], "목소리": "롱자메스자오", "지시": "빠르고 열정적인 어조로 말하세요", "response_format": "mp3", "sample_rate": 24000 }''

서명된 오디오 URL을 받게 됩니다. 출력은 MP3, WAV, 헤더리스 PCM, Opus를 지원하며, 8kHz에서 48kHz까지 샘플 레이트를 제공합니다. 속도, 음정, 볼륨, 시드 등이 모두 노출되며, 이름과 약어의 발음 덮개, 브랜드명에 대한 문자 대체, 그리고 서식화 문자가 소리 내어 읽히지 않도록 마크다운 필터도 포함되어 있습니다.

전체 음성 카탈로그를 열람하려면 전화 빨리 /v1/voices. 언어, 성별, 등급별 필터링을 지원하며, 음성 이름, 특성, 사용 사례에 대한 자유 텍스트 검색도 지원합니다.

건축 전에 알아야 할 세 가지

기본 음성은 계층별 이식 가능하지만, 시스템 음성은 그렇지 않습니다. 기본 음성 ID는 Plus와 Flash 모두에서 작동하므로, 음성을 일정하게 유지한 상태에서 티어를 A/B 수 있습니다. 여섯 개의 플래그십 시스템 음성은 각각 한 티어에 묶여 있고, 잘못된 티어로 보내면 API가 어느 티어를 서비스하는지 알려줍니다.

이 모델에서는 SSML을 지원하지 않습니다. 사용 교육 전역 전달 방향과 로컬 표현 변경을 위한 인라인 태그를 사용합니다. 이 조합이 사람들이 SSML에서 하려는 대부분의 기능을 포함하고, 작성하기도 더 쉽습니다.

음정도 속도를 바꿉니다. 음정을 낮추면 클립이 늘어나고, 올라가면 클립이 압축되니, 원래 길이에서 다른 음정을 원한다면 조정하세요 속도 보상하기 위해서.

가격 책정과 시작 방법

청구는 입력 텍스트의 문자 한 자자당 선택한 계층에서 계산되며, pay-as-you-go입니다. 플래시가 두 제품 중 더 저렴합니다. 두 등급 모두 현재 요금은 Qwen 오디오 3.0 TTS 모델 페이지 그리고 계속 가격 페이지·.

코드를 작성하지 않고도 시도해볼 수 있습니다. 팟캐스트, 여기서 티어 스위치, 보이스 피커, 그리고 모든 매개변수는 실시간 컨트롤입니다. 전체 매개변수 참조는 API 문서·.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 모델을 탐색하시거나, 비즈니스 문의, 맞춤형 배포 또는 기타 어떤 사항이든 문의해 주세요.