블로그

Qwen 오디오 3.0 TTS API를 사용하는 방법

EmpirioLabs 에서 API를 통해 Qwen 오디오 3.0 TTS

Jul 23, 2026

EmpirioLabs AI

Qwen 오디오 3.0 TTS는 EmpirioLabs 에서 사용할 수 있습니다. Alibaba의 연설 합성 모형이고, 우리는 층 스위치를 가진 단 하나 모형으로 발송합니다: 더 높은 오디오 질 및 표현, 더 낮은 첫번째 포장 대기권과 가진 순간 상호 작용을 위한 섬광 플러스. tiers 둘 다 동일한 모수 및 동일한 음성 도서관을 공유합니다, 그래서 당신은 한개의 분야를 가진 음성을 한 번 선택하고 tiers를 바꾸십시오.

Qwen 오디오 3.0 TTS가 좋은 점

그것은 포함 16 언어, 아랍어, 중국어, 영어, 프랑스어, 독일어, 인도네시아어, 이탈리아어, 일본어, 한국어, 말레이어, 포르투갈어, 러시아어, 스페인어, 타갈로그, 타이어, 베트남어, 플러스 20 중국 방언 지구. 납품은 2가지의 방법을 지시합니다: 일반 영어 이름 * 감정, 음색, 문자, 속도, 그리고 스타일 전체 렌더링, 및 인라인 태그 등 [예금]·, [수퍼]·, [웃음], 또는 [기타] 본문으로 떨어졌다.

음성 라이브러리는 계층 스위치가 무통 이유입니다. 1,000개 이상의 기본 음성이 있고, 그 중 모든 사람이 같은 id 아래 계층에 존재하므로 Plus와 Flash 사이 이동은 누구가 말하는 것을 변경하지 않습니다. 그 위에, 각 층은 자체의 주력 시스템 목소리의 작은 세트가 있습니다.

자주 묻는 질문

표준 OpenAI 모양의 연설 엔드 포인트이므로 대부분의 클라이언트는 하나의 기본 URL 변경이 필요합니다.

컬 https://api.empiriolabs.ai/v1/audio/speech \ -H "Authorization: Bearer $EMPIRIOLABS API KEY" \ -H "Content-Type: application/json " \ -d '{ "model": " qwen-audio-3-0-tts ", "model tier": "flash", "input": "[excited] 결과에, 그리고 그들은 우리의 예측을 이길![웃음], "voice": "loongjameszhao", "instruction": "자막, 열광 톤에서 빨리 말", "response format": "mp3", "sample rate": 24000 }'

서명된 오디오 URL을 다시 가져옵니다. 출력은 MP3, WAV, headerless PCM 및 Opus를, 8 kHz에서 48 kHz까지 샘플 속도로 지원합니다. 속도, 피치, 볼륨 및 씨앗은 이름과 약어, 브랜드 이름의 리터 텍스트 교체 및 Markdown 필터와 함께 모든 노출되어 문자를 읽지 못합니다.

전체 음성 카탈로그를 검색하려면 전화 GET /v1/voices. 그것은 언어, 성별, 계층 및 음성 이름, 특색 및 사용 사례를 통해 무료 텍스트 검색에 의해 필터링을 지원합니다.

당신이 빌드하기 전에 알아야 할 세 가지

기본 음성은 계층 호환, 시스템 음성은 없습니다. 모든 기본 음성 id는 Plus와 Flash 모두에서 작동하므로 A/B 음성을 가진 계층을 열 수 있습니다. 6개의 주력 시스템 음성은 1개의 층에 각각 잠겨 있고, 당신이 틀린 층에 하나를 보낼 경우에 API는 당신이 그것에게 오히려 vaguely 실패 보다는 그것을 봉사한다는 것을 말합니다.

SSML은 이 모델에 의해 지원되지 않습니다. 사용 이름 * 글로벌 배송 방향 및 인라인 태그를 현지 표현 변경. 그 조합은 SSML에 어떤 사람들의 도달의 대부분을 커버하고, 저자가 쉽게.

피치는 또한 속도를 변화합니다. 더 낮은 피치는 클립을 펴고 클립을 압축하므로 원래 기간에 다른 피치를 원한다면 조정하십시오. 속도: 관련 기사

가격 및 시작

빌링은 입력 텍스트의 문자, 어느 계층을 선택, 그리고 그것은 pay-as-you-go 입니다. 섬광은 2의 더 싼입니다. 계층 모두의 현재 속도는 Qwen 오디오 3.0 TTS 모델 페이지 · 가격표·.

코드를 작성하지 않고 시도 할 수 있습니다. 팟캐스트, tier 스위치가 있는 곳에, 음성 피커 및 각 모수는 살아있는 통제입니다. 가득 차있는 모수 참고는 안으로 입니다 API 문서·.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 모델을 탐색하시거나, 비즈니스 문의, 맞춤형 배포 또는 기타 어떤 사항이든 문의해 주세요.