Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS는 EmpirioLabs에서 이용 가능합니다. 둘 다 텍스트를 음성으로 변환합니다 /v1/audio/speech 이후, 오디오 스트림 /v1/audio/speech:stream 이후그리고 2,000개 이상의 음색으로 이루어진 동일한 라이브러리를 사용합니다. 두 기능 모두 API와 Playground에서 작동합니다.
두 모델
gemini-3-8-flash-tts창의적인 방향성, 내레이션, 오디오북, 캐릭터, 그리고 두 명의 화자 장면을 위해 만들어졌습니다. 130개 언어를 다룹니다.gemini-3-8-flash-lite-tts음성 에이전트, 더빙, 대량 오디오 작업과 같은 대량 작업을 위해 설계되었으며, 생성된 오디오는 더 낮은 요금을 제공합니다. 101개 언어를 커버합니다.
두 모델 모두 동일한 요청 본체를 받기 때문에, 서로 전환할 때 다음 조건이 변경됩니다 모델 번호:·.
당신의 첫 번째 요청
curl https://api.empiriolabs.ai/v1/audio/speech \ -h "인증: 보유자 $EMPIRIOLABS_API_KEY" \ -h "내용 유형: application/json" \ -d '{ "모델": "gemini-3-8-flash-tts", "입력": "다시 돌아오신 것을 환영합니다. <짧은 정지> 이번 주에 바뀐 점입니다.", "목소리": "코레", "style_prompt": "따뜻하고 서두르지 않은" }'
응답은 생성된 오디오에 서명된 URL을 포함합니다. 기본 형식은 24,000 Hz의 WAV입니다. Set output_format 로 MP3·, 오그·, 알라우, 또는 무를로, 그리고 sample_rate 8,000, 16,000, 22,050, 24,000, 44,100, 또는 48,000 Hz 중 어느 곳이든 가능합니다.
공연 연출
- 스타일 방향.
style_prompt예를 들어 "차분하고 안심시키는 사람" 또는 "흥분한 스포츠 해설자"처럼 전체 지문의 분위기를 설정합니다. - 음성 태그. 다음과 같은 태그
<laugh>·,<sigh>·,<breath>, 그리고<잠시 멈춤>소리가 나야 할 곳으로 가세요. 전체 목록은입력모델 참조 내의 매개변수를 사용하세요. 텍스트가 다른 언어로 되어 있어도 영어 태그를 사용하세요. - 강조. 강조하기 위해 단어를 대문자로 쓰세요.
두 화자 대화
설치하기 모드 로 멀티, 각 화자에게 음성을 선택하세요. 목소리 그리고 목소리2, 그리고 모든 줄을 화자의 이름과 콜론으로 시작한다. 이름이 일치해야 한다 speaker1_name 그리고 speaker2_name, 기본값은 화자1 그리고 화자2·.
{ "모델": "gemini-3-8-flash-lite-tts", "모드": "멀티", "speaker1_name": "마야", "speaker2_name": "테오", "voice": "Aoede", "voice2": "Puck", "입력": "마야: 배송 도착했나요?" \nTheo: 도착했어요.<laugh> 모든 상자, 제시간에 도착했어요." }
목소리 선택
30명의 목소리가 목소리 Kore, Puck, Charon, Aoede 같은 목록은 지원되는 모든 언어를 구사합니다. 전체 라이브러리에는 30개 지역에 걸쳐 2,000개 이상의 음성을 담고 있으며, 각 음성에는 언어, 억양, 성별, 음높이, 설명이 있습니다. 다음과 같이 나열하세요 빨리 /v1/voices 그리고 필터링 언어·, 성별·, 음정, 또는 다음 검색어를 q::
curl "https://api.empiriolabs.ai/v1/voices?model=gemini-3-8-flash-tts&language=fr&gender=female" \ -h "권한: 베어러 $EMPIRIOLABS_API_KEY"
리스팅이 반환하는 어떤 음성 ID든 작동합니다 목소리 그리고 목소리2·.
스트리밍
/v1/audio/speech:stream 이후 동일한 몸체를 가져와 서버-전송 이벤트를 반환합니다: 오디오.청크 오디오가 생성될 때 base64 16비트 PCM을 24,000 Hz로 운반하는 이벤트, 그리고 1 오디오.완료 요청된 형식의 완전한 파일 링크가 포함된 이벤트입니다.
운용 노트
- Gemini 3.1 Flash TTS용으로 작성된 스크립트는 태그를 다시 작성해야 합니다. 3.8 모델은 다음과 같은 괄호 태그를 사용합니다.
<whispers>그리고<laugh>3.1에서 사용하는 대괄호 태그 대신에 스크립트를 이동할 때 태그를 업데이트하세요. - 도서관 목소리는 자신만의 언어를 유지한다. 네가 세팅할 때
언어라이브러리 보이스와 함께, 그 보이스의 위치가 반드시 필요합니다:fr-fr-advisor-1이름 *미국거부됩니다. 30개의 다국어 목소리는 어떤 언어든 받아들입니다. - 대화 라벨은 화자 이름과 일치해야 합니다. 에서
멀티모드, 첫 번째 라벨이 붙은 줄 앞의 텍스트가 거부되고, 라벨이 두 줄과 일치하지 않는 줄은 제외됩니다speaker1_name아니요speaker2_name이전 턴의 일부로 읽힙니다. 속도완전한 파일에 적용됩니다. 스트리밍 엔드포인트는 다음을 거부합니다.속도1.0을 제외하고. 파일을 요청합니다./v1/audio/speech 이후다른 속도가 필요할 때.
제품정보
두 모델 모두 구독이 없는 선불 방식입니다. 요청은 입력 텍스트 토큰과 생성된 오디오에 대해 초당 32개의 오디오 토큰으로 청구되며, Flash-Lite는 생성된 오디오에 대해 더 낮은 요금을 제공합니다. 현재 요금은 모델 페이지에 있습니다 제미니 3.8 플래시 TTS 그리고 제미니 3.8 플래시-라이트 TTS 그리고 가격표·.
건설 시작
시도해 봐 제미니 3.8 플래시 TTS 또는 제미니 3.8 플래시-라이트 TTS Playground에서 API 참조를 읽어보세요. 플래시 그리고 플래시-라이트·.
같은 계열의 실시간 음성 대화는 다음을 참조하세요 Gemini 3.8 라이브 및 라이브 확장 사고 사용 방법·.
공개: 이 문서는 AI 지원으로 작성되었으며 EmpirioLabs AI에 의해 검토되었습니다.



