홈 블로그

Qwen3.8 옴니 플래시 실시간 및 Qwen 오디오 3.1 사용 방법

Qwen3.8 옴니 플래시 리얼타임 및 Qwen 오디오 3.1 리얼타임 플러스 API를 통해

Sep 21, 2026

EmpirioLabs AI

두 가지 새로운 알리바바 음성 모델이 EmpirioLabs에서 라이브 방송 중이며, 두 모델 모두 요청이 아닌 대화 형식입니다. 웹소켓을 열고 마이크 오디오를 스트리밍하면, 스피커가 계속 말하는 동안 오디오가 돌아옵니다.

Qwen3.8 옴니 플래시 실시간 또한 볼 수 있는 존재입니다. 이미 보내고 있는 오디오 외에도, 실시간 영상 프레임을 전송할 수 있고, 같은 턴에 화면에 무엇이 보이는지에 대한 질문에 답해줍니다. 56개의 목소리를 전달하며 대화 중에 당신의 기능을 호출합니다.

Qwen 오디오 3.1 리얼타임 플러스 검색을 할 수 있는 유일한 기능입니다. 세션마다 켤 수 있는 네이티브 웹 검색, 27개의 자체 음성, 그리고 256K 컨텍스트가 있습니다.

playground 중 어느 쪽이든 시도해 보세요: 옴니 플래시 실시간 또는 오디오 3.1 리얼타임 플러스. 세션 시작을 클릭하고 대화하세요.

연결

플랫폼 내 모든 모델마다 하나의 실시간 엔드포인트가 있으며, 쿼리 매개변수가 있는 모델을 선택합니다. 다른 곳에서 사용하는 동일한 API 키로 핸드셰이크를 인증하세요:

wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-omni-flash-realtime 권한: 베어러 YOUR_EMPIRIOLABS_API_KEY

프로토콜은 널리 사용되는 실시간 이벤트 형태를 따르므로, 그 규칙에 따라 작성된 클라이언트는 변경 없이 작동합니다. 소켓을 통해 세션을 구성하세요 세션.업데이트, 마이크 오디오를 다음과 같이 추가하세요 input_audio_buffer.append, 그리고 오디오를 읽어줍니다. 응답.오디오.델타 일치하는 대본이 켜져 있을 때 response.audio_transcript.델타·.

{"type": "session.update", "session": { "voice": "Tina", "modalities": ["text", "audio"] }}

오디오는 16비트 PCM으로 양방향으로 전달됩니다. 이 두 모델은 상향 16 kHz를 사용하고, 돌아오는 곳에는 24 kHz를 반환합니다. 세션.생성됨 Connect에서 받는 이벤트는 그 세션의 형식을 보고하니, 가정하지 말고 그쪽에서 읽으세요.

옴니 플래시 실시간 비디오 프레임

프레임은 오디오 버퍼 옆에 별도의 버퍼에 저장됩니다:

{"type": "input_image_buffer.append", "image": "<base64 JPEG 또는 PNG>"}

카메라 프레임처럼 보내고, 같은 음성 턴에서 무엇을 보여줄지 물어보세요. 최대 50턴과 240초의 영상 기록, 최대 100턴과 600초의 오디오를 보관합니다. 이전 기록은 그 한계를 넘으면 맥락에서 벗어나게 됩니다.

오디오 3.1에 대한 웹 검색

검색은 요청하지 않는 한 꺼져요, 세션 중에 요청해야 해요:

{"type": "session.update", "session": {"enable_search": true}}

이 기능이 켜지면 모델은 학습 후 발생한 일에 대한 질문에 답할 수 있습니다. 결과가 대화에 추가되므로, 검색이 있는 턴이 그렇지 않은 턴보다 입력 토큰 수가 눈에 띄게 많다고 보고합니다.

제품정보

두 모델 모두 각 완료된 턴을 모델이 보고한 사용량에 따라 요금을 청구하며, 오디오 토큰과 텍스트 토큰에 대해 양방향 각각 별도의 요금을 적용합니다. 이 구분이 중요합니다: 음성 응답은 주로 오디오 토큰이고, 텍스트 전용 응답을 요청할 때는 drop(drop) 언어: 영어 출처 치료 방식 진짜로 비용이 더 저렴합니다. 현재 요금은 옴니 플래시 실시간 그리고 오디오 3.1 리얼타임 플러스 모델 페이지와 가격표이 계산은 청구 금액과 동기화됩니다. 두 모델 모두 캐시된 입력 계층이 없으므로 모든 입력 토큰은 일반 요금으로 청구됩니다.

첫 세션 전에 알아야 할 것들

  • 세션이 보고한 목소리를 되돌려보지 마세요. 두 모델 모두 connect에서 음성 알림을 하는데, 자기 생성기가 거부하면 첫 턴이 종료됩니다. 음성 설정하지 않으면 플랫폼이 해당 모델의 작동 기본값을 설정하거나, 음성 목록에서 직접 하나를 선택하세요. 두 목록은 이름을 공유하지 않기 때문에, 한 목록에서 작동하는 음성 소리는 다른 목록에서 작동하지 않습니다.
  • 음성 활동 감지는 작동하기 위해 잠시 침묵이 필요합니다. 이 모델들은 당신이 말을 멈췄다고 판단합니다. 만약 클라이언트가 화자가 마지막 단어를 끝내자마자 오디오 스트림을 끊으면, 아무것도 커밋되지 않고 응답도 오지 않아 세션이 끊긴 것처럼 보입니다. 연설이 끝난 후 약 1초 정도 계속 스트리밍하세요.
  • 비디오 프레임은 메시지 내용이 아닙니다. 그들은 통과한다 input_image_buffer.append. 이미지를 안에 넣기 대화.아이템.create. 콘텐츠 배열은 거부되고, 일부 모델에서는 턴 종료 시 사용자 메시지가 전혀 표시되지 않습니다.
  • Audio 3.1에서는 웹 검색과 함수 호출이 상호 배타적입니다. 세션당 하나씩 활성화하세요, 둘 다 활성화하지 마세요.
  • 새로운 소켓은 새로운 대화입니다. 연결 간에 서버 측 메모리가 없으므로, 재연결하는 클라이언트는 모델에 남겨두고자 하는 컨텍스트를 재생해야 합니다.

전체 이벤트 테이블, 음성 목록 및 오디오 형식은 실시간 음성 API 문서들. 두 모델 모두 지금 이용 가능합니다.

더 나은 엔드포인트를 사용할 준비가 되셨나요?

저희 모델을 탐색하시거나, 비즈니스 문의, 맞춤형 배포 또는 기타 어떤 사항이든 문의해 주세요.