Qwen3.8 옴니 플래시는 알리바바의 옴니 입력 플래시 모델로, 텍스트, 이미지, 오디오, 비디오를 읽고 텍스트로 답변합니다. 기본적으로 켜져 있는 1M 토큰 컨텍스트, 함수 호출, 엄격한 JSON 스키마 구조화 출력, 그리고 웹 검색이라는 내장 도구를 포함하고 있습니다.
Qwen3.8 옴니 플래시는 오늘 OpenAI 호환 API를 통해 EmpirioLabs에서 라이브 제공되며, 스트리밍과 최대 128K 출력 토큰을 지원합니다. 다음에서 시도해 보세요 뚱 베어 또는 OpenAI 호환 클라이언트에서 호출. 전체 사양과 현재 비율은 Qwen3.8 옴니 플래시 모델 페이지 그리고 API 문서·.
같은 출시 시 배송은 Qwen3.8 라이브랜트 플래시 실시간: WebSocket을 통한 음성 번역. 대상 언어를 설정하고, 말하면 모델이 해당 언어로 텍스트와 오디오로 응답합니다. 다음에서 엽니다 뚱 베어 또는 다음 wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime. 자세한 내용은 실시간 음성 API 페이지.
제품정보
옴니 플래시 청구는 사용 기준으로, 모든 프롬프트 크기마다 하나의 고정 입력 속도와 하나의 고정 출력 비율이 적용됩니다. 오디오 및 비디오 토큰은 텍스트와 동일한 입력 속도를 사용합니다; 비디오의 사운드트랙은 비디오 토큰과 함께 오디오 토큰으로 계산됩니다. 웹 검색은 통화당 소액의 수수료를 추가하며, 이는 실제로 통화가 실행될 때만 적용됩니다. 생각하는 토큰은 출력 토큰으로 청구됩니다.
LiveTranslate는 모델이 보고한 사용량을 기준으로 각 턴마다 청구하며, 오디오 토큰과 텍스트 토큰에 대해 별도의 요금이 적용됩니다. 두 모델 모두 현재 요금은 항상 그들의 기준에 존재합니다. 모델 페이지 그리고 가격표, 당신이 청구 된 것과 동기화에 머물.
퀵스타트
EmpirioLabs 기본 URL에서 OpenAI SDK를 포인트로 전달 qwen3-8-omni-flash 모형으로:
openai로부터 가져오기 OpenAI client = OpenAI(base_url="https://api.empiriolabs.ai/v1", api_key="YOUR_EMPIRIOLABS_API_KEY",) resp = client.chat.completions.create(model="qwen3-8-omni-flash", messages=[ {"role": "user", "content": [ {"type": "text", "text": "무엇이 말해지고 있고, 화면에 무엇이 있는가?"}, {"type": "input_audio", "input_audio": { "format": "mp3", "data": "https://example.com/clip.mp3", }}, ]}, ], extra_body={"enable_thinking": True, "thinking_budget": 8192},) print(resp.choices[0].message.content)
동일 모델에서 id가 작동합니다 /v1/responses 에, 인류형 /v1/messages 에, 그리고 구글 호환 /v1beta/models/qwen3-8-omni-flash:생성 콘텐츠 경로. 대체 ID qwen3.8-omni-flash 동일한 모델로 해결됩니다.
WebSocket을 통한 LiveTranslate
LiveTranslate는 HTTP가 아닙니다. 다른 곳에서 사용하는 것과 같은 API 키로 실시간 소켓에 연결한 후, 세션.업데이트 이 방법은 어떤 오디오 앞에 목표 언어를 설정하는지:
{"type": "session.update", "session": { "voice": "Tina", "translation": {"language": "en"}, "modalities": ["text", "audio"] }}
그 다음 마이크 오디오를 다음과 같이 추가하세요 input_audio_buffer.append 이벤트. 모델이 당신이 말하는 대로 번역되고 오디오가 다시 스트리밍됩니다. 이 모델의 목소리는 티나, 세레나, 이선, 신디입니다. 대체 아이드 qwen3.8-livetranslate-flash-realtime 동일한 모델로 해결됩니다. 이 슬러그에 대한 채팅 완료 호출은 거부됩니다; 유일하게 광고된 엔드포인트는 소켓입니다.
사고
Omni Flash에서는 기본적으로 딥 스팅이 켜져 있고 스트리밍으로 돌아옵니다 사이트 맵 답변과 함께. 다음으로 제어합니다 enable thinking을 활성화 그리고 thinking_budget (최대 262,144개의 토큰까지), 또는 전송 이유 effort 플랫폼은 모델을 예산 크기에 매핑합니다. 생각하는 토큰은 출력 토큰으로 청구되므로, 생각을 비활성화하거나 짧고 지연에 민감한 턴에 대한 작은 예산을 설정하세요.
내장 도구
옴니 플래시 웹 검색 뒤에 있습니다 tool_web_search 에 그리고 기본값으로 꺼져 있습니다. 이 모델은 웹 추출기, 코드 해석기, 이미지 검색 도구를 노출하지 않습니다. 검색이 실행될 때, 응답은 usage.tool_usage MAP은 정확한 통화 수를 보고하여 도구별 청구를 감사할 수 있습니다. 한 번의 요청이 검색을 여러 번 호출할 수 있으며, 호출된 통화마다 청구됩니다. LiveTranslate는 웹 검색이 없습니다.
구조화된 출력
Omni Flash에서 정확한 응답 형태를 원한다면, 패스하세요 response_format 이름 * {"type": "json_schema",...} 그리고 "엄격": 참: 모델은 스키마의 키를 정확히 반환하며 추가 요소 없이 반환합니다. 일반 JSON 모드 {"type": "json_object"} 또한 지원됩니다.
첫 통화 전에 알아야 할 사항들
- 옴니 플래시는 오디오와 비디오를 읽고, 텍스트로 응답합니다. 오디오 출력을 요청하지 마세요. 그 모델에는 음성 제어가 없습니다.
- Omni Flash 오디오를 URL이나 base64 데이터 URI로 보내세요. 중첩
input_audio.data반드시 URL 또는데이터:URI이지, 원시 base64가 아닙니다. playground MP3 업로드는포맷: "mpeg"; 별칭으로MP3·. tool_choice: "필수"생각이 켜져 있을 때는 작동하지 않습니다. 요청은 명백한 오류와 함께 거절됩니다. 지키세요tool_choice: "자동"생각이 활성화된 상태, 또는 설정된 상태에서enable_thinking: 거짓함수 호출을 강제해야 할 때.- LiveTranslate는 첫 세션에서 목표 언어가 필요합니다.update. 이 기능이 없으면 오디오가 생성되기 전에 소켓이 닫힙니다. 소스 언어를 설정하지 않은 상태로 두면 자동 감지가 가능합니다.
두 모델 모두 현재 playground 및 EmpirioLabs API·.



