Qwen3.8 Omni Flash 是阿里巴巴的全输入 Flash 模型:它能读取文本、图片、音频和视频,并以文本回答。它自带 1M 令牌上下文,默认开启,函数调用,严格的 JSON Schema 结构化输出,以及内置工具, 网页搜索。
Qwen3.8 Omni Flash 今天通过兼容 OpenAI 的 API 上线EmpirioLabs,支持流媒体和最多 128K 个输出令牌。试试看 操场 或者从任何 OpenAI 兼容客户端调用它。 全部谱率和当前率 Qwen3.8 Omni Flash 型号页面 页:1 API 文档。 。 。.
同一发售时的发货方式是 Qwen3.8 LiveTranslate Flash 实时:通过WebSocket进行口语翻译。设置目标语言,说话,模型会用该语言回复文本和音频。在 操场 或连接到 wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime.详情可在线查看 实时语音API 侍从。
定价
Omni Flash的计费基于使用,每个提示大小都采用固定输入速率和统一输出速率。音频和视频令牌使用与文本相同的输入率;视频的音轨与其视频令牌一起计入音频令牌。网页搜索会增加少量每次通话费用,仅在通话实际运行时生效。思维令牌按输出令牌计费。
LiveTranslate 的账单每回合都基于模型报告的使用情况,音频令牌和文本令牌分别有不同的费率。两种模型的当前费率始终存在于 模型页面 页:1 定价页面,它与你被控的罪行保持同步.
快速启动
将 OpenAI SDK 指向 EmpirioLabs 基础 URL并通过 qwen3-8-omni-flash 作为模式:
从 openai 导入 OpenAI 客户端 = OpenAI( base_url=“https://api.empiriolabs.ai/v1", api_key=”YOUR_EMPIRIOLABS_API_KEY“, ) resp = client.chat.completions.create( model=”qwen3-8-omni-flash“, messages=[ {”role“: ”user“, ”content“: [ {”type“: ”text“, ”text“: ”屏幕上有什么内容?“}, {”type“: ”input_audio“, ”input_audio“: { ”format“: ”mp3“, ”data“: ”https://example.com/clip.mp3", }}, ]}, ], extra_body={“enable_thinking”: True, “thinking_budget”: 8192}, ) print(resp.choices[0].message.content)
同一个型号ID也适用于 /v1/responses (英语),类人形态 /v1/messages (英语),以及谷歌兼容的 /v1beta/models/qwen3-8-omni-flash:生成内容 路线。备用ID(替代ID) qwen3.8-omni-flash 解析为同一模型。
通过WebSocket进行LiveTranslate
LiveTranslate不是HTTP。用你在其他地方用的API密钥连接到实时套接字,然后发送 session.update 它在任何音频之前设置目标语言:
{“type”: “session.update”, “session”: { “voice”: “Tina”, “translation”: {“language”: “en”}, “modalities”: [“text”, “audio”] }}
然后将麦克风音频附加为 input_audio_buffer.append 事件。模型在你说话时翻译并流回音频。该模型的声音包括蒂娜、塞丽娜、伊桑和辛迪。替代身份 qwen3.8-livetranslate-flash-realtime 解析为同一模型。对该 slug 进行聊天完成调用被拒绝;唯一被通告的端点是套接字。
思考
在Omni Flash上,深度思考默认开启,并以 推理(c) 同时也在回答中。控制它: 启用 思考 以及 thinking_budget (最多262,144个令牌),或发送 推理(e) 平台会将其映射到模型预算大小。思考标记作为输出标记计费,所以关闭思考,或者为短暂且有延迟的回合设定小预算。
内置工具
Omni Flash 的网络搜索 tool_web_search (英语) 默认情况下,且关闭。该模型不暴露网页提取器、代码解释器或图像搜索工具。搜索运行时,响应为 usage.tool_usage Map 会准确报告通话数量,方便您审核每个工具的计费。一个请求可以多次调用搜索,并且每次调用都会计费。LiveTranslate 没有网页搜索功能。
结构化输出
如果想在Omni Flash上获得精确的响应形态,可以跳过 response_format 与 {“type”: “json_schema”,...} 以及 “严格”:真:模型返回的键完全相同,没有额外内容。纯JSON模式,其中 {“类型”:“json_object”} 也支持。
第一次打电话前值得了解的事情
- Omni Flash 读取音频和视频,并以文本回复。 不要请求音频输出。该型号没有语音控制。
- 将Omni Flash音频发送为URL或base64数据URI。 嵌套
input_audio.data必须是 URL 或数据:URI,不是原始的base64。playgroundMP3上传会使用格式:“mpeg”;该别名为mp3。 。 。. tool_choice:“必须”思考时不起作用。 请求被拒绝,显示明显错误。守tool_choice:“自动”在思考被启用或设定的情况下enable_thinking:错误当你需要强制调用函数时,- LiveTranslate 在第一次会话时需要一个目标语言。更新。 没有它,套接字会在产生任何音频前关闭。保持源语言未设置以实现自动检测。
这两款车型现已在playground及 EmpirioLabs API。 。 。.



