首页 博客

如何使用Qwen3.8 Omni Flash和LiveTranslate

Qwen3.8 Omni Flash 和 LiveTranslate 通过 API

Sep 18, 2026

EmpirioLabs AI

Qwen3.8 Omni Flash 是阿里巴巴的全输入 Flash 模型:它能读取文本、图片、音频和视频,并以文本回答。它自带 1M 令牌上下文,默认开启,函数调用,严格的 JSON Schema 结构化输出,以及内置工具, 网页搜索。

Qwen3.8 Omni Flash 今天通过兼容 OpenAI 的 API 上线EmpirioLabs,支持流媒体和最多 128K 个输出令牌。试试看 操场 或者从任何 OpenAI 兼容客户端调用它。 全部谱率和当前率 Qwen3.8 Omni Flash 型号页面 页:1 API 文档。 。 。.

同一发售时的发货方式是 Qwen3.8 LiveTranslate Flash 实时:通过WebSocket进行口语翻译。设置目标语言,说话,模型会用该语言回复文本和音频。在 操场 或连接到 wss://api.empiriolabs.ai/v1/realtime?model=qwen3-8-livetranslate-flash-realtime.详情可在线查看 实时语音API 侍从。

定价

Omni Flash的计费基于使用,每个提示大小都采用固定输入速率和统一输出速率。音频和视频令牌使用与文本相同的输入率;视频的音轨与其视频令牌一起计入音频令牌。网页搜索会增加少量每次通话费用,仅在通话实际运行时生效。思维令牌按输出令牌计费。

LiveTranslate 的账单每回合都基于模型报告的使用情况,音频令牌和文本令牌分别有不同的费率。两种模型的当前费率始终存在于 模型页面 页:1 定价页面,它与你被控的罪行保持同步.

快速启动

将 OpenAI SDK 指向 EmpirioLabs 基础 URL并通过 qwen3-8-omni-flash 作为模式:

从 openai 导入 OpenAI 客户端 = OpenAI( base_url=“https://api.empiriolabs.ai/v1", api_key=”YOUR_EMPIRIOLABS_API_KEY“, ) resp = client.chat.completions.create( model=”qwen3-8-omni-flash“, messages=[ {”role“: ”user“, ”content“: [ {”type“: ”text“, ”text“: ”屏幕上有什么内容?“}, {”type“: ”input_audio“, ”input_audio“: { ”format“: ”mp3“, ”data“: ”https://example.com/clip.mp3", }}, ]}, ], extra_body={“enable_thinking”: True, “thinking_budget”: 8192}, ) print(resp.choices[0].message.content)

同一个型号ID也适用于 /v1/responses (英语),类人形态 /v1/messages (英语),以及谷歌兼容的 /v1beta/models/qwen3-8-omni-flash:生成内容 路线。备用ID(替代ID) qwen3.8-omni-flash 解析为同一模型。

通过WebSocket进行LiveTranslate

LiveTranslate不是HTTP。用你在其他地方用的API密钥连接到实时套接字,然后发送 session.update 它在任何音频之前设置目标语言:

{“type”: “session.update”, “session”: { “voice”: “Tina”, “translation”: {“language”: “en”}, “modalities”: [“text”, “audio”] }}

然后将麦克风音频附加为 input_audio_buffer.append 事件。模型在你说话时翻译并流回音频。该模型的声音包括蒂娜、塞丽娜、伊桑和辛迪。替代身份 qwen3.8-livetranslate-flash-realtime 解析为同一模型。对该 slug 进行聊天完成调用被拒绝;唯一被通告的端点是套接字。

思考

在Omni Flash上,深度思考默认开启,并以 推理(c) 同时也在回答中。控制它: 启用 思考 以及 thinking_budget (最多262,144个令牌),或发送 推理(e) 平台会将其映射到模型预算大小。思考标记作为输出标记计费,所以关闭思考,或者为短暂且有延迟的回合设定小预算。

内置工具

Omni Flash 的网络搜索 tool_web_search (英语) 默认情况下,且关闭。该模型不暴露网页提取器、代码解释器或图像搜索工具。搜索运行时,响应为 usage.tool_usage Map 会准确报告通话数量,方便您审核每个工具的计费。一个请求可以多次调用搜索,并且每次调用都会计费。LiveTranslate 没有网页搜索功能。

结构化输出

如果想在Omni Flash上获得精确的响应形态,可以跳过 response_format{“type”: “json_schema”,...} 以及 “严格”:真:模型返回的键完全相同,没有额外内容。纯JSON模式,其中 {“类型”:“json_object”} 也支持。

第一次打电话前值得了解的事情

  • Omni Flash 读取音频和视频,并以文本回复。 不要请求音频输出。该型号没有语音控制。
  • 将Omni Flash音频发送为URL或base64数据URI。 嵌套 input_audio.data 必须是 URL 或 数据: URI,不是原始的base64。playgroundMP3上传会使用 格式:“mpeg”;该别名为 mp3。 。 。.
  • tool_choice:“必须” 思考时不起作用。 请求被拒绝,显示明显错误。守 tool_choice:“自动” 在思考被启用或设定的情况下 enable_thinking:错误 当你需要强制调用函数时,
  • LiveTranslate 在第一次会话时需要一个目标语言。更新。 没有它,套接字会在产生任何音频前关闭。保持源语言未设置以实现自动检测。

这两款车型现已在playground及 EmpirioLabs API。 。 。.

准备好使用更好的终端了吗?

欢迎浏览我们的模型,或联系我们洽谈业务咨询、定制部署或其他任何事宜。