Qwen3.7 Flash 已在EmpirioLabs上可用。 它是阿里巴巴Qwen3.7视觉语言系列中的快速版本,专为多模态理解、智能工具使用和长上下文工作而设计,支持100万令牌上下文窗口、可切换思维,以及文本、图像和视频输入。它运行在兼容OpenAI的API,因此你只需切换一个字段即可切换到OpenAI。
Qwen3.7 Flash 的优势
Flash是Qwen3.7系列中的速度和成本层级,适合大量工作,仍希望有真实的推理支持:文档和截图理解、视频问答、提取流水线,以及调用工具的代理循环。它能读取图片和视频,调用标准函数调用工具,按需返回JSON,并通过内置工具搜索网页、运行代码和读取URL。支持新加坡和中国部署,您可以选择最适合自己延迟和定价需求的方案。
怎么称呼它呢
发送标准聊天回复:
curl https://api.empiriolabs.ai/v1/chat/completions \ -h “授权:持有者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”: “qwen3-7-flash”, “messages”: [ {“role”: “user”, “content”: “总结本季度”报告用五个项目符号。“} }}'
最终答案回来了 内容当思考 时,模型的推理 属于 推理(c)。 。 。.
控制思维
思维默认开启。对于短时间、延迟敏感的通话关闭,或者设定模型可能花费多少代币的预算。你也可以使用 推理(e) 有无、低、中、高或最大,这些对应的是该型号的预算规模:
{ “model”: “qwen3-7-flash”, “messages”: [{“role”: “user”, “content”: “计划迁移并合理化订单。”}], “enable_thinking”: true, “thinking_budget”: 32768 }
推理代币作为输出代币计费。
图片与视频
在用户消息中将图片和视频作为内容部分与你的文本一起传递,然后询问它们显示的内容。你可以在一次请求中附加多个输入:
{ “model”: “qwen3-7-flash”, “messages”: [{“role”: “user”, “content”: [ {“type”: “text”, “text”: “这两截图之间发生了什么变化?”}, {“type”: “image_url”, “image_url”: {“url”: “https://example.com/before.png"}}, {”type“: ”image_url“, ”image_url“: {”url“: ”https://example.com/after.png"}} ]}] }
内置工具
Qwen3.7 Flash 自带网页搜索、用于读取 URL 的网页提取器、代码解释器以及 text-to-image 和 image-to-image 搜索。每个功能都是一个开关,只有模型实际调用时才计费。网页提取器和代码解释器需要启用思维功能:
{ “model”: “qwen3-7-flash”, “messages”: [{“role”: “user”, “content”: “最新版本发布了什么?”}], “tool_web_search”: true }
当工具运行时,响应会携带 usage.tool_usage 把标记数对应到,这样你可以准确查看调用了哪些内容。
结构化输出与函数调用
用途 response_format 与 {“类型”:“json_object”} 强制执行有效的JSON对象,并传递 工具 用于标准函数调用,当你希望模型调用你自己的代码时。
提示缓存
重复的提示词前缀会自动缓存,缓存输入令牌的收费率远低于新输入。如果你在多个请求中发送一个长的共享系统提示词或文档头,你就能获得折扣,而无需修改代码内容。
地区
默认 qwen3-7-flash 是新加坡的部署。 qwen3-7-flash:variant1 是中国对同一模型的部署,速率更低。两者参数相同,因此仅凭模型字段即可切换。
定价
Qwen3.7 闪电版是按需付费,按令牌计费。输入和输出速率在较短提示时下降,非常长提示时提高,缓存输入费用降低,内置工具仅在运行时按呼叫收取少量费用。查看实时费率 Qwen3.7 Flash 模型页面 页:1 定价页面,试试在 操场。 。 。.



