
编码和代理模型,拥有100万令牌上下文,输出12.8K,始终在线推理,无论低、高、最大努力,本地网页搜索和工具调用。
按需付费,或者选择每周津贴的计划。
价格目录
EmpirioLabs 的定价因型号和单位而异:代币、图片、秒数音频或视频、消息、3D 资产和搜索请求。交互式定价表加载当前目录,而这些代表性费率在客户端JavaScript下仍可读取。
每张图片输入$0.05。视频输出在480p时为每秒$0.096,720p为每秒$0.168。
对于一个经济高效的长上下文多模态 API,输入起始于每 100 万个提示令牌 $0.40。
输入从每100万个提示令牌$0.30开始,用于多模态推理、编码和代理工作负载。
图像转3D生成按生成的3D素材计费,格式和分辨率控制文档。
模型 API 价格以 USD 显示并按 USD 计费。符合条件时,结账页可能显示本地支付方式。
Weekly allowances across models, media, search and tasks, on top of pay as you go. Usage inside your allowances is included and never touches your credit balance.
3 of these are free to run, so they never draw from your allowance.
DeepSeek V4.1 Flash
GLM 5.3 Flash
Qwen3.8 Flash
Qwen3.8 27B
Muse Glimmer 30B
DeepSeek V4 Flash 0731
Qwen3.7 Flash
Qwen3.7 Flash (Variant 1)
MiniMax M3
MiniMax M3 (Priority)
Step 3.7 Flash
DeepSeek V4 Flash (Variant 2)
DeepSeek V4 Flash
DeepSeek V4 Flash (Variant 1)
Qwen3.6 Flash
Qwen3.6 Flash (Variant 1)
Qwen3.6 35B A3B
Step 3.5 Flash 2603
Gemma 4 26B-A4B
MiniMax M2.7 Highspeed
MiniMax M2.7
Mistral Small 4
Qwen3.5 4B
Qwen3.5 122B-A10B
Qwen3.5 35B-A3B
Qwen3.5 27B
Qwen3.5 Flash (Variant 1)
Qwen3.5 Flash
Qwen3.5 9B
Qwen3.5 397B-A17B
Seed 2.0 Mini
Step 3.5 Flash
GLM 4.7 Flash免费This model is free to run, so using it never draws from your weekly allowance.
GLM 4.6V Flash免费This model is free to run, so using it never draws from your weekly allowance.
GLM 4.5 Flash免费This model is free to run, so using it never draws from your weekly allowance.
Mistral Small 3.1
Gemma 3 27B
Nova Lite 1.0
Nova Micro 1.0
Fugu Max
Fugu Ultra v2.0
Qwen3.8 Max 0902
Muse Spark 1.3
GLM 5.3
DeepSeek V4 Pro 0813
Muse Spark 1.2
Qwen3.8 Max
Qwen3.8 Max (Variant 1)
Fugu Ultra v1.1
Kimi K3
Seed 2.1 Turbo
Muse Spark 1.1
Fugu Ultra v1.0
Kimi K2.7 Code
GLM 5.2
Kimi K2.7 Code Highspeed
GLM 5.2 (Variant 1)
Kimi K2.7 Code (Variant 1)
Qwen 3.7 Plus
Qwen3.7 Plus (Variant 1)
Qwen3.7 Max
Qwen3.7 Max (Variant 1)
MiMo V2.5 Pro
DeepSeek V4 Pro (Variant 2)
DeepSeek V4 Pro
DeepSeek V4 Pro (Variant 1)
Qwen3.6 27B
MiMo V2.5
Kimi K2.6
Qwen3.6 Max Preview
GLM 5.1
Qwen3.6 Plus (Variant 1)
Qwen3.6 Plus
Qwen3.5 Omni Flash
Qwen3.5 Omni Plus
Qwen3.5 Plus (Variant 1)
Qwen3.5 Plus
Seed 2.0 Code
Seed 2.0 Lite
Seed 2.0 Pro
Nova Lite 2
DeepSeek V3.2
Qwen3 Max
Qwen3 Max Thinking
Qwen3 Max Preview
DeepReasoning
Nova Pro 1.0
Perplexity Sonar
StepAudio 2.5 ChatAllowances cover models, media, search and tasks, including generation templates and Compose. Past them, usage bills at normal pay-as-you-go rates. Personal use only, no reselling. Allowances refresh weekly and do not roll over.

编码和代理模型,拥有100万令牌上下文,输出12.8K,始终在线推理,无论低、高、最大努力,本地网页搜索和工具调用。

文本转视频和image-to-video,原生音频同步,720p或1080p,持续3到15秒,支持宽高比和提示控制。

原生多模态闪存模型,具备100万令牌上下文、图像和视频输入、始终在线推理、原生网页搜索和工具调用。

推理与编码模型,具有100万个令牌上下文,输出12.8K,推理努力可调,原生网页搜索和工具调用。
推理与编码模型,具有100万个令牌上下文,输出12.8K,推理努力可调,原生网页搜索和工具调用。

Kimi K3 是 Moonshot 的旗舰推理模型,具备 100 万令牌上下文、始终在线思维、原生网页搜索以及文本、图片和视频输入。

Meta更新的前沿推理模型,涵盖1,048,576个令牌上下文、图片、视频、音频和PDF理解,支持网页搜索和工具调用。

Kimi K2.7 代码是 Moonshot 的万亿参数代理编码模型,拥有 256K 上下文、始终在线的推理,以及文本、图像和视频输入。
Kimi K2.7 代码是 Moonshot 的万亿参数代理编码模型,拥有 256K 上下文、始终在线的推理,以及文本、图像和视频输入。

Meta 前沿推理模型,拥有1,048,576个令牌上下文,并支持图片、视频、音频和PDF理解,并支持网页搜索和工具调用。

更新的多智能体指挥器,用于硬推理、编码和研究,具备独特的最大努力、100万上下文、图像输入和网页搜索。

性价比高的Qwen3.7视觉语言模型,适用于文本、图像、视频、编码、工具使用、图形界面理解和100万上下文工作流程。
性价比高的Qwen3.7视觉语言模型,适用于文本、图像、视频、编码、工具使用、图形界面理解和100万上下文工作流程。

Kimi K2.7 Code Highspeed 是 Moonshot 代理编码模型中服务速度更快的版本,支持256K上下文、始终在线推理以及图像和视频输入。

原创多智能体导体,用于硬推理、编码和研究,支持1M上下文、图像输入、函数调用和网页搜索。

快速Qwen3.7视觉语言模型,适用于文本、图像、视频、工具使用及代理任务,具隐式缓存和100万令牌上下文。
快速Qwen3.7视觉语言模型,适用于文本、图像、视频、工具使用及代理任务,具隐式缓存和100万令牌上下文。
MiniMax M3 是一种多模态推理模型,用于编码、代理和长上下文分析,包含文本、图像和视频输入。
MiniMax M3 是一种多模态推理模型,用于编码、代理和长上下文分析,包含文本、图像和视频输入。

Qwen3.7 Max 是编码、生产力、长期运行代理、深度思考、工具和 100 万令牌上下文的旗舰文本模型。
Qwen3.7 Max 是编码、生产力、长期运行代理、深度思考、工具和 100 万令牌上下文的旗舰文本模型。

万亿级MoE旗舰,适用于编码、长期代理和专业工作,支持100万令牌上下文的图像和视频理解。
万亿级MoE旗舰,适用于编码、长期代理和专业工作,支持100万令牌上下文的图像和视频理解。

快速Qwen3.8视觉语言模型,用于编码、代理和视觉理解,支持图像和视频输入,内置五个工具,以及100万个令牌上下文。

升级后的Qwen3.8 Max快照,增强编码、更稳定的多工具代理运行,以及在100万令牌上下文中更清晰的图表和文档视野。
开源音乐生成模型,支持text-to-song和歌词引导音频,支持快速的8步XL Turbo推理,实现可控的歌曲迭代。
Apache 许可的 4B FLUX.2 Klein 图像生成与编辑模型,支持text-to-image、参考图像编辑和创意工作流程。
高速M2.7变体,调校为快速推理,具备强大的通用性能和强大的代理能力。
实时语音模型采用纯英语表达方向,拥有跨200+语言的统一语音身份,并带有单词时间戳进行流媒体传输。
TTFB语音合成速度低于130毫秒,支持15种语言的271+语音,富有表现力的韵律,以及为低延迟语音代理提供实时SSE流媒体。
广播级语音合成,富有表现力的韵律,271+语音,跨15种语言,实时SSE流媒体,按字时间戳。
长上下文的智浦AI推理模型,具备202K上下文、128K输出、工具调用、结构化输出和缓存支持。
Kimi K2.6 是一个 Moonshot 多模态推理模型,拥有 256K 上下文、强编码以及文本、图像和视频输入。

经过训练后的 0731 版本,在编码、仓库工作、工具使用和全栈任务方面有了重大提升,并且支持了 100 万上下文窗口。

经过训练后的 0731 版本,在编码、仓库工作、工具使用和全栈任务方面有了重大提升,并且支持了 100 万上下文窗口。
根据歌词和风格提示生成完整的立体声歌曲,时长、种子和格式控制最长可达5分钟。

官方 0813 Pro 版本,在编码、仓库工作、工具使用和代理任务方面有了重大提升,同时实现了混合思维和 100 万上下文窗口。

Meta的长视野代理推理模型,拥有1,048,576个令牌上下文、图像、视频和PDF理解,并支持网页搜索和工具调用。
以延迟为先的实时语音合成,跨越200+语言保持单一语音身份,专为高流量流媒体工作负载优化。

Deepseek 新架构的轻量旗舰,具备原生图像理解、混合思维、100万上下文支持,以及高达 384K 的输出令牌。
MiniMax M2.7 是一种通用推理聊天模型,具备交错思考、函数调用和提示缓存功能。
TRELLIS.2 图像转3D模型,将参考图像转换为带有分辨率、种子、网格、纹理和导出控制的纹理GLB资产。
Qwen3.5 122B-A10B 是一个多模态推理模型,具备 256K 上下文、高效的稀疏 MoE 推断,以及文本、图像和视频输入。
Qwen3.5 397B-A17B 是语言、代码、代理、图形界面任务以及图像和视频理解的旗舰多模态推理模型。
Qwen3.5 35B-A3B 是一个高效的原生视觉语言模型,拥有稀疏的 MoE 路由、深度思考以及文本、图像和视频输入。
Qwen3.5 27B 是一个密集的多模态推理模型,响应速度快,上下文达256K,并能理解文本、图像和视频。
多模推理器,支持256K上下文、图像和视频输入、函数工具、结构化JSON,默认使用思维。
Qwen3.6 27B 提升了在 256K 上下文中对智能编码、STEM 推理、空间视觉、光学字符识别(OCR)以及文本、图像和视频的理解。

Fast Qwen3.6视觉语言模型,用于智能编码、数学推理、空间理解、OCR以及文本、图像和视频输入。
Fast Qwen3.6视觉语言模型,用于智能编码、数学推理、空间理解、OCR以及文本、图像和视频输入。
Gemma 4 26B A4B 是谷歌开放多模态模型,拥有256K上下文、文本、图像和视频输入、工具及结构化输出。
Meta Open 30B 代理模型,具备图像理解、128K 上下文、工具调用、结构化输出和可控推理强度。
Qwen3.5 9B 是一个紧凑的多模态推理模型,拥有 256K 上下文、图像和视频输入、函数工具以及结构化输出。

Qwen3.5 4B 是一个低成本的多模态推理模型,拥有 256K 上下文、图像和视频输入、函数工具以及结构化输出。
Qwen3.6 35B A3B 是一个包含256个专家mixture-of-experts推理模型,拥有128K上下文、函数工具和严格结构化的JSON输出。

免费的轻量级GLM-4.7文本模型,用于编码、推理、长上下文写作和一般聊天。

免费的轻量级GLM-4.5文本模型,用于推理、编码、长距离聊天及通用语言任务。

免费的多模态GLM-4.6V模型,支持图像、视频、文件和文本的理解,支持原生函数调用。

视频生成模型可从文本和可选图像提示中生成长达2分钟的多镜头视频,质量和一致性均有提升。

采用Nova-3模型进行语音转文字转录,支持多语言支持,并可为生产工作负载提供高级可定制设置。

将 DeepSeek R1 chain-of-thought推理与 Anthropic Claude 创意和代码生成结合,构建统一的数据控制界面。

开源专家混合大语言模型,专为高效推理、编码和通用语言任务优化,适用于长格式提示。

轻量级MoE模型,总参数284B/活动参数13B,原生100万上下文,优化为低延迟、经济高效的高并发使用。

轻量级MoE模型,总参数284B/活动参数13B,原生100万上下文,优化为低延迟、经济高效的高并发使用。
轻量级MoE模型,总参数284B/活动参数13B,原生100万上下文,优化为低延迟、经济高效的高并发使用。

轻量级MoE模型,总参数284B/活动参数13B,原生100万上下文,优化为低延迟、经济高效的高并发使用。
旗舰MoE大型语言模型,拥有1.6特斯拉总参数/49B活跃参数,并支持原生1M上下文,支持高级数学、逻辑推理和专业编码。

旗舰MoE大型语言模型,拥有1.6特斯拉总参数/49B活跃参数,并支持原生1M上下文,支持高级数学、逻辑推理和专业编码。
旗舰MoE大型语言模型,拥有1.6特斯拉总参数/49B活跃参数,并支持原生1M上下文,支持高级数学、逻辑推理和专业编码。

旗舰MoE大型语言模型,拥有1.6特斯拉总参数/49B活跃参数,并支持原生1M上下文,支持高级数学、逻辑推理和专业编码。

低延迟text-to-speech,支持单人和多扬声器语音,以及可控的风格、口音和富有表现力的制作应用。

高度可控的语音转语音系统,配备新的音频标签,支持精准的风格、语调、节奏和跨越旁白、助理和语音应用的表达。

开源视觉语言模型,拥有128K上下文、140+语言、改进math/reasoning、结构化输出和函数调用。

基于LLM的text-to-speech,支持从3到10秒音频中零声量克隆,并通过多奖励强化学习实现情感表达、可控输出。

视频模型提供文本转视频、图像转视频、参考视频和视频编辑模式,输出高保真、运动平滑。

基于多模态专家混合架构的开源text-to-image模型,具备照片级真实细节和强力的多语言文本渲染。
8.3B参数视频模型,原生720p输出(可升频至1080p),具备强烈的运动连贯性,双语提示理解能力高达10秒。

基于Janus Pro 7B模型的自回归框架,将多模态理解和图像生成统一在一个架构中。

Kling 3.0 型号,将参考视频的动态传输到参考图像中的角色上,支持标准 720p 和 Pro 1080p 层级。

基于AI的网络搜索,提供详细的概述和解答,速度快于深度搜索。在OpenAI SimpleQA基准测试中排名#1。

24B参数多模态模型,拥有128K上下文,用于图像分析、编程、数学和多语言任务,优化为高效的局部推断。

统一Instruct、Reasoning(Magistral)和Devstral家族的混合模型:完成时间比Small 3快40%,吞吐量是3倍。

开源32B MoE基础模型,通过精确的双塔口型同步,在一次推断步骤内生成同步的视频和音频。

低成本多模态基础模型,适用于30万上下文下的文本、图像和视频(视频时长最长~30分钟),优化速度和经济性。

快速、经济高效的多模态推理模型,适用于100万上下文下的文本、图片、文档和视频(长文档和~90分钟的片段)。

纯文本基础模型,针对128K上下文的超低延迟和成本进行了调校。在摘要、翻译和聊天方面表现强劲,缓存折扣达44%。

多模态基础模型在30万上下文(最长~30分钟视频)中平衡文本、图像和视频的准确性、速度和成本。

Whisper-1 speech-to-text多语言监督音频训练的转录,每个文件上传限制为25 MB。

采用Claude Opus 4.6推理驱动的机构级研究,具备最大深度、更便捷的工具获取和广泛的来源覆盖。

实时网络连接搜索,提供准确的引用和可定制的来源,支持up-to-date生产应用中的人工智能搜索集成。

基于未审查开源R1-1776的推理模型,支持网页搜索,在SimpleQA基准测试中优于领先的搜索引擎和大型语言模型。

可根据文本或1-2帧图片提示生成视频,最高支持1080p,支持多种宽高比,时长为5-10秒,并可选同步音频。

统一的图像生成与编辑模型,拥有类领先的复杂Chinese/English文本渲染、逼真的纹理和多图像融合。

Qwen 图像生成与编辑支持基础和专业版本,多语言排版,多图像参考,以及可控制的 1K 或 2K 输出。
视觉语言模型,结合混合线性注意力、稀疏的 MoE、1M 上下文和快速多模态text/image/视频推断。
视觉语言模型,结合混合线性注意力、稀疏的 MoE、1M 上下文和快速多模态text/image/视频推断。

成本效益高的全模态模型,处理文本、图像、音频和视频,支持90+语言,最高可达3小时音频和1小时视频。

旗舰全模态模型,涵盖文本、图像、音频和视频。3小时音频,1小时视频,90+输入和30+输出语言,55种语音音色。
采用多模态模型,采用混合架构,在100万上下文中实现文本、图像和视频的高效深度思考和视觉理解。
采用多模态模型,采用混合架构,在100万上下文中实现文本、图像和视频的高效深度思考和视觉理解。

3.6系列(仅文本)中最大的预览变体:改进了编码代理执行,增强了前端技能,以及更广泛的长尾知识。

视觉语言模型,比3.5版本有重大升级:代理编码和前端编码、多模态识别、OCR和对象定位。
视觉语言模型,比3.5版本有重大升级:代理编码和前端编码、多模态识别、OCR和对象定位。
256K上下文旗舰机,在推理、指令跟随和多语言支持方面有显著提升,coding/math准确性更高。
预览版相较2.5系列在中英理解、复杂指令、多语言能力和工具使用方面有了显著提升。
推理模型,采用自适应工具(搜索、内存、代码解释器)和测试时间缩放,以提升复杂任务的准确性。

语义文档重排序器。可按相关性排序最多500个候选人,支持100+语言,并接受自定义排序指令。

经过编码调优的256K上下文模型,前端结果强劲,并支持多语言编程,支持AI编码工具和代理。

为高频企业工作负载提供平衡通用模型:信息处理、内容、搜索和数据分析。

以延迟为重点的多模态模型,拥有256K上下文,支持四种推理努力模式,image/video并用于高并发使用。

旗舰通用模型,拥有256K上下文,支持复杂推理、多模态理解、结构化生成和工具增强执行。

为电影剪辑提供速度优化的2.0视频变体,具备原生音频同步、摄像机控制和稳定动作,且每次渲染成本更低。

多模态视频模型,用于文本、图像、音频或视频输入的电影输出,具有稳定的运动和一致的字符。

统一的多模态图像模型,能在渲染前根据提示推理,生成高分辨率且一致的编辑和品牌视觉效果。

高级Seedream图像模型,可将一张图片拆分为可编辑图层,按坐标或草图标记编辑,并融合多达10个参考。

开源语音模型,用于长格式、多说话播客对话,并具备副语言控制(笑声、叹息)和零帧语音克隆。

可根据文本提示生成长达3分钟的音频,支持可调节时长、步数和CFG比例的 text-to-audio 和audio-to-audio。

to-3-minute的文本音频,配合text-to-audio、audio-to-audio和音频修复,用于音乐制作、音效设计和混音。

WAN 2.2 上的稳定视频无限 2.0 Pro:将静态图像扩展为理论上无限长的视频,同时保持字符ID一致。

多语言文本嵌入,输出尺寸可选(64–2048)。每个输入最多可支持8,192个词。

速度优化的多模态嵌入,形状与Vision-Plus相同,3×更便宜的image/video令牌。

多模态嵌入产生文本、图像和视频输入的独立矢量。

多模态视频生成模型,用于电影感、多镜头故事,并配备原生视听同步(口型同步、对白、音乐、音效)。

多模态视频模型支持T2V、I2V、视频编辑和reference-to-video,支持文本、图像或视频输入的高保真输出。

图像生成与编辑伴随模型:text-to-image、边界框编辑和连贯图像集,Pro版本支持最高4K输出。
受控Whisper Large v3 Turbo转录,支持多语言ASR、翻译、VAD、时间戳、字幕、热词和解码控制。

支持文本转视频、image-to-video和reference-to-video生成,最多可使用七张参考图像,以实现字符一致,1080p分辨率下最长15秒。

顶级模型,适用于代理工作流、复杂软件工程和长期任务,能够在1000+工具调用中持续工作,覆盖100万上下文。

多模态模型,基于100万上下文,具备原生视觉和听觉理解,旨在跨模态推理和行动,在代理工作流中进行推理和行动。

文字、图片和reference-to-video合一模型。电影般的动作,最多9个参考元素中的角色一致性,以及同步的原生音频。

这是Seedance 2.0中最快、最实惠的版本,支持原生音频、摄像控制以及480p和720p的图像或视频输入,支持短片电影。

StepFun 多模态推理模型,具备图像和视频输入、工具调用、可调节推理努力和 256K 上下文。

StepFun 文本推理模型,适用于代理、编码、工具调用和长上下文分析。

代理优化的Step 3.5闪存变体,具有低推理和高推理工作模式。

StepFun 图像生成和图像编辑模型,用于text-to-image和单张图像编辑。

情境式 StepFun text-to-speech具有自然语言语音指导和富有表现力的模型。

下一代编码和代理模型,具备工程级代码交付、长远自主性和256K多模态理解能力。

分层语音合成,拥有1000多个语音、16种语言、20种汉语方言、自然语言表达方向和内联情感标签。

可生成4至15秒的片段,最高可达2K,支持原生立体声音频,同时在一次请求中跟随文本、图像、视频和音频引用。

OpenAI的旗舰图像模型,具备强烈的提示准确度、清晰的文本渲染和基于指令的编辑,覆盖最多16张参考图片。

快手的Kling 3.0视频生成器,支持text-to-video帧、首尾帧image-to-video、原生音频,以及720p、1080p或4K输出。

阿里巴巴万2.5视频型号,支持text-to-video和image-to-video,原生音频,可选自定义音轨,支持480p转1080p输出。

阿里巴巴的万2.2视频系列,包含标准和闪存层级,首帧和末帧插值,以及低成本的480p到1080p输出。

阿里巴巴的万2.1视频模型,支持text-to-video、image-to-video以及首尾帧的加速和加层,支持480p或720p的首尾帧。

阿里巴巴的万2.5图像模型,支持text-to-image和多参考编辑,最多可编辑3张约170万像素的图片。

阿里巴巴的万2.2text-to-image型号,支持Plus和闪光灯层级,最高输出1440x1440,单张价格低廉。

阿里巴巴的万2.1text-to-image型号,配备涡轮和加层,最高1440x1440分辨率,单张价格低廉。

长视频模型,支持最长30秒的连贯片段,最多包含50张参考图片、视频和音频片段,支持原生音频、编辑和扩展。

文本转图像加上多重引用编辑,支持最多五张源图像,自动或钉顶质量等级,以及1K或2K输出分辨率。

联合音频和视频生成,配合毫秒对口型同步,六种语言对话,电影级摄像机移动,以及最高1080p输出。

高保真图像生成和编辑,支持最多14张参考图片,强力文本渲染,以及2K或4K输出,且价格统一。

统一的图像生成和编辑,最多支持 14 张参考图像,批量最多 15 张,以及每张图片统一价格的 1K 至 4K 输出。

Rodin Gen-2 引擎,可将文本提示或最多五张参考图像转化为带有 PBR 材质和四边形或原始网格的生产 3D 资产。

以制作为中心的图像转3D,带有结构感知纹理,1536和1536 Pro的高精度层级,最多可进行200万个面部网格,以及五种导出格式。

多模态嵌入,将文本、图像和视频融合为一个1024或2048维的向量,实现跨模态搜索和检索。

一体化视频生成,最高30秒,支持原生音频、全模态参考(图片、视频、音频、文件、网页链接),以及快速的Prime级别。

成本效益高的多智能体指挥器,能为每个任务组建合适规模的专家团队,支持100万上下文、图像输入和网页搜索。

旗舰多智能体指挥,适合最难的推理、编码和研究工作,支持100万上下文、图像输入和网页搜索。
163 / 182 模型