
Text-to-video和 image-to-video 带有同步的本土音频,在720p或1080p时为3至15秒,具有宽比和即时控制.
只按你用的付费。没有订阅锁定。
价格目录
EmpirioLabs 的定价因型号和单位而异:代币、图片、秒数音频或视频、消息、3D 资产和搜索请求。交互式定价表加载当前目录,而这些代表性费率在客户端JavaScript下仍可读取。
每张图片输入$0.05。视频输出在480p时为每秒$0.096,720p为每秒$0.168。
对于一个经济高效的长上下文多模态 API,输入起始于每 100 万个提示令牌 $0.40。
输入从每100万个提示令牌$0.30开始,用于多模态推理、编码和代理工作负载。
图像转3D生成按生成的3D素材计费,格式和分辨率控制文档。
模型 API 价格以 USD 显示并按 USD 计费。符合条件时,结账页可能显示本地支付方式。

Text-to-video和 image-to-video 带有同步的本土音频,在720p或1080p时为3至15秒,具有宽比和即时控制.

1M令牌上下文的理性和编码模型,128K输出,可调整的推理努力,本土网络搜索,以及工具调用.

Kimi K3 is Moonshot's flagship reasoning model with a 1M token context, always-on thinking, native web search, and text, image, and video inputs.

Kimi K2.7 (韩语) 代码是Monshot的万亿参数的代理编码模型,其上下文为256K,总是进行推理,以及文字,图像,和视频输入.
Kimi K2.7 (韩语) 代码是Monshot的万亿参数的代理编码模型,其上下文为256K,总是进行推理,以及文字,图像,和视频输入.

Meta 前沿推理模型,具备100万个令牌上下文、图像和视频理解、内置带有引用来源的网页搜索以及工具调用功能。

Updated multi-agent conductor for hard reasoning, coding, and research, with distinct max effort, 1M context, image input, and web search.

成本效益高的Qwen3.7视觉语言模型用于文本,图像,视频,编码,工具使用,GUI理解,以及1M-context工作流程.
成本效益高的Qwen3.7视觉语言模型用于文本,图像,视频,编码,工具使用,GUI理解,以及1M-context工作流程.

Kimi K2.7 (韩语) 代码高速(Code Highpy)是月光的代理编码模型中服务速度更快的一级,其上下文为256K,总是进行推理,图像和视频输入.

Original multi-agent conductor for hard reasoning, coding, and research, with 1M context, image input, function calling, and web search.

Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.
Fast Qwen3.7 vision-language model for text, image, video, tool use, and agentic tasks, with implicit caching and a 1M token context.
MiniMax M3是一种多模式推理模型,用于编码,代理,以及带有文本,图像,视频输入的长文本分析.
MiniMax M3是一种多模式推理模型,用于编码,代理,以及带有文本,图像,视频输入的长文本分析.

问题3.7 Max是一个旗舰文本模型,用于编码,生产力,长期代理,深思,工具,和1M-token上下文.
问题3.7 Max是一个旗舰文本模型,用于编码,生产力,长期代理,深思,工具,和1M-token上下文.
开源音乐生成模式用于 text-to-song 和lyric-guided音频,快速8步XL Turbo推论用于可控歌曲迭代.
阿帕奇牌4B FLUX.2 Klein 图像生成和编辑模式带有 text-to-image,参考图像编辑,以及创意工作流程支持.
高速M2.7变体调制用于快速推导,具有很强的调剂能力的强通用性能.
实时语音模型,采用纯英语语音指导,跨100+语言实现统一语音身份,且流媒体time-to-first-audio低于200毫秒。
sub-130ms TTFB语音合成,配有271+语音,跨越15种语言,表现性prosody,以及用于低纬度语音代理的实时SSE流.
广播质量语音合成,具有丰富的表达式音标,271+语音跨越15种语言,实时SSE流传每字时间戳.
长康文本 Zhipu AI 推理模型有202K上下文,128K输出,工具调用,结构输出,以及缓存支持.
Kimi K2.6是一种月光多模式推理模型,有256K上下文,强编码,以及文本,图像,和视频输入.
MiniMax M2.7是一种通用推理聊天模式,具有互留式思维,功能调用,以及即时缓存.
TRELLIS.2 图像到-3D模型,将参考图像转化为有文本的GLB资产,具有分辨率,种子,网格,纹理和导出控制.
Quen3.5 122B-A10B是一种多式联运推理模型,其上下文为256K,高效的稀疏的MOE推论,以及文本,图像,视频输入.
Quen3.5 397B-A17B是语言,代码,代理,GUI任务,图像和视频理解的旗舰式多式联运推理模型.
Quen3.5 35B-A3B是一个高效的本土视觉语言模型,其MOE的路由,深思熟虑,以及文本,图像,视频输入.
Quen3.5 27B是一种密集的多式联运推理模型,具有快速响应,256K上下文,以及文本,图像,和视频的理解.
Quen3.6 27B改进了代理编码,STEM推理,空间视觉,OCR,以及文本,图像,视频对256K上下文的理解.

Fast Quen3.6 用于代理编码,数学推理,空间理解,OCR,以及文本,图像,视频输入的视觉语言模型.
Fast Quen3.6 用于代理编码,数学推理,空间理解,OCR,以及文本,图像,视频输入的视觉语言模型.
Gemma 4 26B A4B是一个Google开放的多式联运模型,包含256K上下文,文本,图像,以及视频输入,工具,和结构化输出.
Quen3.5 9B是一种紧凑的多式联运推理模型,有256K上下文,图像和视频输入,功能工具,以及结构化输出.

Quen3.5 4B是一种低成本的多式联运推理模型,其上下文,图像和视频输入,功能工具,以及结构化输出.
Qwen3.6 35B A3B is a 256-expert mixture-of-experts reasoning model with 128K context, function tools, and strict structured JSON output.

免费轻量级GLM-4.7文本模型,用于编码,推理,长文写作,以及一般聊天.

用于推理,编码,长式聊天和一般语言任务的免费轻量级GLM-4.5文本模型.

用于图像,视频,文件和文本理解的免费多模式 GLM-4.6V 模型,带有本地函数调用.

Pairs DeepSeek R1 chain-of-thought 推理与Anthropic Claude在统一,数据控制的界面背后的创意和代码生成.

开源Mixture-of-Experts LLM调制,用于高效推理,编码,以及跨长式提示的通用语言任务.

具有284B总/13B活性参数和原生1M上下文的轻量级MOE模型,为低纬度,成本效益高的高货币使用.

具有284B总/13B活性参数和原生1M上下文的轻量级MOE模型,为低纬度,成本效益高的高货币使用.
具有284B总/13B活性参数和原生1M上下文的轻量级MOE模型,为低纬度,成本效益高的高货币使用.
Flagship MoE LLM拥有1.6T总/49B活性参数和本土1M背景,用于高级数学,逻辑推论,以及专用编码.

Flagship MoE LLM拥有1.6T总/49B活性参数和本土1M背景,用于高级数学,逻辑推论,以及专用编码.
Flagship MoE LLM拥有1.6T总/49B活性参数和本土1M背景,用于高级数学,逻辑推论,以及专用编码.

低纬度 text-to-speech 使用单声道和多声道语音,并具有可控风格,口音,以及制作应用的表达语调.

高度可控的TTS带有新的音频标记,用于精确的风格,音调,速度,以及跨叙述,助手,语音应用程序的发送.

具有128K上下文,140+语言的开源视觉语言模型,改进了 math/reasoning,结构化输出,功能调用.

基于LLM的 text-to-speech 通过多奖RL从3~10s的音频和情感表达式零镜头语音克隆,可控输出.

视频模式提供Text-to-Video,Image-to-Video,Reference-to-Video,以及视频编辑模式,具有高真实度,运动流畅的输出.

Open-source text-to-image 型号为多式混合实验架构,具有光现实性细节和强多语言文本渲染.
8.3B参数的视频模型,原生输出720p(可扩展至1080p),强运动一致性,双语快速理解可达10s.

Janus Pro 7B模型上的自动递减框架,统一了一种架构中的多式联运理解和图像生成.

以标准或Pro模式制作的视频模型有Text至Video,Image至Video,Reference-toVideo,编辑,原声,以及多景过渡.

Kling 3.0 模型,从参考视频中将运动从参考图像转移到字符上,具有标准720p和Pro 1080p级.

AI有动力的网络搜索有详细的综述和答案,比"深度搜索"更快. OpenAI SimpleQA基准上的排名#1.

具有成本效益的语言模式为具有竞争力的暂时性的一般生产工作量提供了强有力的推理和多模式性能。

企业级模型具有强大的推理,编码,和STEM性能,支持混合,prem,以及VPC内部署.

24B参数的多式模型,有128K背景,用于图像分析,编程,数学,以及多语言任务,为高效的局部推论调制.

混合模式 统一指令,理性(Magistral),和Devstral家族:完成时间减少40%,通过量减少3x对Small 3.

开源32B MoE基础模型,以精确的双层唇音同步的推论步骤生成同步视频和音频.

300K上下文的文本、图像和视频(最多为~30分钟)的低成本多式联运基础模型,用于速度和可负担性。

1M上下文的文本、图像、文件和视频的快速、成本效益高的多式联运推理模型(长文件及~90分钟剪辑)。

仅文本基础模型为128K上下文的超低纬度和成本调制. 强于总和,翻译,以及44%缓存折扣的聊天.

家里最有能力的模特儿 1M上下文的多式联运 text/image /video,与 chain-of-thought 跨工具和数据源的推理.

300K上下文(最多~30分钟视频)上的多模式基础模型平衡文本、图像和视频的准确性、速度和成本。

Whisper-1 speech-to-text 在多语种监督音频上训练的转录,每个文件有25 MB上传限制.

机构级研究由克劳德·奥普斯4.6推理提供动力,具有最大深度,增强工具访问,以及广泛的源覆盖.

未审查的开源R1-1776上采用网络搜索的理性模型,优于SimpleQA基准上的主要搜索引擎和LLMs.

在Text-to-Video,Image-to-Video,以及过渡模式中以高细节,流体运动,和生活类动画制作的电影视频生成.

从文本或1-2帧图像生成视频,提示最高可达1080p,多角度比,5-10s持续时间,可选同步音频.
统一的图像生成和编辑模型,具有类引导复合体 Chinese/English 文本渲染,现实的纹理,以及多图像聚变.
具有混合线性意向+稀疏的MOE,1M上下文,以及快速多式联运 text/image /video推论的视觉语言模型.
具有混合线性意向+稀疏的MOE,1M上下文,以及快速多式联运 text/image /video推论的视觉语言模型.

具有成本效益的全方位模式处理文本,图像,音频,视频,90+语言的音频最多3小时,视频最多1小时.

Flagship omni-model for text, image, audio, and video. 互联网档案馆的存檔,存档日期2014-03-02., p. 3h音频,1h视频,90+输入和30+输出语言,55声调调调.
具有混合结构的多模式模型,用于在1M上下文中高效的深度思考和视觉理解,跨越文本,图像,视频.
具有混合结构的多模式模型,用于在1M上下文中高效的深度思考和视觉理解,跨越文本,图像,视频.

3.6系列中最大型的预览变体(仅文本):改进编码代理执行,加强前端技能,拓宽长尾知识.

视觉语言模式,主要升级超过3.5:代理和前端编码,多式联运识别,OCR,以及对象本地化.
视觉语言模式,主要升级超过3.5:代理和前端编码,多式联运识别,OCR,以及对象本地化.
256K-context旗舰,在推理,指令跟随,以及多语种支持方面有重大改进,加上更高的 coding/math 准确度.
预览发布在中英文理解,复杂指令,多语种能力,工具使用方面与2.5系列相比有重大收益.
使用适应性工具(搜索,内存,代码解释器)和测试时间缩放以提升复杂任务的精度的理性模型.

语义文档重排. 每个查询按相关性排序最多500名考生,支持100+语言,接受自定义排序指令.

编码调试了256K-context模型,具有强大的前端结果和AI编码工具和代理的多语言编程支持.

高频企业工作量的平衡通用模式:信息处理,内容,搜索,数据分析.

以256K为上下文的以延迟为重点的多式联运模式,四种推理努力模式,以及 image/video 理解高通币使用.

具有256K背景的旗舰通用模型,用于复杂的推理,多式联运理解,结构化生成,以及工具强化执行.

速度优化2.0视频变体,用于电影片段,具有本土音频同步,相机控制,稳定运动,每渲染成本较低.

从文字,图像,音频,或视频输入输出的多模式影视模式,具有稳定的运动和一致的字符.

统一的多式联运图像模型,在渲染前通过提示说明理由,产生高分辨率和一致的编辑和品牌视觉.

高级Seedream图像模型,支持详细的text-to-image、单图编辑和多重参考融合,输出1K和2K。

开源语音模型,用于长形,多语种播客对话,配有准语言控制(笑声,叹息)和零镜头语音克隆.

从文本提示生成最多3分钟的音频,支持 text-to-audio 和 audio-to-audio,具有可调整的持续时间,步骤,和CFG比例.

上 to-3-minute 音频从文本中带 text-to-audio, audio-to-audio,以及用于音乐制作,音效设计,和重混的音频涂装.

在WAN 2.2上的Stable Video Infinity 2.0 Pro:将静态图像扩展为理论上无限长的视频,同时保持一致的角色ID.

多语言文本嵌入可选择输出维度(64–2048). 每个输入最高可达8,192个令牌.

速度优化多模式嵌入 - - 与Vision-Plus相同形状,3×更便宜 image/video 符牌.

多模式嵌入生成文本、图像和视频输入的独立矢量。
多模式视频生成模式,用于电影,多镜头故事的本土视听同步(lip-sync,对话,音乐,SFX).

支持T2V,I2V,视频编辑的多模式视频模型,以及 reference-to-video,由文本,图像,或视频输入的高精度输出.

图像生成和编辑伴模: text-to-image,边框编辑,以及凝聚的图像集,在Pro上输出最多4K.
受控Whisper Large v3 Turbo转录,支持多语言ASR、翻译、VAD、时间戳、字幕、热词和解码控制。

图像对视频模型,将源图像动画为即时导动,在480p或720p时最长可达15秒,跨7个方面的比例.

代理工作流程的顶级模型,复杂的软件工程,以及长视野任务,维持跨1000+工具的工作需要1M上下文.

1M上下文具有本土视觉和音频理解的多式联运模式,旨在对代理工作流程中的各种模式进行推理和采取行动。

文字、图片和reference-to-video合一模型。电影般的动作,最多9个参考元素中的角色一致性,以及同步的原生音频。

这是Seedance 2.0中最快、最实惠的版本,支持原生音频、摄像控制以及480p和720p的图像或视频输入,支持短片电影。

StepFun 多模态推理模型,具备图像和视频输入、工具调用、可调节推理努力和 256K 上下文。

StepFun 文本推理模型,适用于代理、编码、工具调用和长上下文分析。

代理优化的Step 3.5闪存变体,具有低推理和高推理工作模式。

StepFun 图像生成和图像编辑模型,用于text-to-image和单张图像编辑。

情境式 StepFun text-to-speech具有自然语言语音指导和富有表现力的模型。

Next-generation coding and agent model with engineering-grade code delivery, long-horizon autonomy, and 256K multimodal understanding.

Tiered speech synthesis with over 1,000 voices, 16 languages, 20 Chinese dialects, natural-language delivery direction, and inline emotion tags.
127 / 141 模型