简短回答: 万3.0 是阿里巴巴all-in-one视频模型,通过一个类似OpenAI的终端在EmpirioLabs上提供。它生成2到30秒的同步音频片段,一次请求最多可调用10张参考图片、5个参考视频、5个音频片段以及文档或网页。叫它 型号:“wan-3-0” 打开 后 /v1/videos/generations,并选择供应层次 model_tier编号: 标准 对于基础费率,或者 首选 因此产生了显著更快的end-to-end。
与万2.7相比有什么新变化
| 能力 | 湾 2.7 | 万3.0 |
|---|---|---|
| 输出长度 | 2到15秒 | 2到30秒,或者让模特自行选择 |
| 参考资产 | 5次总计 | 10张图片,5段视频和5段音频片段 |
| 文档和网页参考 | 不支持 | 每个请求需要1个文件或1个公共链接 |
| 决议 | 720p,1080p | 480p、720p、1080p |
| 宽高比 | 固定预设 | 默认自适应,加上五个预设 |
| 服务等级 | 一 | 标准版和Prime(端到端更快) |
快速启动
视频生成是同步的. 提交工作,然后调查它。
curl -X POST https://api.empiriolabs.ai/v1/videos/generations \ -H “授权:承载者 $EMPIRIOLABS_API_KEY” \ -h “内容类型:application/json” \ -d '{ “model”:“wan-3-0”, “model_tier”:“prime”, “prompt”:“一只蜂鸟在金色时分的红花上方盘旋,慢动作”, “分辨率”: “1080p”, “duration”: 6 }' # -> {“job_id”: “...”, “status”: “processing”, “poll_url”: “/v1/jobs/...”} curl https://api.empiriolabs.ai/v1/jobs/JOB_ID \ -H “授权: 承载者$EMPIRIOLABS_API_KEY”
三种驾驶方式
- 文本转视频: 仅一个提示词,最多可达20,000字符。输出默认包含生成的音轨;场景
音频:错误用同样的价格买无声夹。 - 第一帧和最后一帧: 附加一张图像来动画,或者恰好是两张图像,模型会插值它们之间的路径。
- 全能参考: 附上任意混合的参考图片、视频和音频,并可选地附上一份文档或一个公开网页链接,然后在提示中写道:
图片1, (中文),视频1, (中文),音频1.模型将主体、运动和声音带入新场景。
该 模式 参数为可选: 自动 会读懂你的感情并为你挑选。
作战笔记
- 第一帧和最后帧输入不能在同一请求中与参考输入合并。向图片请求添加音频、文档或网页链接时,会将其切换到引用模式,也就是显式
模式:“I2V”音频会返回验证错误;离开模式自动运行,请求会自动路由。 - 每张输入图像每边至少240像素,最多8000像素。较小的图像在生成开始前会被拒绝。
- 通过视频参考,输入秒和输出秒共享一个30秒预算,计费秒覆盖输入加输出的总和。工作结果会报告具体的计费时长。
持续时间:-1让模型从提示和参考中选择剪辑长度;计费是根据工作结果中的实际秒数计算的。
定价
WAN 3.0是按使用量付费,按分辨率和服务等级设定的每秒视频计费。Prime每秒成本高于标准,且返回速度明显更快。目前六种组合的每秒速率均为 模型页面 页:1 定价页面。 。 。.
试试看吧
运行它 操场 没有代码,或者读到 API 参考 完整参数列表。万3.0还为playground效果标签页中的创意特效提供动力。上一代, 湾 2.7,仍然可以通过其视频编辑模式使用。



