Skip to main content
POST
Wan 3.0 全能视频生成
Wan 3.0 的公共模型名为 wan3.0-video。同一个模型支持以下生成方式:
  • 文生视频
  • 首帧或首尾帧控制
  • 参考图片、参考视频和参考音频联合生成
  • 文件或公开网页内容参考
接口为异步任务。提交成功后返回任务 ID,再通过视频任务状态接口查询进度和结果。
首尾帧模式与参考素材模式互斥。只要请求中包含 first_framelast_frame,就不能同时传入参考图片、参考视频、参考音频、文件或网页链接。参考图片、参考视频和参考音频之间可以组合使用。

认证

string
必填
使用 Bearer Token 认证:

请求参数

string
默认值:"wan3.0-video"
必填
模型名称,固定为 wan3.0-video
string
视频内容、主体动作、镜头和声音描述。prompt 与媒体素材至少提供一项。使用多模态参考时,可以按数组顺序在提示词中写“图片1”“视频1”“音频1”。
integer
默认值:"5"
输出时长,支持 230 秒。
string
默认值:"adaptive"
输出宽高比,支持:
  • adaptive,根据参考素材自适应
  • 16:9
  • 9:16
  • 1:1
  • 4:3
  • 3:4
兼容字段 aspect_ratio 也可以使用。无需同时传入两个字段。
string
默认值:"1080p"
输出分辨率,支持 480p720p1080p
boolean
默认值:true
是否生成音频,默认开启。
boolean
默认值:false
是否添加水印,默认关闭。
integer
可选随机种子。相同参数和种子有助于复现相近结果。
object[]
首尾帧控制数组。每项包含:
  • url:公开可访问的图片 URL
  • rolefirst_framelast_frame
最多提供一个首帧和一个尾帧。使用 last_frame 时必须同时提供 first_frame
string[]
参考图片 URL 数组,最多 10 张。不能与 image_with_roles 中的首尾帧混用。
object[]
参考视频数组,最多 5 段,总时长不超过 15 秒。每项使用以下结构:
object[]
参考音频数组,最多 5 段,总时长不超过 15 秒。每项包含:
  • url:公开可访问的音频 URL
  • role:固定为 reference_audio
object
文件或网页参考通过 metadata.media 传入。
本地图片或视频需要先上传并取得公开 URL。不要在生成请求中直接传入本地文件路径或 base64 数据。

素材组合规则

如果收到以下错误:
请删除首帧/尾帧,保留参考素材;或者删除全部参考素材,只保留首帧/尾帧。

请求示例

文生视频

首尾帧生成视频

参考视频生成视频

不要在此请求中同时传入 first_framelast_frame

图片、视频和音频联合参考

文件参考

响应

string
视频任务 ID,用于查询任务状态。
string
对象类型,通常为 generation.task
string
本次请求使用的模型名称。
string
任务状态:queuedin_progresscompletedfailed
integer
任务进度,范围为 0100
integer
任务创建时间戳。