Skip to main content
POST
万相 Wan 系列
万相(Wan)是阿里通义的视频模型线。本页覆盖九个视频模型:wan2.5-preview、wan2.6、wan2.6-i2v、wan2.6-i2v-flash 做文生与图生,wan2.7 与 wan3.0-video / wan3.0-video-prime 是多模态统一入口(文本、首尾帧、参考素材、视频续写走同一个模型 ID),wan2.7-r2v 做参考生视频,wan2.7-videoedit 做视频编辑。九个模型共用 POST /v1/tasks,换模型只改 model,但参数集合、可传的媒体输入和计费维度各不相同。万相的图像模型见 Wan Image 系列。 wan3.0-video-prime 是 wan3.0-video 的加速版:参数、取值范围、约束与计费维度相同,出片更快、单价更高。

快速开始

提交成功后返回 task_id。用 GET /v1/tasks/{task_id} 查询结果,也可以用 Prefer: wait 在一次调用里等待,或配置 Webhook。

请求参数

string
必填
九选一:wan2.5-preview、wan2.6、wan2.6-i2v、wan2.6-i2v-flash、wan2.7、wan2.7-r2v、wan2.7-videoedit、wan3.0-video / wan3.0-video-prime。
string
默认值:"generate"
  • generate:生成视频。wan2.7-videoedit 之外的七个模型只支持这个动作
  • edit:编辑输入视频。只有 wan2.7-videoedit 支持,且它只支持这一个动作
string
视频内容描述或编辑指令。wan2.7-r2v 必填。wan2.7 与 wan3.0-video / wan3.0-video-prime 在没有任何媒体输入时必填。其余模型可选,但用于指导运镜与动作。
string
负面提示词,排除不想要的内容。wan3.0-video / wan3.0-video-prime 不接受这个参数,其余七个模型都接受。
string[]
图片输入。语义与张数上限按模型不同:
  • wan2.5-preview / wan2.6:传入即进入图生视频模式
  • wan2.6-i2v / wan2.6-i2v-flash:必传,恰好 1 张,作首帧,画幅跟随图片
  • wan2.7:1–2 张(1 张为首帧,2 张为首尾帧);与 first_frame_image、video_urls、aspect_ratio 互斥
  • wan2.7-r2v:1–5 张主体 / 风格参考;与 video_urls 互斥;与 first_frame_image 同传时最多 4 张
  • wan2.7-videoedit:最多 4 张风格 / 内容参考
  • wan3.0-video / wan3.0-video-prime:最多 10 张;generation_type: "frame" 时只接受 1–2 张帧图
string
首帧图片 URL。wan2.7、wan2.7-r2v 与 wan3.0-video / wan3.0-video-prime 接受。
  • wan2.7:不能与 image_urls、video_urls 或 aspect_ratio 混用
  • wan2.7-r2v:最多搭配 4 张参考图,不能与 video_urls 或 aspect_ratio 混用,比例跟随首帧
  • wan3.0-video / wan3.0-video-prime:不能与 image_urls、video_urls、audio_urls、file_url、link_url 混用
string
尾帧图片 URL。wan2.7 与 wan3.0-video / wan3.0-video-prime 接受,必须与 first_frame_image 一起提供。
string[]
视频输入。段数与时长上限按模型不同:
  • wan2.7:最多 1 段,2–10 秒,用于视频续写
  • wan2.7-r2v:最多 5 段,单段 1–30 秒
  • wan2.7-videoedit:必传,恰好 1 段,2–10 秒
  • wan3.0-video / wan3.0-video-prime:最多 5 段,单段最长 15 秒、合计最长 15 秒
string[]
自定义音频。wan2.6-i2v-flash 最多 1 段(3–30 秒),wan2.7 最多 1 段(2–30 秒),wan3.0-video / wan3.0-video-prime 最多 5 段(单段 1–15 秒、合计最长 15 秒)。其余模型不接受。
boolean
是否生成有声视频。wan2.6 默认 false;wan2.6-i2v-flash 与 wan3.0-video / wan3.0-video-prime 默认 true;wan2.5-preview 只生成有声视频,默认 true,不能传 false。其余模型不接受这个参数。
string
输出分辨率:
  • wan2.5-preview:480p、720p、1080p
  • wan2.6、wan2.6-i2v、wan2.6-i2v-flash、wan2.7、wan2.7-r2v、wan2.7-videoedit:720p、1080p
  • wan3.0-video / wan3.0-video-prime:480p、720p、1080p
默认值:wan3.0-video / wan3.0-video-prime 为 480p,其余模型为 720p。
integer
输出时长(秒):
  • wan2.5-preview:5 或 10
  • wan2.6:5、10 或 15
  • wan2.6-i2v、wan2.6-i2v-flash、wan2.7、wan2.7-r2v:2–15 任意整数
  • wan2.7-videoedit:2–10 任意整数,另接受 0(沿用源视频时长)
  • wan3.0-video / wan3.0-video-prime:2–30 任意整数;不传或传 0 由模型自定时长(2–30 秒;带参考视频时输入与输出合计不超过 30 秒),按实际出片秒数结算
wan2.6-i2v 默认 5。带 video_urls 时输出时长另有上限:wan2.7 与 wan2.7-r2v 最长 10 秒,wan3.0-video / wan3.0-video-prime 最长 15 秒。
string
画面比例。wan2.5-preview、wan2.6、wan2.7、wan2.7-r2v、wan2.7-videoedit 支持 16:9、9:16、1:1、4:3、3:4;wan3.0-video / wan3.0-video-prime 在这五种之外还支持 adaptive,默认 adaptive。wan2.6-i2v 与 wan2.6-i2v-flash 不接受这个参数,画幅跟随输入图。另外几种情况下这个参数也不能传:wan2.5-preview 与 wan2.6 带 image_urls 时、wan2.7 带 first_frame_image / image_urls / video_urls 时、wan2.7-r2v 带 first_frame_image 时——这些场景的画幅跟随输入素材。
integer
随机种子。相同请求配相同种子会生成相似结果。九个模型都接受。
boolean
是否给输出视频加水印。九个模型都接受。
boolean
默认值:"true"
提示词智能扩写,对短提示词效果提升明显。wan3.0-video / wan3.0-video-prime 不接受这个参数,其余七个模型都接受。wan2.6-i2v 与 wan2.6-i2v-flash 在设置 shot_type 时要求 prompt_extend 为 true。
string
镜头类型:single(单镜头连续)或 multi(多镜头叙事)。只有 wan2.6、wan2.6-i2v、wan2.6-i2v-flash 接受。
string
特效模板。使用时只需一张图片,prompt 被忽略。wan2.6-i2v 与 wan2.6-i2v-flash 的取值:squish、rotation、poke、inflate、dissolve、carousel、singleheart、flying、rose、hug、frenchkiss、coupleheart。wan2.6 接受特效模板名字符串。
string
指定音频地址,优先级高于 generate_audio。只有 wan2.5-preview 与 wan2.6 接受。
array
带角色的图片数组,每项 {url, role},role 取 first_frame、last_frame 或 reference;与 first_frame_image / last_frame_image 合并发送。只有 wan2.7、wan2.7-r2v、wan3.0-video / wan3.0-video-prime 接受。
string
图片数组的归属:frame(首尾帧)或 reference(参考图)。只有 wan3.0-video / wan3.0-video-prime 接受;不传时由输入素材自动判定。
string
参考文档地址。只有 wan3.0-video / wan3.0-video-prime 接受,与 link_url 互斥。
参考网页地址。只有 wan3.0-video / wan3.0-video-prime 接受,与 file_url 互斥。
object
附加参数对象,目前只有 audio_setting:auto(自动生成音频)或 origin(保留源视频音频)。只有 wan2.7-videoedit 接受。
通用的 callback_url、callback_events、Prefer: wait、Idempotency-Key 和费用上限请求头见提交任务。 九个模型都不接受 n 与 quality。以上之外的参数会返回 400,不计费。

限制

计费

全系按分辨率档 × 输出秒数计费,带输入视频时另按输入秒数加收一笔。 带声档(wan2.6-i2v-flash):开启音频生成(generate_audio: true,该模型默认即为 true)或传了 audio_urls 时按带声档计。 输入视频秒数在提交时读取;wan2.7-videoedit 的源视频读不到时长时返回 400(input_video_duration_unknown),不计费。读取规则见视频生成概述。 wan3.0-video / wan3.0-video-prime 提交时冻结额度(duration 为 0 或不传时按 30 秒冻结),完成后按实际生成结果结算退差。
各模型的单价见 GET /v1/models 返回的 price_config,或控制台「模型市场」。看这一单实际花了多少:任务响应里的 cost(整数 quota,500,000 quota = 1 USD)。
只有成功出片才计费。任务失败、取消,或没有返回可用视频时,全额退款。最终费用以任务响应里的 cost 为准,它是整数 quota 不是美元。

响应

任务完成
result.videos 返回生成的视频,url 是数组,expires_at 是视频链接的过期时间戳。完整字段说明见查询任务状态。

可用模型

生成类(action: "generate") 视频编辑(action: "edit")

相关文档