视频生成
万相 Wan 系列
阿里通义万相视频模型:文生、图生、参考生与视频编辑,统一任务入口,按分辨率档 × 秒数计费
POST
万相 Wan 系列
万相(Wan)是阿里通义的视频模型线。本页覆盖九个视频模型:
提交成功后返回
通用的
只有成功出片才计费。任务失败、取消,或没有返回可用视频时,全额退款。最终费用以任务响应里的
wan2.5-preview、wan2.6、wan2.6-i2v、wan2.6-i2v-flash 做文生与图生,wan2.7 与 wan3.0-video / wan3.0-video-prime 是多模态统一入口(文本、首尾帧、参考素材、视频续写走同一个模型 ID),wan2.7-r2v 做参考生视频,wan2.7-videoedit 做视频编辑。九个模型共用 POST /v1/tasks,换模型只改 model,但参数集合、可传的媒体输入和计费维度各不相同。万相的图像模型见 Wan Image 系列。
wan3.0-video-prime 是 wan3.0-video 的加速版:参数、取值范围、约束与计费维度相同,出片更快、单价更高。
快速开始
task_id。用 GET /v1/tasks/{task_id} 查询结果,也可以用 Prefer: wait 在一次调用里等待,或配置 Webhook。
请求参数
string
必填
九选一:
wan2.5-preview、wan2.6、wan2.6-i2v、wan2.6-i2v-flash、wan2.7、wan2.7-r2v、wan2.7-videoedit、wan3.0-video / wan3.0-video-prime。string
默认值:"generate"
generate:生成视频。wan2.7-videoedit之外的七个模型只支持这个动作edit:编辑输入视频。只有wan2.7-videoedit支持,且它只支持这一个动作
string
视频内容描述或编辑指令。
wan2.7-r2v 必填。wan2.7 与 wan3.0-video / wan3.0-video-prime 在没有任何媒体输入时必填。其余模型可选,但用于指导运镜与动作。string
负面提示词,排除不想要的内容。
wan3.0-video / wan3.0-video-prime 不接受这个参数,其余七个模型都接受。string[]
图片输入。语义与张数上限按模型不同:
wan2.5-preview/wan2.6:传入即进入图生视频模式wan2.6-i2v/wan2.6-i2v-flash:必传,恰好 1 张,作首帧,画幅跟随图片wan2.7:1–2 张(1 张为首帧,2 张为首尾帧);与first_frame_image、video_urls、aspect_ratio互斥wan2.7-r2v:1–5 张主体 / 风格参考;与video_urls互斥;与first_frame_image同传时最多 4 张wan2.7-videoedit:最多 4 张风格 / 内容参考wan3.0-video/wan3.0-video-prime:最多 10 张;generation_type: "frame"时只接受 1–2 张帧图
string
首帧图片 URL。
wan2.7、wan2.7-r2v 与 wan3.0-video / wan3.0-video-prime 接受。wan2.7:不能与image_urls、video_urls或aspect_ratio混用wan2.7-r2v:最多搭配 4 张参考图,不能与video_urls或aspect_ratio混用,比例跟随首帧wan3.0-video/wan3.0-video-prime:不能与image_urls、video_urls、audio_urls、file_url、link_url混用
string
尾帧图片 URL。
wan2.7 与 wan3.0-video / wan3.0-video-prime 接受,必须与 first_frame_image 一起提供。string[]
视频输入。段数与时长上限按模型不同:
wan2.7:最多 1 段,2–10 秒,用于视频续写wan2.7-r2v:最多 5 段,单段 1–30 秒wan2.7-videoedit:必传,恰好 1 段,2–10 秒wan3.0-video/wan3.0-video-prime:最多 5 段,单段最长 15 秒、合计最长 15 秒
string[]
自定义音频。
wan2.6-i2v-flash 最多 1 段(3–30 秒),wan2.7 最多 1 段(2–30 秒),wan3.0-video / wan3.0-video-prime 最多 5 段(单段 1–15 秒、合计最长 15 秒)。其余模型不接受。boolean
是否生成有声视频。
wan2.6 默认 false;wan2.6-i2v-flash 与 wan3.0-video / wan3.0-video-prime 默认 true;wan2.5-preview 只生成有声视频,默认 true,不能传 false。其余模型不接受这个参数。string
输出分辨率:
wan2.5-preview:480p、720p、1080pwan2.6、wan2.6-i2v、wan2.6-i2v-flash、wan2.7、wan2.7-r2v、wan2.7-videoedit:720p、1080pwan3.0-video/wan3.0-video-prime:480p、720p、1080p
wan3.0-video / wan3.0-video-prime 为 480p,其余模型为 720p。integer
输出时长(秒):
wan2.5-preview:5或10wan2.6:5、10或15wan2.6-i2v、wan2.6-i2v-flash、wan2.7、wan2.7-r2v:2–15任意整数wan2.7-videoedit:2–10任意整数,另接受0(沿用源视频时长)wan3.0-video/wan3.0-video-prime:2–30任意整数;不传或传0由模型自定时长(2–30 秒;带参考视频时输入与输出合计不超过 30 秒),按实际出片秒数结算
wan2.6-i2v 默认 5。带 video_urls 时输出时长另有上限:wan2.7 与 wan2.7-r2v 最长 10 秒,wan3.0-video / wan3.0-video-prime 最长 15 秒。string
画面比例。
wan2.5-preview、wan2.6、wan2.7、wan2.7-r2v、wan2.7-videoedit 支持 16:9、9:16、1:1、4:3、3:4;wan3.0-video / wan3.0-video-prime 在这五种之外还支持 adaptive,默认 adaptive。wan2.6-i2v 与 wan2.6-i2v-flash 不接受这个参数,画幅跟随输入图。另外几种情况下这个参数也不能传:wan2.5-preview 与 wan2.6 带 image_urls 时、wan2.7 带 first_frame_image / image_urls / video_urls 时、wan2.7-r2v 带 first_frame_image 时——这些场景的画幅跟随输入素材。integer
随机种子。相同请求配相同种子会生成相似结果。九个模型都接受。
boolean
是否给输出视频加水印。九个模型都接受。
boolean
默认值:"true"
提示词智能扩写,对短提示词效果提升明显。
wan3.0-video / wan3.0-video-prime 不接受这个参数,其余七个模型都接受。wan2.6-i2v 与 wan2.6-i2v-flash 在设置 shot_type 时要求 prompt_extend 为 true。string
镜头类型:
single(单镜头连续)或 multi(多镜头叙事)。只有 wan2.6、wan2.6-i2v、wan2.6-i2v-flash 接受。string
特效模板。使用时只需一张图片,
prompt 被忽略。wan2.6-i2v 与 wan2.6-i2v-flash 的取值:squish、rotation、poke、inflate、dissolve、carousel、singleheart、flying、rose、hug、frenchkiss、coupleheart。wan2.6 接受特效模板名字符串。string
指定音频地址,优先级高于
generate_audio。只有 wan2.5-preview 与 wan2.6 接受。array
带角色的图片数组,每项
{url, role},role 取 first_frame、last_frame 或 reference;与 first_frame_image / last_frame_image 合并发送。只有 wan2.7、wan2.7-r2v、wan3.0-video / wan3.0-video-prime 接受。string
图片数组的归属:
frame(首尾帧)或 reference(参考图)。只有 wan3.0-video / wan3.0-video-prime 接受;不传时由输入素材自动判定。string
参考文档地址。只有
wan3.0-video / wan3.0-video-prime 接受,与 link_url 互斥。string
参考网页地址。只有
wan3.0-video / wan3.0-video-prime 接受,与 file_url 互斥。object
附加参数对象,目前只有
audio_setting:auto(自动生成音频)或 origin(保留源视频音频)。只有 wan2.7-videoedit 接受。callback_url、callback_events、Prefer: wait、Idempotency-Key 和费用上限请求头见提交任务。
九个模型都不接受 n 与 quality。以上之外的参数会返回 400,不计费。
限制
计费
全系按分辨率档 × 输出秒数计费,带输入视频时另按输入秒数加收一笔。
带声档(
wan2.6-i2v-flash):开启音频生成(generate_audio: true,该模型默认即为 true)或传了 audio_urls 时按带声档计。
输入视频秒数在提交时读取;wan2.7-videoedit 的源视频读不到时长时返回 400(input_video_duration_unknown),不计费。读取规则见视频生成概述。
wan3.0-video / wan3.0-video-prime 提交时冻结额度(duration 为 0 或不传时按 30 秒冻结),完成后按实际生成结果结算退差。
各模型的单价见
GET /v1/models 返回的 price_config,或控制台「模型市场」。看这一单实际花了多少:任务响应里的 cost(整数 quota,500,000 quota = 1 USD)。cost 为准,它是整数 quota 不是美元。
响应
任务完成
result.videos 返回生成的视频,url 是数组,expires_at 是视频链接的过期时间戳。完整字段说明见查询任务状态。
可用模型
生成类(action: "generate")
视频编辑(
action: "edit")