图像生成
Wan Image 系列
阿里通义万相图像生成 — 文生图 / 图生图 / 多图参考 / 组图 / 交互式编辑
POST
Wan Image 系列
阿里通义万相 2.7 图像生成与编辑统一接口。提供 两个独立 model,共用同一接口与同一组参数,通过
提交后用
为输出指定主色调与配色比例,模型会按比例在画面中分配色彩占比。
结构:数组,每项为
在参考图上画框,告诉模型”只编辑框内区域”,外部保持原样。是 Wan 系列在交互式编辑场景下的独家能力。
结构:三层嵌套数组
示例(单图双框):
示例(多图,每图各一框):
model ID 区分,定价与最高分辨率不同:
wan2.7-image(标准版)— 最高 2K,$0.0243/ 张wan2.7-image-pro(专业版)— 最高 4K,$0.0612/ 张
- 文生图(generate) — 仅
prompt,可走思考模式 - 图生图(image2image) — 单参考图自由发挥
- 图像编辑(edit) — 局部重绘 / 风格迁移 / 元素替换
- 多图参考(reference) — 最多 9 张参考图融合
- 组图(group) —
enable_sequential连环画 / 分镜,n 上限 12 - 交互式编辑(interactive_edit) —
bbox_list框选区域定向编辑(独家)
定价
模式速查
调用示例
GET /v1/tasks/{task_id} 轮询状态,详见 任务系统。
可用模型
两个 model 共用同一接口、同一组参数,仅
model ID、定价与最高分辨率不同。
通用参数
string
默认值:"generate"
操作类型,可选值:
generate— 文生图(默认)image2image— 图生图(需配合image_urls单张)edit— 图像编辑(局部重绘 / 风格迁移)reference— 多图参考融合(最多 9 张)group— 组图生成(配合enable_sequential)interactive_edit— 交互式框选编辑(配合bbox_list)
string
必填
图像描述文本,支持中英文。组图模式建议用分镜式描述
integer
默认值:"1"
生成数量。普通模式取决于服务侧上限;组图模式(
enable_sequential: true)上限 12integer
默认值:"-1"
随机种子,
-1 为随机;固定值可复现相似结果string
默认值:"1:1"
画面宽高比,共 7 种:
1:1— 正方形16:9/9:16— 横/竖版宽屏4:3/3:4— 横/竖版标准3:2/2:3— 横/竖版相机比
string
默认值:"2K"
输出分辨率,取决于模型:
wan2.7-image:1K/2Kwan2.7-image-pro:1K/2K/4K
enable_sequential: true)上限为 2Kstring[]
参考图片 URL 数组:
image2image/edit/interactive_edit:1 张reference:2-9 张
模型特定参数
boolean
默认值:"false"
AI 生成水印
boolean
默认值:"true"
思考模式 — 启用后模型会先做视觉推理再出图,提升复杂 prompt 的解析准确度。生效条件:仅当非组图(
enable_sequential 不为 true)且无图输入(未提供 image_urls)时生效;其他情况自动忽略boolean
默认值:"false"
组图模式(连环画 / 分镜)。启用后:
n上限提升到 12resolution上限为 2Kthinking_mode与color_palette不生效
复合字段说明
color_palette — 自定义颜色主题
为输出指定主色调与配色比例,模型会按比例在画面中分配色彩占比。
结构:数组,每项为 {hex, ratio}
约束:
- 项数:3-10
ratio总和:严格 100(整数百分比)- 仅非组图模式生效(
enable_sequential为true时忽略)
bbox_list — 交互式编辑框
在参考图上画框,告诉模型”只编辑框内区域”,外部保持原样。是 Wan 系列在交互式编辑场景下的独家能力。
结构:三层嵌套数组 [[[x1, y1, x2, y2], ...], ...]
- 最外层:每项对应
image_urls中的一张图,一一对应(数量必须相等) - 中间层:某张图上的多个框,单图最多 2 个框
- 最内层:单个框的坐标,4 个数字
[x1, y1, x2, y2],代表左上角与右下角(像素坐标)
- 仅
action: "interactive_edit"时生效 - 每张图最多 2 个框
- 坐标基于参考图原始像素
资源限制
相关文档
Wan Image 系列