All models

wan2.6-i2v

AlibabaVideo
13.5–46.5 Credits
Get your API key
wan2.6-i2v

让静态主视觉变成有声多镜头短片

wan2.6-i2v 是 Alibaba Wan 2.6 系列的标准图生视频模型,以图片作为起始画面,再用文字描述动作、运镜与情节。它支持音画同步和多镜头叙事,适合把产品主视觉、人物插画或场景概念图转化为短片。相比只让画面轻微运动的创作方式,它更适合有明确开场、发展与收束的视觉表达。

Alibaba模型品牌
视频模型类型
视频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

创作方式
图片起始帧+文字提示生成视频
原生分辨率
720P、1080P
原生时长
2–15 秒
原生视频输出
30 fps、MP4
叙事与声音
多镜头叙事、音画同步
平台调用
POST /wan/videos;model=wan2.6-i2v;action=image2video
任务交付
支持异步任务,返回任务标识及视频结果链接

时长、分辨率与帧率为原生型号规格;平台通过图片地址、提示词和任务接口完成提交与结果获取。

核心能力

了解 wan2.6-i2v 能为你的工作带来什么。

从主视觉展开动作

图片提供起始构图,提示词负责说明接下来发生什么。可以围绕产品展示、人物动作或环境变化设计镜头,而不必从文字重新构建整个开场。建议明确主体、运动方向与相机变化,让静态素材成为短片的视觉起点。

用镜头顺序组织故事

多镜头叙事适合把短片写成简洁的拍摄计划,例如先展示环境,再呈现主体动作,最后收束到产品画面。创作重点不只是堆叠风格词,而是交代各段发生的事情与先后关系,让有限时长承载清晰的信息结构。

声音与画面共同表达

wan2.6-i2v 原生具备音画同步能力,创作时可以同时考虑视觉动作与声音氛围。提示词中可描述期望的场景声音和情绪,帮助表达有声短片的创作目标。成片仍应试听检查,尤其注意声音是否符合动作与整体节奏。

适用场景

从具体任务出发,找到模型发挥作用的位置。

产品主图动态化

以商品主图或活动视觉为输入,描述镜头靠近、主体展示与背景变化,生成用于商品介绍或社交传播的短片。制作时先确定要突出外观还是使用情境,再围绕一个重点设计动作,避免同时要求过多细节变化。

人物插画情节预演

把人物插画或角色概念图作为起始画面,配合简短情节说明,生成动作与镜头发展的预演视频。适合讨论角色出场、情绪转折和场景气氛,交付物可作为分镜沟通材料,再由创作团队选择值得继续制作的方向。

活动视觉短片试稿

从已有海报或场景概念图出发,分别尝试不同动作、运镜和声音氛围,形成可比较的视频草稿。适合在正式制作前讨论开场吸引力与叙事顺序;文字标题、品牌标识和行动提示可在后期统一排版,便于控制最终呈现。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

按素材选择 i2v、t2v 或 r2v

已有明确起始图片,希望把它发展成动态场景时,选择 wan2.6-i2v。只有文字构想时,可选 wan2.6-t2v;希望从已有视频提取人物外观并用于新场景时,应考虑 wan2.6-r2v。三者分别围绕图片、文字与视频参考展开创作,不宜仅替换素材字段就混用。

按迭代目标选择标准版或 Flash

wan2.6-i2v 是标准图生视频型号,wan2.6-i2v-flash 则强调快速生成,适合先探索多个镜头方向。与 wan2.5-i2v-preview 相比,2.6 明确支持多镜头叙事,原生时长范围也更宽。若任务需要短片中的情节推进,而非单个动作展示,2.6 更贴合这一需求。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 这是图生视频型号,不应把首尾帧联合控制、视频续写或多媒体文件参考视为它的默认能力。图片用于建立起始画面;需要视频参考角色迁移时,应选择对应的 r2v 型号,而不是将视频地址当作图片输入。
  • 原生输出范围为 720P、1080P 和 2–15 秒,不应按其他 Wan 型号规划更长时长或更低分辨率。长故事建议拆成多个短片,再通过剪辑组织;多镜头创作也要留出足够时间,避免动作与转场过于拥挤。
  • 图片起点与文字指令不等于逐帧锁定。产品细节、人物外观、镜头衔接及声音表现都需要在成片中检查;对必须准确呈现的文字和标识,建议后期添加。优先保持提示词简洁明确,再逐步增加复杂动作。

常见问题

解答使用 wan2.6-i2v 时的常见疑问。

wan2.6-i2v 需要怎样的输入?

使用图片地址 image_url 提供起始画面,并用 prompt 描述主体动作、场景变化和运镜。调用时选择 model=wan2.6-i2v,显式设置 action=image2video,避免使用默认的文生视频操作。提示词宜写成简短拍摄说明。

可以生成多长、什么清晰度的视频?

原生支持 2–15 秒视频,分辨率为 720P 或 1080P,输出为 30 fps 的 MP4。选择时应先考虑动作能否在目标时长内完整表达;需要长故事时,可以拆成多个短片,再进行剪辑,而不是把所有情节塞进一次生成。

如何让短片有多个镜头?

该型号原生支持多镜头叙事。可在提示词中按顺序描述开场、主要动作与结束画面,明确各镜头的主体、动作和衔接关系。各段应围绕同一主体和情节展开,减少相互矛盾的构图要求;镜头数量与切换效果并非逐项锁定,生成后应检查衔接是否自然。

支持有声视频吗?

wan2.6-i2v 原生支持音画同步,可用于有声短片创作。可以在提示词中交代声音氛围及其与画面动作的关系,但这不等同于精确配音或声音克隆。发布前仍需试听成片,检查声音内容、节奏与画面的对应关系。

提交后怎样取得生成结果?

可设置 async=true,以异步方式提交并获取 task_id,再通过 /wan/tasks 查询任务终态。成功结果可取得视频链接,响应还定义了视频尺寸和缩略图字段。业务流程应先确认任务成功,再进入预览、保存和发布环节。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 wan2.6-i2v 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。