All models

kling-v2-1-master

KuaishouVideo
14–28 Credits
Get your API key
kling-v2-1-master

面向画面质量与一致性的短视频创作模型

kling-v2-1-master 是快手可灵 V2.1 Master 视频模型,适合重视画面质量与视觉一致性的短片创作。它可从文字描述构建镜头,也可用首帧图片启动动画,生成 5 秒或 10 秒视频。在本平台中,还可通过会说话的照片功能,将人物照片与已有音频制作成口型同步视频。

Kuaishou模型品牌
视频模型类型
视频任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

创作方式
文生视频、首帧图生视频
视频时长
5 秒或 10 秒
视频画幅
16:9、9:16、1:1
提示控制
prompt、negative_prompt;cfg_scale 范围 0–1
生成结果
视频链接、视频 ID、任务 ID、时长与状态
照片口播输入
人物照片与音频链接;音频支持 mp3/wav/m4a/aac,≤5MB

以上为本平台对应入口的可用规格;照片口播通过动画化与口型同步完成,不属于模型原生伴音。

核心能力

了解 kling-v2-1-master 能为你的工作带来什么。

以画面质量与一致性为选择重点

V2.1 Master 的定位侧重画面质量与一致性,适合把注意力放在主体表现、场景氛围和镜头整体观感上。创作时可用文字明确主体、动作、环境和光线,再围绕同一镜头调整描述,比较不同结果,选取适合剪辑与展示的片段。

从文字构想或现有图片起步

没有现成视觉素材时,可用文生视频探索镜头;已有产品图、人物照或场景图时,可用首帧图生视频从指定画面开始。两种方式分别服务于概念探索和素材动画化,提示词重点描述接下来发生的动作,而不是仅重复图片内容。

让人物照片配合已有声音表达

会说话的照片功能接收人物照片和录制好的音频,先生成照片动画,再完成口型同步。可用提示词补充表情或动作要求,获得最终口播视频及中间动画视频,适合已有声音素材、希望快速形成短段人物表达的制作流程。

适用场景

从具体任务出发,找到模型发挥作用的位置。

产品图片转成展示短片

以产品图片作为首帧,描述想要的动作、环境变化和展示重点,制作适合商品介绍或社交内容的短视频。根据投放位置选择横屏、竖屏或方形画幅,交付可进入剪辑流程的视频素材;本型号不通过尾帧图片指定最终构图。

脚本镜头与氛围预演

将脚本拆成独立镜头,为每段写明主体、动作和场景,用文生视频制作视觉草案。5 秒片段可用于简短动作展示,10 秒片段可容纳更完整的过程表达,输出用于讨论构图、节奏和氛围的预演素材,而非一次完成整部影片。

照片口播与角色短句

准备清晰的单人正脸照片与短段音频,制作介绍、问候或角色台词视频。音频建议不长于选定的视频时长,提示词可补充希望出现的表情和动作。最终视频用于口播交付,中间动画则可用于检查照片动态表现。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

质量取向明确,优先考虑 V2.1 Master

在 V2 Master 与 V2.1 Master 之间选择时,可将 V2.1 Master 作为更关注质量与一致性的候选,用同一提示词或首帧比较实际结果。两者都不能因 Master 名称而被理解为支持全部高级控制。若希望使用尾帧约束,可考虑支持该能力的 V2.5 Turbo pro。

需要声音或多素材编辑时换一种方案

普通视频创作需要同步伴音时,可考虑 V2.6 pro 或 V3;需要原生 4K 时可考虑 V3 系列的对应模式。若任务是多图参考、参考视频或已有视频编辑,可选择 O1 或 V3 Omni。已有照片与音频的短口播,则可继续使用本型号的会说话的照片功能。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 普通视频生成不支持尾帧图片、结构化 camera_control 运镜控制或原生同步伴音。可以在提示词中描述镜头意图,但不能把这种描述等同于可精确设定的运镜参数,也不应按首尾帧插值流程设计任务。
  • 本型号按 5 秒或 10 秒短片组织创作,不支持原生 4K 模式,也不提供 Omni 多图参考和参考视频编辑。较长内容宜先拆镜头再剪辑,不要将多个参考素材或延长视频作为默认创作方式。
  • 照片口播需要提供已有音频,并非输入台词就自动生成声音。照片建议清晰、单人、正脸,音频文件不超过 5MB,时长尽量匹配视频;侧脸、遮挡或过长音频不宜作为首选素材。

常见问题

解答使用 kling-v2-1-master 时的常见疑问。

V2.1 Master 和 V2 Master 怎样选?

V2.1 Master 更适合作为画面质量与一致性取向的候选。建议使用相同提示词或首帧比较两者的实际结果,而不是只看版本名称。两者在这里都按 5 秒或 10 秒短片使用,不能据此推定更多控制能力。

图生视频可以同时指定首帧和尾帧吗?

本型号采用首帧图生视频:提交 start_image_url,并用提示词描述后续动作,不支持 end_image_url 尾帧约束。若必须指定结束画面,可选择支持首尾帧的型号,例如 V2.5 Turbo pro,再按相应创作方式准备素材。

普通视频和会说话的照片有什么区别?

普通视频从文字或首帧图片生成动态画面,本型号不原生同步生成伴音。会说话的照片则必须提供照片和已有音频,通过动画化与口型同步生成口播视频;其中音频是输入素材,不是模型自动创作的声音。

怎样提交一个本型号的视频任务?

调用 POST /kling/videos,显式设置 model 为 kling-v2-1-master,选择 text2video 或 image2video,并提交提示词及 5 或 10 秒时长。图生视频还需首帧图片链接,完成后通过 video_url 获取生成视频。

批量制作时如何跟踪生成结果?

可设置 async=true,先保存返回的 task_id,再查询任务进度;也可配置 callback_url 接收完成通知。取得结果后按任务 ID 关联视频链接和状态。照片口播同样可采用异步方式,并返回最终视频及中间动画链接。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 kling-v2-1-master 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。