Wan v2.6

视频模型

概览

阿里巴巴的 WAN 2.6 生成 5-15 秒的电影级视频片段,支持多镜头叙事和最高 1080p 分辨率。支持文本生成视频和图像生成视频两种模式,并具有提示词扩展功能。

叙事不应局限于单个镜头。YouArt 上的 Wan v2.6 可将文本提示词或首帧图像转化为 5–15 秒的电影感片段,支持多镜头叙事,分辨率最高可达 1080p。无论是为电影创意构建连续场景、测试产品亮相方案,还是生成社交视频的吸睛开场,模型的提示词扩展功能都能帮助将简短描述转化为更完整的视觉场景。

概览:Wan v2.6 的功能

Wan v2.6 是 YouArt 上由 Alibaba 推出的视频模型,支持文生视频和图生视频。它面向需要生成电影感片段的创作者,支持多镜头叙事,并提供灵活的时长范围。输入文本描述,可按需上传首帧图像,再设置宽高比和时长即可。模型内置的提示词扩展功能可将简短提示词扩展为更详细的场景描述,提升连贯性和运动质量。输出时长为 5 至 15 秒,分辨率最高可达 1080p。

功能用途
支持多镜头叙事规划并生成相互衔接的连续场景,用于构建更长的叙事结构。
提示词扩展模型自动将简短提示词扩展为更详细的场景描述。
5–15 秒的时长范围生成聚焦于某个瞬间的 5 秒片段,或将时长延至 15 秒,呈现更完整的场景。
分辨率最高可达 1080p生成适用于客户审阅、社交平台发布或营销活动素材的高质量内容。
文生视频与图生视频从文本描述出发,或使用参考图像确定开场画面。

适用场景

电影感场景与叙事规划

使用 Wan v2.6 为电影创意、品牌视频或广告分镜生成一组相互衔接的场景片段。为每个场景编写提示词,按需使用首帧图像确定开场画面,并将每个片段生成为独立初稿。借助多镜头叙事支持,可以在正式投入完整制作流程之前,先规划更长的叙事。

产品与品牌视频创意

对于营销团队,Wan v2.6 是生成产品亮相创意和品牌视频初稿的实用工具。上传产品图像作为首帧,描述产品亮相方式和镜头运动,即可生成在具体场景中呈现产品的视频片段。提示词扩展功能有助于根据简短描述补充场景细节。

社交媒体内容与 B-roll 辅助素材

编写清晰的场景描述,即可生成分辨率最高达 1080p 的高质量 B-roll 辅助素材或社交视频吸睛开场。灵活的时长范围让你可以根据平台和内容形式,选择生成紧凑的 5 秒吸睛开场,或更长的 15 秒场景。

如何在 YouArt 上使用 Wan v2.6

可直接在 YouArt 的模型界面中使用 Wan v2.6。先编写简洁的场景描述,再决定是否需要首帧图像来确定开场构图。模型的提示词扩展功能会进一步完善描述,因此,聚焦的初始提示词比冗长的提示词更有帮助。

  1. 打开模型。在 YouArt 中进入 Wan v2.6 页面;如果工作区提示登录,请先登录。
  2. 选择输入。输入文本提示词,描述主体、动作、环境和镜头运动方式。也可上传首帧图像,用于确定开场构图。
  3. 让提示词扩展发挥作用。模型会将提示词扩展为更详细的场景描述。如果生成前可以看到扩展后的版本,请先检查。
  4. 设置格式。选择宽高比,并将时长设为 5 至 15 秒。
  5. 生成并检查。生成初稿,评估运动效果和构图,再调整提示词或首帧,进行下一轮迭代。

输入与输出

Wan v2.6 支持输入文本提示词和最多一张首帧图像。输出为时长 5 至 15 秒、分辨率最高达 1080p 的视频片段。模型的提示词扩展功能会自动扩展输入的提示词。

规格当前 YouArt 模型页面信息
输入方式文本提示词;最多一张首帧图像(两者均为可选项)
生成模式文生视频;图生视频
主要输出分辨率最高达 1080p 的视频
宽高比16:9, 9:16, 1:1
时长范围5–15 秒
分辨率最高 1080p
积分显示页面所示设置下为 90 积分;生成前请查看实时界面

提示词与使用示例

最有效的 Wan v2.6 提示词会清楚描述主体、环境和镜头运动。由于模型会自动扩展提示词,聚焦的初始描述通常比过于详尽的描述效果更好;后者留给扩展功能提升连贯性的空间较小。

示例 1:用于分镜规划的电影感场景

输入:日出时山间小径的首帧图像,加上文本。

提示词:一位徒步者沿着狭窄的小径行走,日出的第一缕光照亮了上方的山峰。镜头从侧面低角度跟拍,呈现小径、岩石以及洒在人物身上的暖光。

适用原因:首帧确定了地点和光照。提示词描述了主体、动作和镜头运动方式。模型的提示词扩展功能会补充场景细节,使输出比仅依靠极简描述时更连贯。

示例 2:产品亮相创意

输入:大理石台面上护肤品瓶的首帧图像,加上文本。

提示词:镜头缓缓环绕护肤品瓶,柔和的影棚灯光映出玻璃质感和标签。镜头运动平滑、连贯。

适用原因:首帧确定了产品和开场构图。提示词明确了镜头运动和光照表现。模型的提示词扩展功能会在不改变核心方向的前提下,进一步完善场景。

示例 3:社交视频吸睛开场

输入:文本提示词。

提示词:在 9:16 画面中,一位街头小吃摊主正在热闹的夜市里装盘。镜头保持稳定,食物热气升腾,周围的灯光营造出温暖而充满活力的氛围。

适用原因:竖屏画幅与聚焦单个瞬间的动作,使其适合作为社交视频的吸睛开场。提示词清楚地说明了镜头运动方式和氛围,足以让模型生成连贯的 5 秒片段。

使用技巧与限制

  • 编写聚焦的初始提示词。模型的提示词扩展功能会进一步完善描述,因此,简洁、具体的提示词通常比冗长的提示词效果更好。
  • 开场构图已经确定时,使用首帧图像。图像可确立场景,减少提示词需要提供的视觉指引。
  • 根据创意选择时长。生成 5 秒片段适合紧凑的产品亮相或社交视频吸睛开场;生成 10–15 秒片段则能为镜头在空间中移动留出余地。
  • 编写提示词前先选择画幅。为 9:16 设计的社交视频吸睛开场,与电影感的 16:9 场景需要不同的取景方式。
  • 限制:模型最多接受一张图像输入。如果需要首尾帧控制,可考虑 Kling v3.0 或 Seedance 2.0,两者均支持两张图像输入。
  • 限制:不支持原生音频。输出为无声视频片段,音频需另行添加。

对比与相关模型

YouArt 模型页面将 Wan v2.6 与其他视频生成选项一同展示。可参考下表,根据时长、分辨率、音频需求和输入控制,选择适合当前项目的模型。

相关模型适合改用该模型的情况

Wan v2.2

需要较早一代的 Wan 模型进行比较,或将其作为备用选项。

Kling v3.0

需要首尾帧控制、原生音频同步生成,以及最高 4K 输出。

Kling O3

希望选择 Kling 系列中支持多镜头分镜规划和首尾帧输入的另一款模型。

Seedance 2.0

希望选择由 ByteDance 提供、支持原生音频、4–15 秒时长和 1080p 输出的替代方案。

Vidu Q3

需要灵活的 1–16 秒时长,以及可选的音频生成和运动控制。

该模型主要适合以文本或首帧图像生成视频创意,尤其适用于优先考虑多镜头叙事支持和提示词扩展的项目。如需更全面地了解可用选项,可返回 YouArt 的视频模型页面,在投入积分正式生成之前,对比各模型页面显示的输入方式、设置和示例表现。

工作流应用

Wan v2.6 很适合用于视频制作工作流中的规划与创意阶段。凭借多镜头叙事支持和提示词扩展功能,它可以方便地生成一组场景初稿,供团队共同审阅。使用AI 视频工作流构建器,统筹从创意提示词到生成片段的流程衔接。

对于导演和设计师,Wan v2.6 可直接融入AI 分镜转视频工作流,其中每个生成的片段都对应较长场景序列中的一个叙事节点。对于产品和品牌团队,模型的图生视频模式是开展AI 产品演示视频生成器工作流的实用起点,可从产品图像出发构思视觉创意。

创作你的下一个视频

Wan v2.6 为导演、设计师、产品营销人员和社交内容创作者提供了直接测试电影感视频创意的方式,支持多镜头叙事和提示词扩展,分辨率最高可达 1080p。准备文本提示词、首帧图像或两者结合,选择适合场景的时长,即可将最初的想法转化为供团队评估的视觉初稿。