Veo 3
视频模型
概览
高质量视频生成模型,提供提示词增强和自动修复功能。支持文本生成视频和图像生成视频,并提供灵活的宽高比(16:9、9:16)。可选生成音频。可接受提示词和首帧输入。
Veo 3
规格
- 类别
- 视频模型
- 输入
- 文本, 图像
- 输出
- 视频
- 价格
450
最多接受 1 个图像输入:首帧。
能力
- 生成
- 动画化
- 文生视频
- 图生视频
- 起始帧
常见问题
你的视频创意也值得享有 Google 处理最高要求的视觉任务时所采用的同等品质标准。YouArt 上的 Veo 3 能将文本提示词或首帧图像转化为高质量的 8 秒视频,支持可选的音频生成、提示词增强和自动修复功能。这款由 Google 开发的模型面向需要可靠、高保真生成效果的创作者,能够处理复杂的场景描述,并以 720p 分辨率输出连贯的画面。
概览:Veo 3 能做什么
Veo 3 是 YouArt 上由 Google 开发的视频模型,支持文生视频和图生视频。它面向需要高质量视频输出、提示词增强和自动修复功能的创作者。提供文本描述,按需上传首帧图像,再设置画面比例即可。模型的提示词增强功能会在生成前将输入描述扩展为更详细的场景描述,自动修复功能则有助于自动纠正常见的生成问题。模型还提供可选的音频生成功能,可自行决定是否为输出添加同步声音。
| 功能 | 能带来什么帮助 |
|---|---|
| 提示词增强 | 模型会在生成前自动将输入描述扩展为更详细的场景描述。 |
| 自动修复功能 | 自动纠正常见的生成问题,有助于输出更连贯的画面。 |
| 可选音频生成 | 根据所处的工作流阶段,选择是否在输出中加入同步音频。 |
| 高质量 720p 输出 | Google 的 Veo 3 架构可输出分辨率为 720p 的高保真画面。 |
| 文生视频与图生视频 | 从文本描述开始创作,或使用参考图像确定开场画面。 |
适用场景
高保真场景生成
如果最看重输出画面的质量,可以选择 Veo 3。模型的提示词增强和自动修复功能使其非常适合处理对连贯性和细节要求较高的复杂场景描述。用详细的提示词描述主体、环境、镜头运动和光照,让模型的增强功能进一步完善描述,生成高质量的画面。
产品与品牌可视化
对于需要高质量视觉参考来评审营销活动的团队,Veo 3 能将产品图像或品牌概念直接转化为精致的视频初稿。将产品图像作为首帧上传,描述产品的亮相方式和镜头运动,即可生成高保真视频片段,传达品牌的视觉品质标准。
创意开发与前期制作
对于导演、摄影指导和创意总监,Veo 3 是在前期制作阶段生成高质量视觉参考的实用工具。描述设想中的场景、镜头表现和光照,即可生成初稿,在拍摄前向制作团队传达视觉方向。
如何在 YouArt 上使用 Veo 3
Veo 3 可直接在 YouArt 的模型界面中使用。先详细描述想要生成的场景,再决定是否需要首帧图像来确定开场构图。模型的提示词增强功能会进一步扩展描述,因此,具体而详细的初始提示词能带来最佳效果。
- 打开模型。 进入 YouArt 的 Veo 3 页面,如果工作区提示登录,请先登录。
- 选择输入。 输入详细的文本提示词。也可以上传首帧图像,确定开场构图。
- 让提示词增强发挥作用。 模型会在生成前将提示词扩展为更详细的场景描述。初始提示词越具体,增强功能就越有发挥空间。
- 设置格式。 选择 16:9 或 9:16,并决定是否启用可选的音频生成功能。
- 生成并评审。 生成初稿后,评估画面质量;如果启用了音频,也一并检查音频效果。然后调整提示词或图像,进行下一轮迭代。
输入与输出
Veo 3 支持输入文本提示词和最多一张首帧图像。它输出分辨率为 720p 的高质量 8 秒视频,并可选择生成音频。模型的提示词增强和自动修复功能会在生成前处理输入,以提升输出质量。
| 规格 | 当前 YouArt 模型页面信息 |
|---|---|
| 输入方式 | 文本提示词;最多一张首帧图像(可选) |
| 生成模式 | 文生视频;图生视频 |
| 主要输出 | 720p 高质量视频,可选音频 |
| 画面比例 | 16:9, 9:16 |
| 时长 | 8 秒 |
| 分辨率 | 720p |
| 积分显示 | 页面所示设置为 450 积分;生成前请查看实时界面 |
提示词与使用示例
Veo 3 最有效的提示词应当详细而具体。由于模型会在生成前进行提示词增强,因此,用结构清晰的初始提示词描述主体、环境、镜头表现和光照,能为增强功能提供更多依据,生成更连贯的效果。
示例 1:高保真电影感场景
输入: 文本提示词。
提示词: 黄金时刻,展现海滨村庄的全景定场镜头。镜头从俯瞰村庄的悬崖上缓缓推进,温暖的光线洒在刷白的建筑和下方平静的海面上。镜头运动平稳而从容。
适用原因: 这段提示词提供了完整的场景描述,明确交代了拍摄角度、镜头运动、光照条件和主体。模型的提示词增强功能会将其扩展为细致的场景,供 Veo 3 架构进行高保真呈现。
示例 2:产品亮相与可选音频
输入: 一张深色台面上摆放奢华腕表的首帧图像,加上文本。
提示词: 镜头缓缓推向腕表表盘,一束窄光扫过盘面,显露出指针和表壳的质感。随着光线移动,响起轻柔而纯净的音调。
适用原因: 首帧确定了产品和开场构图。提示词则指引镜头运动、光线变化和声音出现的时机。启用可选音频后,加入的声音会让产品亮相更显完整。
示例 3:创意前期制作参考
输入: 文本提示词。
提示词: 在光线昏暗的房间里,特写镜头拍摄雨滴落在窗户上的画面。镜头保持固定,一颗颗雨滴沿着玻璃滑落,留下水痕,窗外的城市灯光虚化成柔和的散景。运动持续不断,光线微妙变化。
适用原因: 这段提示词描述了具体的视觉质感和光照条件,适合借助 Veo 3 的高保真输出加以呈现。模型的自动修复功能有助于确保雨滴运动和散景效果连贯自然。
使用建议与限制
- 编写详细的提示词。模型的提示词增强功能会进一步扩展描述,因此,具体而详细的初始提示词比简短的提示词更能带来理想效果。
- 如果开场构图已经确定,请使用首帧图像。图像能为场景提供基准,减少提示词需要交代的视觉细节。
- 确认视觉概念后再启用可选音频。这样可以避免为可能需要大幅修改的早期初稿花费音频生成积分。
- 电影感场景使用 16:9,以社交平台为主的内容使用 9:16。画面比例的选择会影响模型对主体和环境的取景方式。
- 限制:时长固定为 8 秒。如果需要更长的片段,请规划生成多个片段,再在后期制作中拼接。
- 限制:分辨率固定为 720p。如果需要 1080p 或 4K 输出,可以考虑 Kling v3.0 或 Seedance 2.0。
模型对比与相关模型
YouArt 模型页面将 Veo 3 与其他视频生成选项一同展示。可以参考下表,根据输出质量、音频需求、时长和分辨率要求,选择适合当前项目的模型。
| 相关模型 | 适合改用该模型的情况 |
|---|---|
需要使用基于 Veo 架构的插帧模型,在两个指定画面之间生成平滑过渡。 | |
需要较早一代 Veo 进行对比,或作为消耗积分更少的替代方案。 | |
需要原生音视频联合生成、首尾帧控制,以及最高 4K 输出。 | |
希望选用 ByteDance 的替代模型,支持 4–15 秒时长、原生音频和 1080p 输出。 | |
希望选用 OpenAI 的替代模型,具备出色的时序一致性,时长最高可达 12 秒。 |
这款模型最适合通过文生视频或图生视频来呈现创意,尤其适用于优先考虑高保真输出、提示词增强和自动修复功能的项目。如果想更全面地了解可选模型,可以返回 YouArt 的视频模型页面,在正式投入积分制作前,对比各模型展示的输入方式、设置和示例效果。
在工作流中的应用
Veo 3 很适合用于视频制作工作流中需要高质量输出的阶段。借助提示词增强和自动修复功能,它能生成精致的视觉参考,供创意团队评审,并作为后续制作决策的依据。使用 AI 视频工作流构建器,串联从文本提示词到生成视频片段的各个环节。
对于导演和创意总监,Veo 3 可以直接融入 AI 分镜转视频工作流,其中每个生成片段都能为场景中的一个叙事节点提供高质量视觉参考。对于产品和品牌团队,模型的图生视频模式和可选音频功能,使其适合作为 AI 功能发布视频生成器 工作流的起点,满足首次评审对高质量视觉素材的需求。
创作你的下一支视频
Veo 3 为导演、创意总监、产品营销人员和设计团队提供了直接生成高质量视频的方式,并配备提示词增强、自动修复和可选音频功能。准备详细的文本提示词或首帧图像,选择画面比例,即可将最初的想法转化为精致的视觉初稿,供团队评估。